GDPevo:在真实业务任务上评测智能体自我进化
- 论文:GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
- arXiv:2608.03764(2026-08-04 提交,cs.AI)
- 作者:Leijun Zhou, Zhihao Liu, Xiang Qu, Chenxu Liu, Yifei Liu, Yanke Yu, Jingzhe Xu, Xuejun Wu, Buyue Qian, Xi Chen, Yaowei Zheng, Junhao Hu(PrismShadow、New York University)
- 开源:https://github.com/Prism-Shadow/GDPevo
一句话总结
GDPevo 是首个面向 GDP 相关企业任务(CRM/ERP/金融/医疗/法律/数据分析)的智能体自我进化基准。其核心机制 rule hybridization(规则杂交) 将企业工作流拆解为原子业务规则、散布到训练任务中、并在留出测试任务中重新组合,使测试收益可归因于训练经验;配套全自动化生成 pipeline 可在两天内将基准扩展一倍以应对数据污染。实验表明自我进化一致地提升留出准确率(最高 +16.44 pp),但最佳配置仍远低于 91.6% 的完全知情 oracle 上限——当前 agent 的自我进化能力远未充分实现。
1. 研究动机:自我进化的"评估方法论"不成熟
Agent 自我进化指 agent 根据过往经验更新其持久状态(参数状态,或 memory、skills、prompts、harness 代码等非参数状态),并在后续相关任务中复用以提升表现。作者的核心观点:在 AI 时代,一个任务一旦可以被自动化和评估,就离被大规模解决不远——自我进化的"自动化"技术(持续学习、经验学习、递归自我改进等)已很多,但评估方法论严重滞后。
现有基准的三大局限
- 领域覆盖不足:缺少金融、法律、医疗等高经济价值领域的困难任务(如发票审计、合规检查、记录对账)。这类任务由业务特定规则支配、正确性可被确定性验证,恰好最适合研究进化。
- 训练-测试收益不可归因:evolution-adaptive 基准(直接切分 ALFWorld、WebShop、SWE-bench、Terminal-Bench 等既有任务集)从未对齐"可迁移能力"的概念,进化后的提升无法归因于训练经验;即便 evolution-native 基准(SkillFlow、SEA-Eval、EvoAgentBench、BenchTrace)也多从已有基准中事后挖掘关系来构造划分,关系的数量和多样性天然受限。
- 数据污染:两类基准都发布静态公开任务集,容易泄露进训练语料。"任何没有明确抗污染机制的 benchmark 都会迅速失效。"
GDPevo 的三大对应方案
- 首个面向 GDP 相关企业任务的自我进化基准,覆盖 CRM、ERP、金融、医疗、法律、数据分析六大领域;
- 提出 rule hybridization,从源头设计训练-测试关系,使测试收益可归因;
- 全自动化构建 pipeline,两天内从 V1 扩展到 V2,为数据污染提供实际可行的应对。
2. 核心机制:Rule Hybridization(规则杂交)
分三步构造训练-测试关系:
- 规则分解:对每个场景(对应一个任务组),将业务逻辑分解为原子规则(atomic rules)——最小且可独立检查的决策规则。这些规则被刻意设计为不存在于模型的世界知识中,而是特定企业的内部惯例(例如某公司的赞助商状态优先级、另一家公司的黑名单排除、公司特定的发票过期日期)。
- 规则散布:将规则子集分散到 5 个训练任务中,每个训练任务只暴露部分规则。Agent 首次尝试时因不知道这些隐藏规则大概率会失败;进化阶段通过各种监督信号让 agent 推断这些规则并记录到 skill 中。
- 规则重组:在 5 个测试任务中重新组合这些规则——一个测试任务可能同时调用优先级规则和黑名单规则,尽管没有任何训练任务包含这种组合。只有真正学会规则并能组合应用的 agent 才能通过测试。
效果:泛化从训练到测试变得具体,测试时的收益可归因于训练经验。
3. 全自动化数据 Pipeline(三阶段)
Pipeline 中所有 agent 使用相同的 harness 和模型(Codex + GPT-5.5),各自作为独立实例运行、拥有独立上下文。唯一的人工参与是收集启动流程的领域基准。
阶段一:种子场景发现(Seed Scenario Discovery)
输入现有领域基准(GDPval、SOP-Bench、JobBench 等),agent 提出候选场景,遵循三条标准: 1. 场景必须嵌入领域相关的隐藏规则; 2. 规则必须可测量、完整、确定,以便用确定性规则评分器检查; 3. 场景必须足够复杂以支撑长程标准操作流程(SOP),且场景间保持多样性。
示例场景"service ticket resolution":验证客户账户 → 诊断服务故障 → 执行维修 → 记录最终处置,其中蕴含"哪些账户状态有资格获得支持""哪些诊断读数算故障""哪些故障必须升级及升级到哪个团队"等企业特定规则。
阶段二:任务组生成(Task Group Generation)
Orchestrator agent 将场景转化为任务组蓝图:环境规格说明、10 个任务陈述、从样例中提取的原子规则、以及固定每个训练/测试任务暴露哪些规则的任务-规则矩阵(task–rule matrix);随后派生 1 个 environment builder(实现共享环境)和 10 个 task builder(各自根据分配的规则子集构建单个任务)。
阶段三:校准与独立评审(Calibration and Review)
- 校准 agent 的三条硬性要求:
- 不经训练直接做 5 个测试任务,得分应在 40–60% 左右(排除纯靠世界知识可解的或过难的任务组);
- 先用 fewshot(当前最强监督类型)从训练任务进化后再做测试,得分须提升约 0.1–0.3;
- 进化后最终得分须低于 0.8,保留可测量的提升空间。
- 6 个独立评审 agent 分别检查每个候选任务组,至少 5/6 投票通过才被接受,检查:输出完整性(防止 builder agent"模型懒惰"留下不完整的文件/评估器/环境)、评估格式与 rubric 多样性、无答案泄露(答案必须存放在独立文件夹)。
4. Benchmark 组成
基本单元:任务组(Task Group)
一个任务组 = 1 个共享业务环境(如病历系统、员工数据库)+ 5 个训练任务 + 5 个留出测试任务。Agent 先处理 5 个训练任务(可选地接收监督信号),更新持久状态,再解决留出测试任务;与无训练经验的同一 agent 的准确率差即为进化收益。
版本与规模
| 版本 | 任务数 | 任务组数 | 领域分布 |
|---|---|---|---|
| V1 | 120 | 12 | CRM ×4、ERP ×4、金融 ×4 |
| V2 | 120 | 12 | 医疗 ×4、法律 ×4、数据分析 ×4 |
| 合计 | 240 | 24 | 6 大领域 |
V2 由同一 pipeline 在不到两天内生成,展示抗污染的快速再生能力。除非特别说明,论文所有实验均使用 240 任务完整基准。
24 个任务组明细
- CRM:营销线索捕获、B2B 报价与账户响应、服务工单解决、留存与流失分析
- ERP:财务费用控制、采购与收货控制、库存与订单履约、HR 员工生命周期
- 金融:税务与遗产咨询、运营建模与报告、投资策略与风险、分行信用风险与放贷
- 医疗:患者入院与转院、支付方授权与申诉、EHR 质量与数据治理、临床方案决策支持
- 法律:白领犯罪调查审查、法院处置与财务条目、监管许可与合规、并购合同审查与谈判
- 数据分析:数据清洗与质量流水线、SQL 分析与对账、公共卫生统计审计、工程项目组合分析
三大附加属性
- 确定性评分:不使用 LLM 作裁判,而是让 LLM 将每条 rubric 评分点翻译为基于代码的测试用例;每个评分点要么得满权重要么得零分,分数可复现、每个失败可追溯到被违反的规则。
- 成本作为一等指标:token 消耗、agent 轮次、货币成本与准确率并列报告。
- 诊断视图:分组拆解、雷达图、迁移热力图,可将总体收益追溯到具体领域,并检查源领域进化对目标领域的影响(并非所有迁移都是有益的)。
5. 实验设置
Agent = Harness + Model
Harness 决定工具使用、上下文管理、skill 加载与执行控制;Model 提供底层推理策略。
四个被评 agent:
| Agent | Harness | 模型(推理档位) |
|---|---|---|
| 1 | Codex | GPT-5.5 (xhigh) |
| 2 | Claude Code | Opus-4.8 (xhigh) |
| 3 | Claude Code | GLM-5.2 (max) |
| 4 | Claude Code | DeepSeek-V4-Pro-Preview (max) |
四种监督类型(Supervision Types)
进化的两个独立维度:监督类型(训练时可用什么信号)与进化方法(信号如何变成持久状态)。四种监督类型:
- base:无训练经验,直接做测试任务(对照组);
- fewshot:提供 5 个训练任务的问题、环境和黄金答案;agent 反思黄金答案的推导过程,蒸馏为可复用 skill。类比监督微调(SFT)——都是从输入-输出监督中学习,只是 fewshot 更新的是文本 skill 而非模型权重;
- reflect:提供训练任务的问题和环境但无黄金答案,agent 自行求解后由规则评分器返回分数作为反馈,循环 3 轮(reflect-3)。类比强化学习(RL);
- self:仅提供训练任务的问题和环境,无任何答案相关监督,但 agent 可探索环境。类比无监督学习。
进化方法
全部实验采用基于 skill 的进化方法:进化产物是一个可移植的 SKILL.md 文件,蒸馏可迁移业务规则、环境使用流程、输出惯例、常见失败模式。RQ3 中比较了 5 种 skill creator:Naive(作者自写的极简基线)、Claude Code 内置、Codex 内置、OpenCode、deepagents。注意 GDPevo 本身对持久状态形式不可知(可评估 memory、prompt、skill、harness 代码、参数等任何形式),skill-based 只是本文实验的选择。
其他设置
- 每个测试任务运行 3 次取均值;确定性规则评分器;
- 每次训练/测试尝试在独立 Docker 容器中执行,仅挂载白名单文件,可并行;
- 大部分实验由另一个 agent(通常是 Codex + GPT-5.5)通过自然语言请求驱动运行。
6. 主要实验结果
RQ1:主榜单(240 任务、24 组宏观平均)
| 模型 + Harness | 监督类型 | ACC ± STD (%) | 相对 base 提升 (pp) | 测试成本 (USD/任务) |
|---|---|---|---|---|
| GPT-5.5 / Codex | base | 49.37 ± 5.51 | – | 1.29 |
| fewshot | 64.51 ± 6.31 | +15.14 | 1.02 | |
| self | 55.80 ± 7.63 | +6.42 | 1.00 | |
| reflect-3 | 57.82 ± 7.38 | +8.45 | 1.07 | |
| Opus-4.8 / Claude Code | base | 50.63 ± 5.37 | – | 1.37 |
| fewshot | 67.07 ± 6.22 | +16.44 | 1.36 | |
| self | 55.05 ± 6.96 | +4.42 | 1.49 | |
| reflect-3 | 59.27 ± 7.01 | +8.64 | 1.43 | |
| GLM-5.2 / Claude Code | base | 46.12 ± 5.82 | – | 0.50 |
| fewshot | 60.09 ± 7.90 | +13.97 | 0.53 | |
| self | 50.96 ± 8.32 | +4.84 | 0.50 | |
| reflect-3 | 55.49 ± 8.28 | +9.37 | 0.47 | |
| DS-V4-Pro-Preview / Claude Code | base | 43.58 ± 7.77 | – | 0.039 |
| fewshot | 48.79 ± 9.05 | +5.21 | 0.040 | |
| self | 46.17 ± 7.89 | +2.59 | 0.040 | |
| reflect-3 | 47.15 ± 8.18 | +3.57 | 0.037 |
五大发现: 1. fewshot 对所有四个 agent 都是最可靠的监督类型;任何监督形式下每个 agent 都超过其 base,提升幅度 2.59 ~ 16.44 pp。 2. 进化可替代模型训练:DeepSeek-V4-Pro fewshot(48.79%)以约 1/28 的摊销端到端成本达到 GPT-5.5 base(49.37%)的水平;GLM-5.2 fewshot 分别以 10.72 pp 和 9.46 pp 超过 GPT-5.5 base 和 Opus-4.8 base,成本仅约一半。 3. 起点弱 ≠ 进化空间大:DeepSeek base 最低(43.58%)但 fewshot 增益最小(+5.21 pp);Opus-4.8 base 最高(50.63%)增益却最大(+16.44 pp)。 4. 进化还能降低测试成本:GPT-5.5 fewshot 提升 15.14 pp 的同时测试成本降低 20.88%;摊销一次性 skill 生成成本后与 base 几乎相同。 5. 帕累托前沿由四个 fewshot agent + GLM-5.2 reflect + DeepSeek reflect 构成。
Oracle Ceiling:91.6%
用"完全知情的模型"近似人类专家上限:向 Codex + GPT-5.5 (xhigh) + 一名非专家人类操作员提供全部隐藏规则、训练问题及黄金答案,模型无需学习或推断,直接应用规则解题。覆盖全部 24 组 × 5 个测试任务 × 3 次尝试 = 360 次尝试。最佳进化配置仍远低于此上限——当前 agent 的自我进化能力远未充分实现。
RQ2:跨领域迁移(3×3 源-目标矩阵:CRM/ERP/Finance)
- 发现一:对角线(同组训练同组测试)一致为正,fewshot 下对角线是每行最大增益。
- 发现二:fewshot 行为类似 SFT,会过拟合源领域——6 个非对角格中 5 个为负,最差 -5.0 pp(Finance 训练 → ERP 测试)。
- 发现三:reflect 行为类似 RL,过拟合更温和——非对角格一半为正(最高 +6.5 pp,ERP→Finance),最差仅损失 1.0 pp;但对角线不再占优(在 CRM 上进化对 Finance 的帮助 +5.9 pp 超过对 CRM 自身 +2.6 pp)。结论:在策略反馈(on-policy feedback)产生更通用的 skill,代价是牺牲部分领域内专精。
RQ3:进化方法 vs 模型(固定 fewshot,仅换 skill creator)
| 进化方法 | GPT-5.5 / Codex ACC (%) | Δ (pp) | DS-V4-Pro / Codex ACC (%) | Δ (pp) |
|---|---|---|---|---|
| base | 49.66 | – | 42.48 | – |
| CC creator | 62.15 | +12.49 | 46.74 | +4.26 |
| Codex creator | 62.19 | +12.53 | 47.05 | +4.57 |
| DeepAgents creator | 62.69 | +13.03 | 47.75 | +5.27 |
| OpenCode creator | 60.79 | +11.13 | 47.84 | +5.36 |
| Naive creator | 65.12 | +15.46 | 48.01 | +5.54 |
令人惊讶的结论:极简的 Naive creator 与复杂的现成 creator 表现相当甚至更好。Harness 可以高杠杆地引导模型进化(无需参数训练),但进化的幅度由模型自身智能决定,而非进化方法中编码的引导;过度工程化甚至有害。
附录案例研究(诊断性)
- tg024(GPT-5.5/Codex,正向广泛迁移):skill 覆盖 35 条训练规则中的 33 条;fewshot 80.21% vs base 51.16%。fewshot 平均每次测试约 15.53 次工具调用,而 base 约 30 次——收益来自更有选择性的取证过程而非更多探索。
- tg014(GLM-5.2/Claude Code,跨保险工作流规则重组):reflect-3 71.33% vs base 51.00%。
- tg018(DS-V4-Pro,负迁移):fewshot 训练重放准确率达 73.88%,但留出测试仅 39.83%(base 48.36%)。skill 把局部观察当成全局策略(把某来源视为一切事实的权威、把"几个训练答案都没收费"固化为"永不收费"、把约 30 天的日期间隔当作默认截止期限),记住了动作却丢失了适用条件(scope conditions),主动将求解器引向无效决策。
- tg016(GLM-5.2,有限迁移):许多关键临床阈值在运行时协议中已可见,训练任务暴露的隐藏规则少,进化反而有害。
7. 图表导读
- Figure 1:GDPevo 数据构建 pipeline 全貌:三阶段(种子场景发现 → 任务组生成 → 校准与评审)。阶段 2 展示 orchestrator 生成蓝图(含任务-规则矩阵)并派生 1 个 environment builder + 10 个 task builder。以"service ticket resolution"为示例场景。
- Figure 2:准确率-成本权衡。(a) 各配置在四种监督类型下的任务组平均准确率,绿色虚线为 91.6% oracle 上限;(b) 全部 240 任务上准确率与总评估成本散点图,展示帕累托前沿。
- Figure 3:CRM/ERP/Finance 三领域间的跨域进化迁移热力图(3×3 源-目标矩阵):(a) 目标组 base;(b) fewshot 差值(对角为正且最大,非对角 5/6 为负,最差 -5.0 pp);(c) reflect-3 差值(非对角一半为正,最高 +6.5 pp,最差仅 -1.0 pp)。
- Figure 4:Rubric 级诊断视图:GPT-5.5 + Codex 在 24 个任务组上 base 与 fewshot 的对比。每个有色格表示 3 次独立尝试中该二元 rubric 获得满分的次数(0/3–3/3),直接呈现单条规则的可靠性。
- Figure 5:任务组准确率雷达图。(a) 固定 Opus-4.8 + Claude Code,比较四种监督类型(fewshot 在 24 组中 23 组超过 base;reflect 和 self 分别改善 20 和 16 组);(b) 固定 fewshot,比较四个配置(Opus-4.8 > GPT-5.5 > GLM-5.2 > DeepSeek)。
- Table 1:5 种 skill creator 受控对比(Naive 最优)。
- Table 2:24 个任务组的 ID、场景焦点、领域、训练/测试划分。
- Table 3:完整排行榜(4 agent × 4 监督类型的 ACC±STD、提升、效率指标)。
- Table 4:一次性 skill 生成开销(如 GPT-5.5 fewshot 每组 1.36 USD / 1.02M token,摊销到每个测试任务为 1/5)。
- Table 5:四个诊断性案例研究的得分模式汇总。
8. 结论与局限
结论
- GDPevo 是首个在 GDP 相关任务上评估 agent 自我进化的基准,也是首个提出 rule hybridization 的工作——该机制使"从训练到测试的泛化"具体、测试收益可归因。
- 全自动化 pipeline 使基准能快速再生成(两天扩展一倍),为数据污染提供实际可行的应对方案。
- 实证结论:自我进化一致提升留出准确率(最高 +16.44 pp),fewshot 最可靠;进化可以替代模型训练(弱模型 + 进化可媲美强模型 base,成本仅 1/28);fewshot 像 SFT 一样跨域过拟合,reflect 像 RL 一样迁移更鲁棒;进化幅度主要由模型智能决定而非进化方法的精巧程度;但最佳进化 agent 仍远低于 91.6% 的完全知情上限。
- 作者公开了 pipeline、基准(V1+V2)和全部评估结果。
局限
- Oracle 上限是近似值:理想情况下应让人类领域专家掌握全部隐藏规则后解题,但缺乏覆盖所有领域的专家,只能用"完全知情的模型 + 非专家操作员"近似。
- 实验仅覆盖 skill-based 进化方法:基准本身对持久状态形式不可知,但本文所有实验只测试了 skill 这一种非参数形式。
- 校准依赖当前最优监督类型:随监督方法进步,校准标准可能需要调整。
- 案例研究是诊断性而非受控对比:四个案例使用不同的模型-harness 配置,不能用于模型间比较。
- 跨域迁移实验规模有限:RQ2 仅在三个领域各抽一组,且放弃了 self 监督类型。
- 评审多样性依赖 agent 判断:rubric 多样性"难以量化",交由 reviewer agent 主观判断。
9. 简评
GDPevo 的价值在于把"自我进化"从模糊的叙事变成可归因、可复现的测量问题:规则杂交给出了训练-测试关系的显式构造,确定性代码评分器避免了 LLM-as-judge 的噪声,而全自动 pipeline 本身就是"agent 构建 agent 评测"的元示范。三个实证结论尤具指导意义:(1) fewshot 蒸馏是当前性价比最高的进化路径,且可同时降低成本;(2) 弱模型配合进化可替代强模型 base,摊薄成本差距达 28 倍;(3) 进化方法的精巧程度远不如模型智能本身重要——Naive creator 反超所有现成 creator,提示社区应将精力放在提升模型的经验归纳与条件泛化能力上。其与 91.6% oracle 上限间约 24.5 pp 的鸿沟,为"如何让 agent 更有效地进化"留下了明确的研究空间。