GDPevo:在真实业务任务上评测智能体自我进化

  • 论文:GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks
  • arXiv2608.03764(2026-08-04 提交,cs.AI)
  • 作者:Leijun Zhou, Zhihao Liu, Xiang Qu, Chenxu Liu, Yifei Liu, Yanke Yu, Jingzhe Xu, Xuejun Wu, Buyue Qian, Xi Chen, Yaowei Zheng, Junhao Hu(PrismShadow、New York University)
  • 开源:https://github.com/Prism-Shadow/GDPevo

一句话总结

GDPevo 是首个面向 GDP 相关企业任务(CRM/ERP/金融/医疗/法律/数据分析)的智能体自我进化基准。其核心机制 rule hybridization(规则杂交) 将企业工作流拆解为原子业务规则、散布到训练任务中、并在留出测试任务中重新组合,使测试收益可归因于训练经验;配套全自动化生成 pipeline 可在两天内将基准扩展一倍以应对数据污染。实验表明自我进化一致地提升留出准确率(最高 +16.44 pp),但最佳配置仍远低于 91.6% 的完全知情 oracle 上限——当前 agent 的自我进化能力远未充分实现。

1. 研究动机:自我进化的"评估方法论"不成熟

Agent 自我进化指 agent 根据过往经验更新其持久状态(参数状态,或 memory、skills、prompts、harness 代码等非参数状态),并在后续相关任务中复用以提升表现。作者的核心观点:在 AI 时代,一个任务一旦可以被自动化评估,就离被大规模解决不远——自我进化的"自动化"技术(持续学习、经验学习、递归自我改进等)已很多,但评估方法论严重滞后。

现有基准的三大局限

  1. 领域覆盖不足:缺少金融、法律、医疗等高经济价值领域的困难任务(如发票审计、合规检查、记录对账)。这类任务由业务特定规则支配、正确性可被确定性验证,恰好最适合研究进化。
  2. 训练-测试收益不可归因:evolution-adaptive 基准(直接切分 ALFWorld、WebShop、SWE-bench、Terminal-Bench 等既有任务集)从未对齐"可迁移能力"的概念,进化后的提升无法归因于训练经验;即便 evolution-native 基准(SkillFlow、SEA-Eval、EvoAgentBench、BenchTrace)也多从已有基准中事后挖掘关系来构造划分,关系的数量和多样性天然受限。
  3. 数据污染:两类基准都发布静态公开任务集,容易泄露进训练语料。"任何没有明确抗污染机制的 benchmark 都会迅速失效。"

GDPevo 的三大对应方案

  1. 首个面向 GDP 相关企业任务的自我进化基准,覆盖 CRM、ERP、金融、医疗、法律、数据分析六大领域;
  2. 提出 rule hybridization,从源头设计训练-测试关系,使测试收益可归因;
  3. 全自动化构建 pipeline,两天内从 V1 扩展到 V2,为数据污染提供实际可行的应对。

2. 核心机制:Rule Hybridization(规则杂交)

分三步构造训练-测试关系:

  1. 规则分解:对每个场景(对应一个任务组),将业务逻辑分解为原子规则(atomic rules)——最小且可独立检查的决策规则。这些规则被刻意设计为不存在于模型的世界知识中,而是特定企业的内部惯例(例如某公司的赞助商状态优先级、另一家公司的黑名单排除、公司特定的发票过期日期)。
  2. 规则散布:将规则子集分散到 5 个训练任务中,每个训练任务只暴露部分规则。Agent 首次尝试时因不知道这些隐藏规则大概率会失败;进化阶段通过各种监督信号让 agent 推断这些规则并记录到 skill 中。
  3. 规则重组:在 5 个测试任务中重新组合这些规则——一个测试任务可能同时调用优先级规则和黑名单规则,尽管没有任何训练任务包含这种组合。只有真正学会规则并能组合应用的 agent 才能通过测试。

效果:泛化从训练到测试变得具体,测试时的收益可归因于训练经验。

3. 全自动化数据 Pipeline(三阶段)

Pipeline 中所有 agent 使用相同的 harness 和模型(Codex + GPT-5.5),各自作为独立实例运行、拥有独立上下文。唯一的人工参与是收集启动流程的领域基准。

阶段一:种子场景发现(Seed Scenario Discovery)

输入现有领域基准(GDPval、SOP-Bench、JobBench 等),agent 提出候选场景,遵循三条标准: 1. 场景必须嵌入领域相关的隐藏规则; 2. 规则必须可测量、完整、确定,以便用确定性规则评分器检查; 3. 场景必须足够复杂以支撑长程标准操作流程(SOP),且场景间保持多样性。

示例场景"service ticket resolution":验证客户账户 → 诊断服务故障 → 执行维修 → 记录最终处置,其中蕴含"哪些账户状态有资格获得支持""哪些诊断读数算故障""哪些故障必须升级及升级到哪个团队"等企业特定规则。

阶段二:任务组生成(Task Group Generation)

Orchestrator agent 将场景转化为任务组蓝图:环境规格说明、10 个任务陈述、从样例中提取的原子规则、以及固定每个训练/测试任务暴露哪些规则的任务-规则矩阵(task–rule matrix);随后派生 1 个 environment builder(实现共享环境)和 10 个 task builder(各自根据分配的规则子集构建单个任务)。

阶段三:校准与独立评审(Calibration and Review)

  • 校准 agent 的三条硬性要求:
  • 不经训练直接做 5 个测试任务,得分应在 40–60% 左右(排除纯靠世界知识可解的或过难的任务组);
  • 先用 fewshot(当前最强监督类型)从训练任务进化后再做测试,得分须提升约 0.1–0.3
  • 进化后最终得分须低于 0.8,保留可测量的提升空间。
  • 6 个独立评审 agent 分别检查每个候选任务组,至少 5/6 投票通过才被接受,检查:输出完整性(防止 builder agent"模型懒惰"留下不完整的文件/评估器/环境)、评估格式与 rubric 多样性、无答案泄露(答案必须存放在独立文件夹)。

4. Benchmark 组成

基本单元:任务组(Task Group)

一个任务组 = 1 个共享业务环境(如病历系统、员工数据库)+ 5 个训练任务 + 5 个留出测试任务。Agent 先处理 5 个训练任务(可选地接收监督信号),更新持久状态,再解决留出测试任务;与无训练经验的同一 agent 的准确率差即为进化收益。

版本与规模

版本 任务数 任务组数 领域分布
V1 120 12 CRM ×4、ERP ×4、金融 ×4
V2 120 12 医疗 ×4、法律 ×4、数据分析 ×4
合计 240 24 6 大领域

V2 由同一 pipeline 在不到两天内生成,展示抗污染的快速再生能力。除非特别说明,论文所有实验均使用 240 任务完整基准。

24 个任务组明细

  • CRM:营销线索捕获、B2B 报价与账户响应、服务工单解决、留存与流失分析
  • ERP:财务费用控制、采购与收货控制、库存与订单履约、HR 员工生命周期
  • 金融:税务与遗产咨询、运营建模与报告、投资策略与风险、分行信用风险与放贷
  • 医疗:患者入院与转院、支付方授权与申诉、EHR 质量与数据治理、临床方案决策支持
  • 法律:白领犯罪调查审查、法院处置与财务条目、监管许可与合规、并购合同审查与谈判
  • 数据分析:数据清洗与质量流水线、SQL 分析与对账、公共卫生统计审计、工程项目组合分析

三大附加属性

  1. 确定性评分:不使用 LLM 作裁判,而是让 LLM 将每条 rubric 评分点翻译为基于代码的测试用例;每个评分点要么得满权重要么得零分,分数可复现、每个失败可追溯到被违反的规则。
  2. 成本作为一等指标:token 消耗、agent 轮次、货币成本与准确率并列报告。
  3. 诊断视图:分组拆解、雷达图、迁移热力图,可将总体收益追溯到具体领域,并检查源领域进化对目标领域的影响(并非所有迁移都是有益的)。

5. 实验设置

Agent = Harness + Model

Harness 决定工具使用、上下文管理、skill 加载与执行控制;Model 提供底层推理策略。

四个被评 agent:

Agent Harness 模型(推理档位)
1 Codex GPT-5.5 (xhigh)
2 Claude Code Opus-4.8 (xhigh)
3 Claude Code GLM-5.2 (max)
4 Claude Code DeepSeek-V4-Pro-Preview (max)

四种监督类型(Supervision Types)

进化的两个独立维度:监督类型(训练时可用什么信号)与进化方法(信号如何变成持久状态)。四种监督类型:

  1. base:无训练经验,直接做测试任务(对照组);
  2. fewshot:提供 5 个训练任务的问题、环境和黄金答案;agent 反思黄金答案的推导过程,蒸馏为可复用 skill。类比监督微调(SFT)——都是从输入-输出监督中学习,只是 fewshot 更新的是文本 skill 而非模型权重;
  3. reflect:提供训练任务的问题和环境但无黄金答案,agent 自行求解后由规则评分器返回分数作为反馈,循环 3 轮(reflect-3)类比强化学习(RL)
  4. self:仅提供训练任务的问题和环境,无任何答案相关监督,但 agent 可探索环境。类比无监督学习

进化方法

全部实验采用基于 skill 的进化方法:进化产物是一个可移植的 SKILL.md 文件,蒸馏可迁移业务规则、环境使用流程、输出惯例、常见失败模式。RQ3 中比较了 5 种 skill creator:Naive(作者自写的极简基线)、Claude Code 内置、Codex 内置、OpenCode、deepagents。注意 GDPevo 本身对持久状态形式不可知(可评估 memory、prompt、skill、harness 代码、参数等任何形式),skill-based 只是本文实验的选择。

其他设置

  • 每个测试任务运行 3 次取均值;确定性规则评分器;
  • 每次训练/测试尝试在独立 Docker 容器中执行,仅挂载白名单文件,可并行;
  • 大部分实验由另一个 agent(通常是 Codex + GPT-5.5)通过自然语言请求驱动运行。

6. 主要实验结果

RQ1:主榜单(240 任务、24 组宏观平均)

模型 + Harness 监督类型 ACC ± STD (%) 相对 base 提升 (pp) 测试成本 (USD/任务)
GPT-5.5 / Codex base 49.37 ± 5.51 1.29
fewshot 64.51 ± 6.31 +15.14 1.02
self 55.80 ± 7.63 +6.42 1.00
reflect-3 57.82 ± 7.38 +8.45 1.07
Opus-4.8 / Claude Code base 50.63 ± 5.37 1.37
fewshot 67.07 ± 6.22 +16.44 1.36
self 55.05 ± 6.96 +4.42 1.49
reflect-3 59.27 ± 7.01 +8.64 1.43
GLM-5.2 / Claude Code base 46.12 ± 5.82 0.50
fewshot 60.09 ± 7.90 +13.97 0.53
self 50.96 ± 8.32 +4.84 0.50
reflect-3 55.49 ± 8.28 +9.37 0.47
DS-V4-Pro-Preview / Claude Code base 43.58 ± 7.77 0.039
fewshot 48.79 ± 9.05 +5.21 0.040
self 46.17 ± 7.89 +2.59 0.040
reflect-3 47.15 ± 8.18 +3.57 0.037

五大发现: 1. fewshot 对所有四个 agent 都是最可靠的监督类型;任何监督形式下每个 agent 都超过其 base,提升幅度 2.59 ~ 16.44 pp。 2. 进化可替代模型训练:DeepSeek-V4-Pro fewshot(48.79%)以约 1/28 的摊销端到端成本达到 GPT-5.5 base(49.37%)的水平;GLM-5.2 fewshot 分别以 10.72 pp 和 9.46 pp 超过 GPT-5.5 base 和 Opus-4.8 base,成本仅约一半。 3. 起点弱 ≠ 进化空间大:DeepSeek base 最低(43.58%)但 fewshot 增益最小(+5.21 pp);Opus-4.8 base 最高(50.63%)增益却最大(+16.44 pp)。 4. 进化还能降低测试成本:GPT-5.5 fewshot 提升 15.14 pp 的同时测试成本降低 20.88%;摊销一次性 skill 生成成本后与 base 几乎相同。 5. 帕累托前沿由四个 fewshot agent + GLM-5.2 reflect + DeepSeek reflect 构成。

Oracle Ceiling:91.6%

用"完全知情的模型"近似人类专家上限:向 Codex + GPT-5.5 (xhigh) + 一名非专家人类操作员提供全部隐藏规则、训练问题及黄金答案,模型无需学习或推断,直接应用规则解题。覆盖全部 24 组 × 5 个测试任务 × 3 次尝试 = 360 次尝试。最佳进化配置仍远低于此上限——当前 agent 的自我进化能力远未充分实现

RQ2:跨领域迁移(3×3 源-目标矩阵:CRM/ERP/Finance)

  • 发现一:对角线(同组训练同组测试)一致为正,fewshot 下对角线是每行最大增益。
  • 发现二fewshot 行为类似 SFT,会过拟合源领域——6 个非对角格中 5 个为负,最差 -5.0 pp(Finance 训练 → ERP 测试)。
  • 发现三reflect 行为类似 RL,过拟合更温和——非对角格一半为正(最高 +6.5 pp,ERP→Finance),最差仅损失 1.0 pp;但对角线不再占优(在 CRM 上进化对 Finance 的帮助 +5.9 pp 超过对 CRM 自身 +2.6 pp)。结论:在策略反馈(on-policy feedback)产生更通用的 skill,代价是牺牲部分领域内专精。

RQ3:进化方法 vs 模型(固定 fewshot,仅换 skill creator)

进化方法 GPT-5.5 / Codex ACC (%) Δ (pp) DS-V4-Pro / Codex ACC (%) Δ (pp)
base 49.66 42.48
CC creator 62.15 +12.49 46.74 +4.26
Codex creator 62.19 +12.53 47.05 +4.57
DeepAgents creator 62.69 +13.03 47.75 +5.27
OpenCode creator 60.79 +11.13 47.84 +5.36
Naive creator 65.12 +15.46 48.01 +5.54

令人惊讶的结论:极简的 Naive creator 与复杂的现成 creator 表现相当甚至更好。Harness 可以高杠杆地引导模型进化(无需参数训练),但进化的幅度由模型自身智能决定,而非进化方法中编码的引导;过度工程化甚至有害。

附录案例研究(诊断性)

  • tg024(GPT-5.5/Codex,正向广泛迁移):skill 覆盖 35 条训练规则中的 33 条;fewshot 80.21% vs base 51.16%。fewshot 平均每次测试约 15.53 次工具调用,而 base 约 30 次——收益来自更有选择性的取证过程而非更多探索。
  • tg014(GLM-5.2/Claude Code,跨保险工作流规则重组):reflect-3 71.33% vs base 51.00%。
  • tg018(DS-V4-Pro,负迁移):fewshot 训练重放准确率达 73.88%,但留出测试仅 39.83%(base 48.36%)。skill 把局部观察当成全局策略(把某来源视为一切事实的权威、把"几个训练答案都没收费"固化为"永不收费"、把约 30 天的日期间隔当作默认截止期限),记住了动作却丢失了适用条件(scope conditions),主动将求解器引向无效决策。
  • tg016(GLM-5.2,有限迁移):许多关键临床阈值在运行时协议中已可见,训练任务暴露的隐藏规则少,进化反而有害。

7. 图表导读

  • Figure 1:GDPevo 数据构建 pipeline 全貌:三阶段(种子场景发现 → 任务组生成 → 校准与评审)。阶段 2 展示 orchestrator 生成蓝图(含任务-规则矩阵)并派生 1 个 environment builder + 10 个 task builder。以"service ticket resolution"为示例场景。
  • Figure 2:准确率-成本权衡。(a) 各配置在四种监督类型下的任务组平均准确率,绿色虚线为 91.6% oracle 上限;(b) 全部 240 任务上准确率与总评估成本散点图,展示帕累托前沿。
  • Figure 3:CRM/ERP/Finance 三领域间的跨域进化迁移热力图(3×3 源-目标矩阵):(a) 目标组 base;(b) fewshot 差值(对角为正且最大,非对角 5/6 为负,最差 -5.0 pp);(c) reflect-3 差值(非对角一半为正,最高 +6.5 pp,最差仅 -1.0 pp)。
  • Figure 4:Rubric 级诊断视图:GPT-5.5 + Codex 在 24 个任务组上 base 与 fewshot 的对比。每个有色格表示 3 次独立尝试中该二元 rubric 获得满分的次数(0/3–3/3),直接呈现单条规则的可靠性。
  • Figure 5:任务组准确率雷达图。(a) 固定 Opus-4.8 + Claude Code,比较四种监督类型(fewshot 在 24 组中 23 组超过 base;reflect 和 self 分别改善 20 和 16 组);(b) 固定 fewshot,比较四个配置(Opus-4.8 > GPT-5.5 > GLM-5.2 > DeepSeek)。
  • Table 1:5 种 skill creator 受控对比(Naive 最优)。
  • Table 2:24 个任务组的 ID、场景焦点、领域、训练/测试划分。
  • Table 3:完整排行榜(4 agent × 4 监督类型的 ACC±STD、提升、效率指标)。
  • Table 4:一次性 skill 生成开销(如 GPT-5.5 fewshot 每组 1.36 USD / 1.02M token,摊销到每个测试任务为 1/5)。
  • Table 5:四个诊断性案例研究的得分模式汇总。

8. 结论与局限

结论

  1. GDPevo 是首个在 GDP 相关任务上评估 agent 自我进化的基准,也是首个提出 rule hybridization 的工作——该机制使"从训练到测试的泛化"具体、测试收益可归因。
  2. 全自动化 pipeline 使基准能快速再生成(两天扩展一倍),为数据污染提供实际可行的应对方案。
  3. 实证结论:自我进化一致提升留出准确率(最高 +16.44 pp),fewshot 最可靠;进化可以替代模型训练(弱模型 + 进化可媲美强模型 base,成本仅 1/28);fewshot 像 SFT 一样跨域过拟合,reflect 像 RL 一样迁移更鲁棒;进化幅度主要由模型智能决定而非进化方法的精巧程度;但最佳进化 agent 仍远低于 91.6% 的完全知情上限。
  4. 作者公开了 pipeline、基准(V1+V2)和全部评估结果。

局限

  1. Oracle 上限是近似值:理想情况下应让人类领域专家掌握全部隐藏规则后解题,但缺乏覆盖所有领域的专家,只能用"完全知情的模型 + 非专家操作员"近似。
  2. 实验仅覆盖 skill-based 进化方法:基准本身对持久状态形式不可知,但本文所有实验只测试了 skill 这一种非参数形式。
  3. 校准依赖当前最优监督类型:随监督方法进步,校准标准可能需要调整。
  4. 案例研究是诊断性而非受控对比:四个案例使用不同的模型-harness 配置,不能用于模型间比较。
  5. 跨域迁移实验规模有限:RQ2 仅在三个领域各抽一组,且放弃了 self 监督类型。
  6. 评审多样性依赖 agent 判断:rubric 多样性"难以量化",交由 reviewer agent 主观判断。

9. 简评

GDPevo 的价值在于把"自我进化"从模糊的叙事变成可归因、可复现的测量问题:规则杂交给出了训练-测试关系的显式构造,确定性代码评分器避免了 LLM-as-judge 的噪声,而全自动 pipeline 本身就是"agent 构建 agent 评测"的元示范。三个实证结论尤具指导意义:(1) fewshot 蒸馏是当前性价比最高的进化路径,且可同时降低成本;(2) 弱模型配合进化可替代强模型 base,摊薄成本差距达 28 倍;(3) 进化方法的精巧程度远不如模型智能本身重要——Naive creator 反超所有现成 creator,提示社区应将精力放在提升模型的经验归纳与条件泛化能力上。其与 91.6% oracle 上限间约 24.5 pp 的鸿沟,为"如何让 agent 更有效地进化"留下了明确的研究空间。