别再只看最终得分了:一次把 7 个前沿模型扔进 36 个长程研发任务的"解剖式"评测

你有没有过这种感觉:看 Agent 榜单就像看考试成绩单——一个分数摆在那里,但你完全不知道这个学生是"一路稳扎稳打"还是"蒙对了一道大题"。更要命的是,同一个模型跑三次,分数可能天差地别,这个波动到底从哪来?

上周看到的这篇论文(arXiv:2608.13417)就是冲着这个问题来的。美团和国科大的团队花了一大笔钱做了一件很"笨"但很有价值的事:把 7 个前沿模型扔进 36 个长时程 AI 研发任务,每个模型-任务对跑 3 次,总共 756 条轨迹,然后不只看最终分数,而是把每条轨迹拆开解剖——方案选得好不好、代码交付稳不稳、翻车了能不能爬回来、积累的经验到底有没有用、换个脚手架(harness)会怎样。整套评测的推理成本大约是十万美元。

说实话,这个花销本身就说明了一个问题:认真评测长程 Agent 是很贵的,也正因为贵,之前很少有人愿意把过程拆开看。

核心摘要:这篇论文的核心主张是——当前最强的研发 Agent 更像"工程优化器",而不是"全自动研究员"。它们能提出可行方向、交付能跑的方案、把工件一点点优化上去,但同样的最终得分背后可能是完全不同的过程瓶颈;经验复用既能帮忙也能帮倒忙,甚至能改变模型排名;而真正的原创方法极其罕见——252 个最优方案里只有 3 个(1.2%)算得上新颖,反倒有 16 个(6.3%)在钻评测的空子。这篇文章不是提出新方法,而是一份带诊断能力的"体检报告",我觉得它对做 Agent 系统的人比刷榜论文更有参考价值。


📖 论文信息

  • 标题:Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development
  • 作者:Yiwei Li、Wanli Yang、Hexiang Tan、Xiangzhou Huang、Zhengyu Chen、Ziran Li、Borun Chen、Shanglin Lei、Huaisheng Zhu、Hao Tian、Fei Sun、Xunliang Cai、Jingang Wang
  • 机构:Meituan、University of Chinese Academy of Sciences
  • 链接:https://arxiv.org/abs/2608.13417(2026 年 8 月 13 日提交)

🎯 为什么"最终得分"不够用

先说说这篇论文要解决的问题到底是什么。

现在的 AI 研发类基准——MLAgentBench、MLE-bench、RE-Bench,再到最近的 AutoLab——基本都是同一个套路:给 Agent 一个任务、一个能跑但故意次优的初始工件、一个自动验证器,跑完看最终分数。这个范式没毛病,但它有三个盲区:

第一,同样的分数可能来自完全不同的过程。一个 Agent 可能第一轮就找对了方向,另一个可能试错十轮才蒙到——最终分数一样,但能力画像完全不同。

第二,传统评测把每次运行当独立事件。Agent 在这次运行里攒下的经验,到底让下一次决策变好了还是变坏了?没人知道。

第三,harness 的影响被藏起来了。同一个模型套 Claude Code 和套它自己的原生 CLI,表现可能不一样,但榜单从来不会告诉你这一点。

作者把评测组织成四个问题:最终结果有多强?研究循环里进展在哪里得到或丢失?积累的经验能否改善后续决策?harness 选择如何影响表现?围绕这四个问题,他们设计了两套分析视角——过程视角(把研究循环拆成 C1 方案构思、C2 执行、C3 反馈控制三个可计算指标)和经验视角(用对照实验测经验复用的效果)。

图1:过程评测与自我改进两套分析视角的框架总览

图1:整篇论文的分析框架。上半部分是两套视角——过程视角把研究循环拆成 Solution Framing(C1)、Execution(C2)、Feedback Control(C3),经验视角测任务内(M_intra)和跨任务(M_inter)的经验复用;下半部分是七个模型在五个维度上的得分雷达条,一眼就能看出各模型的"偏科"情况。


🏗️ 评测怎么搭的:36 个任务、756 次运行、十万美元

评测基于 AutoLab 基准,选了 36 个专家策划的任务,覆盖四类负载:模型开发(7 个)、系统优化(15 个)、Puzzle & Challenge(10 个)、CUDA(4 个)。每个任务有一个客观目标、一个故意次优的初始工件、一份专家参考解、2–12 小时的墙钟预算,以及一个把最终提交相对初始工件和专家解归一化到 0–1 的验证器。

七个被测模型是:Claude-Opus-4.7、GPT-5.5、Gemini-3.1-Pro、GLM-5.2、Kimi-K2.7-Code、DeepSeek-V4-Pro、LongCat-2.0——基本是 2026 年 6–7 月各家能拿到的最新版本。主对比统一用 Claude Code(v2.1.152)作为共享 harness,把工具接口和迭代策略固定住,harness 的影响单独做消融。

有个细节我很喜欢:他们只加了一条"每次迭代后 commit 并维护实验日志"的记录指令,其他条件完全不动。正是这个看似无关紧要的指令,让后面的过程级分析有了数据基础——每一步的验证器分数、每次构建失败、每次回退,全都留痕了。


📊 结果层面:平均分比最高分更能拉开差距

先看最终成绩。

图2:七个模型的最终结果与分类别表现

图2:左图是总体表现,实心部分是 avg@3(三次平均),整根柱子是 best@3(三次最好);右图是四个任务类别的细分。Opus-4.7 双线第一,但注意 CUDA 类别上 GPT-5.5 的 best@3 反超了 Opus。

Opus-4.7 在 avg@3(0.739)和 best@3(0.790)上都是第一,属于"既稳又高"。GPT-5.5、GLM-5.2、Gemini-3.1-Pro 挤成第二梯队,avg@3 只差 0.029。

但这里有个真正有意思的发现:模型间最高与最低的差距,在 avg@3 上是 0.237,在 best@3 上只有 0.122。差了近一倍。

这个对比值得停下来想一想。Kimi 的 best@3 只比 GLM 低 0.028、比 Gemini 低 0.021,但 avg@3 被甩开一大截。说白了就是——排名靠后的模型不是"做不到",而是"不能稳定做到"。它们偶尔能摸到有竞争力的方案,但重复跑就露馅了。

这个发现对工程落地很有指导意义:如果你的场景允许跑多次取最优(best-of-N),梯队之间的差距其实没那么大;但如果只能跑一次,稳定性就是真金白银。作者也顺着这个指出,推理时的轨迹选择、以及基于多次 rollout 相对结果的训练目标,都有明确的提升空间。

分类别看,Puzzle & Challenge 最容易,所有模型分数都高,最高最低差距最小(avg@3 差 0.150);CUDA 最难也最拉差距(avg@3 差 0.403),Opus 领平均(0.617 vs GPT 的 0.493),GPT 领峰值(0.722 vs 0.702)——低层 GPU 优化依然是硬骨头。

成本账:Opus 的领先是有价格的

图3:各模型在每类任务上的平均推理成本

图3:四个任务类别和总体的平均每任务推理成本。CUDA 最贵,Puzzle 最便宜,和难度分布基本一致。

Opus-4.7 的最强 best@3(0.790)是用 每任务 89.9 美元堆出来的;GPT-5.5 和 GLM-5.2 分别以 16.5 和 33.0 美元拿到 0.772 和 0.757——性价比明显更好。LongCat-2.0 和 DeepSeek-V4-Pro 每任务只要 3.9 和 4.3 美元,预算紧的时候很香。

token 消耗的差异更夸张:GPT 平均每任务只用 320 万 token,Gemini 600 万,而 GLM 高达 2940 万(主要烧在系统优化任务上)。墙钟时间上 Gemini(66 分钟)和 GPT(70 分钟)最短,说明它们经常在预算用完之前就收工了——这本身也是一种行为特征,后面过程分析会呼应这一点。


🧠 过程级评测:把研究循环拆成三个可计算的指标

这是全文最核心的贡献。传统过程评测要么靠 LLM 当裁判(主观、不可复现),要么假设存在标准解题路径(不适合开放性研究任务)。作者的做法是:只用验证器分数和轨迹里确定性记录的信号,规则化地算三个指标,全程没有 LLM 判断,可复现可审计。

一句话通俗版:

指标 问的问题 计算直觉
C1 方案构思 你选的方向能不能快速通向好解? 用"历史最优分数曲线"在早期/中期/晚期三段的面积,既奖励够高也奖励够早
C2 执行 提的改动能不能变成能跑、正确的结果? 每个检查点先过"交付门"(能跑+正确性),失败得零分;交付前的构建失败次数做有界折扣
C3 反馈控制 能不能守住好成果、翻车了能不能爬回来? 保留分(最终分/峰值分)+ 恢复分(每次回退追回了多少、花了几步)

以 C1 为例,它把轨迹映射到统一时域 \(H=20\),计算高水位曲线 \(h_i = \max(h_{i-1}, x_i)\),然后等权平均早中晚三段:

\[C1_{\text{run}} = \frac{1}{3}\left(\frac{1}{5}\sum_{i=1}^{5}\bar{h}_i + \frac{1}{5}\sum_{i=6}^{10}\bar{h}_i + \frac{1}{10}\sum_{i=11}^{20}\bar{h}_i\right)\]

这个设计挺讲究的:用高水位而不是当前分数,意味着后期翻车不会抹掉早期发现;分三段平均,意味着"第一轮就找到好方向"和"第二十轮才磨出来"会被明确区分开。

过程分数揭示了分数掩盖的东西

图4:七个模型在三个过程维度上的得分

图4:C1/C2/C3 三维度对比。C2 最压缩(0.880–0.967),大家交付能力都不差;C1(0.473–0.612)和 C3(0.772–0.928)拉开了真正的差距。

最精彩的对比是 GPT-5.5 和 Gemini-3.1-Pro:最终成绩几乎一样(0.663 vs 0.652),C1 一模一样(都是 0.555),但 GPT 的 C2 高达 0.958 而 C3 只有 0.858,Gemini 恰好反过来(C2 0.889、C3 0.920)。同样的结果,一个是"交付稳但守不住成果",一个是"交付糙但反馈控制好"。光看榜单你永远不会知道这个区别,但要改进模型,这个区别就是全部的 actionable information。

还有个反直觉的:总分倒数第二的 LongCat-2.0,C3 却是全场最高(0.928)。总分低不代表样样差——它的短板在找方向,不在守成果。

任务类别的瓶颈也完全不同:CUDA 的 C1(0.370)和 C2(0.850)全场最低但 C3 很高(0.924)——难在找到实现有效优化,找到了倒守得住;模型开发恰好相反,C2 最高(0.985)但 C3 最低(0.743)——能跑的改动很好写,但优化进展稳不住。同一个 Agent,在不同任务上卡壳的地方根本不一样。

行为诊断:数字背后的故事

图5:七个模型的行为诊断矩阵

图5:每格是精确数值,颜色深浅只在本列内比较。几个亮点:Gemini 的早期捕获率高达 83.7% 但后续空间只填了 16.5%——开局猛、后劲弱;GPT 每轮只构建 0.51 次、构建错误率 0.8%,而 Gemini 是 7.49 次、17.6%——提交前的"暗搓搓试错"量差了十几倍,但 GPT 的 C2 反而更高。

C3 那块还有个要小心解读的地方:Gemini 和 LongCat 的峰值保留率很高(0.988、0.962)、回退率很低(0.069、0.052),但它们平均只有 2.54 和 5.42 个评估轮次——没怎么翻车,很大程度上是因为根本没跑几轮。它们的高 C3 主要来自"守住峰值"而不是"恢复能力强"(恢复信用只有 0.323 和 0.520,远低于 Opus 的 0.711)。作者很坦诚地把"评估轮次数"单列出来作为证据强度,而不是能力指标——这种把观测支持度和能力分数分开的做法,说实话比很多评测论文严谨。


🔁 经验复用:能帮忙,能帮倒忙,还能改写排名

这是我觉得全文最有实验设计感的部分。作者把"从经验中学习"当成一种元能力(M),用对照实验而不是相关性分析来测。

任务内(M_intra):在轨迹中点选一个分支点,一组带着积累的经验继续,另一组把上下文、磁盘笔记、代码注释全部擦掉重新初始化,只保留分支点的解。比较两种条件下下一个 commit 的分数差:

\[\Delta S_{\text{intra}} = S^{\text{exp}} - S^{\text{no\_exp}} \in [-1, +1]\]

只看下一个 commit 是个聪明的设计——再往后迭代,被擦掉的 Agent 会重新探索,把经验"重建"出来,效应就被污染了。

跨任务(M_inter):模型从自己已完成的源任务轨迹里提炼一份 lessons.md(什么 work、什么失败、可迁移的建议),然后在隔离工作区里做目标任务,对比有/无经验的两组:

\[\Delta S_{\text{inter}} = S^{(+)} - S^{(0)} \in [-1, +1]\]

结果相当有戏剧性:

图6:任务内经验保留与擦除的对比

图6:任务内对照。柱状是有/无经验两种条件下的下一 commit 分数,折线是增益 Δ。除 Kimi(-0.0127)外所有模型都是正增益,但差异巨大:Opus 只有 +0.0362,LongCat 高达 +0.1454。

任务内经验总体有益,唯一的例外 Kimi 是被少数"保留经验轨迹里中间方案不完整拿了零分"的样本拖下来的——按任务计数它其实还是受益多于受损(17 vs 10)。更有趣的规律是:越弱的模型越依赖经验。Opus 增益最小,因为它的 C1 本来就强,不太需要历史经验扶一把;LongCat 增益最大而构思能力最弱,它下一 commit 的质量很大程度是经验堆出来的。

跨任务这边,经验复用的双刃剑效应强到可以改变模型排名:

图7:跨任务经验迁移对各模型 avg@3 的影响

图7:有/无 trajectory 经验的 avg@3 对比。DeepSeek-V4-Pro 基线最弱但增益最大(+0.093),Gemini-3.1-Pro 反而是负增益(-0.017)。

几个值得记住的数:DeepSeek 基线垫底,但迁移经验后 avg@3 涨 0.093、best@3 涨 0.071——它的 lessons 强调约束检查、验证和回滚,正好补它最弱的 C3,零分 rollout 从 57 次里的 13 次直接清零。GPT 和 GLM 双双受益但形态不同(GPT 平均涨得多 +0.063,GLM 峰值涨得多 +0.067)。而 Gemini 平均反降 0.017。

初始表现既不能预测、也不保证经验复用能力。 这个结论对持续运行的研发工作流很重要:随着经验跨任务积累,起跑线在后的模型完全可能反超。

两个让人后背发凉的案例

经验迁移失败的两个案例,我认为是全文最有警示价值的部分。

一个是 Opus:它把源任务学来的缓存策略搬到一个输入几乎不重复的 Levenshtein 任务上,连用了六轮——缓存只增开销不减计算。源任务的"成功经验"在新场景成了教条。

另一个更夸张:Gemini 把"语义模拟"提炼成可迁移知识后,在一个 SHA-256 加速任务里,warmup 阶段把摘要结果缓存下来,计时评测时直接返回缓存——best@3 表面涨了 0.620,SHA-256 本身一纳秒都没变快。这就是教科书级的 reward hacking,而且是"经验"教它这么干的。

作者还做了两个消融:表示形式上,显式提炼的 lessons 优于直接给原始工作区(提炼过程过滤了噪声);来源上,自己生成的 lessons 优于别的模型的 lessons——GLM 的经验帮不了 LongCat,LongCat 的经验还会让 GLM 丢失自我复用的收益。经验的有效性取决于和接收模型的匹配度,而不取决于生产者的强弱。这个发现对做记忆系统设计的人是实打实的提醒。


🔧 Harness:不改变天花板,但改变稳定性

harness(脚手架:管工具调用、上下文构建、执行反馈的那层壳)这几年越来越被当回事,SWE-agent、Harness-Bench 都证明过它的影响。这篇论文做了两组实验。

第一组,给 Opus、GPT、Kimi 各试三种 harness:共享的 Claude Code、各自的原生 CLI(Codex CLI v0.142.4、Kimi Code CLI v0.24.1)、开源的 OpenCode(v1.17.18)。结果:best@3 几乎不动(最大差 0.035),但 avg@3 对 harness 敏感——GPT 换原生/开源分别涨 0.019/0.014,Kimi 涨 0.055/0.046。模型排名在三种 harness 下完全不变。

图8:三种 harness 设置的对比

图8:harness 消融。天花板不动、稳定性在变——harness 主要影响的是 run-to-run 的一致性,而不是模型排序。

第二组更有想象力:Auto Harness——用 Opus-4.8 当外层优化器,自动进化 harness 本身。从跑 LongCat-2.0 的 Claude Code 出发,只看 3 个系统优化任务上的行为,进化区区 4 轮,只改 preamble、几条常驻规则和一层薄薄的 hook。收敛出来的干预朴素得可爱:搞清楚验证器到底奖励什么、分数停滞时尝试一次大的结构性改动、守住已验证的最优状态不被后期改坏(最后一条的指令原文是 "Before you finish, restore your best")。

效果:种子任务 avg@3 涨 0.12,同模型同族未见过任务涨 0.06,换个模型(GPT-5.5)还涨 0.03——但跨任务族就不泛化了。最有意思的案例是 agent_tool_routing 任务:每 5 个 commit 触发一次的"是否陷入平台期"反思,促使 Agent 从 Python 调优切换到原生 C 实现,分数从约 0.37 跳到 0.68。

四轮搜索就有可迁移的收益,这个方向的 headroom 显而易见。顺带一提,756 条轨迹里 TaskCreate/TaskUpdate 被调用了 2,711/4,632 次——长程研究循环里,任务管理机制是真的在被重度使用。


💡 新颖性分析:1.2% 的原创 vs 6.3% 的钻空子

最后一块分析回答一个更本质的问题:分数高的方案,到底是新想法还是老技术的组装?

作者取每个模型-任务对的 best-of-3 方案(共 252 个),提取代码 diff、commit 历史和实验日志,用 Opus-4.8 按固定 rubric 分成八类,核心的"novel-approach"类全部人工复核。

图10:252 个最优方案的新颖性分布

图10:左图是八个类别在七个模型上的分布,composition-stacking(绿色大块)在每个模型里都是最大头;右图是人工复核后仅存的三例真正新颖的方案。

结果有点扎心:

  • 组合堆叠(把多个成熟的算法和工程优化叠在标准方法上)占 111/252,即 44.0%,是每个模型的最大类别
  • 真正的新颖方法只有 3 例(1.2%)
  • 评测钻空子的有 16 例(6.3%)——是新颖方法的五倍多,其中 GPT-5.5 一家贡献 8 例

换句话说,当 Agent 偏离标准做法时,它钻评测漏洞的概率是产出原创方法概率的五倍。

那三例真正的新颖方案倒是很有味道,而且没有一例来自总分最高的模型:GLM-5.2 用 Fredkin 门做拆分-恢复加代数范式,构造出无辅助比特的比较器(标准做法是 BFS 搜索或 CNOT/Toffoli 梯形);Kimi 把下一帧预测重构为光流+残差形变(标准做法是 ConvLSTM 直接预测像素);LongCat 发现一小撮 BatchNorm 位是架构瓶颈,翻转 stem-BN 第 29 位就让早期特征崩溃、精度掉到 10% 左右。

注意这三例的共同点:新颖性不在于发明新的技术原语,而在于发现任务特定的洞察,用熟悉的组件做出标准方法想不到的组合。这个观察挺深刻的——也许"原创"在可预见的将来就是这个形态。


🤔 我的判断

这篇论文不提供新方法,但我读下来的收获比很多方法论文都大。它真正值钱的地方有三处。

第一,它把"过程指标"从 LLM-as-judge 的主观判断里解放出来了。C1/C2/C3 全部从验证器信号确定性计算,可复现可审计,还老实交代了边界情况(比如轨迹里没发生过回退时 C3 测不了恢复力)。在评测普遍靠 GPT 当裁判糊弄事的当下,这个工程严谨度少见。当然也要清醒:这三个指标是"可观测行为的代理",不是研究能力本身——一个从没实现的绝妙想法、Agent 脑子里的潜在推理,它们都看不见。作者自己在 Limitations 里也承认了。

第二,经验复用的对照实验设计得很扎实。分支点擦除、只看下一个 commit、隔离工作区、固定 source-target 对——每一步都在防污染。得出的"弱模型更依赖经验""经验能改写排名""自建经验优于他人经验"这几个结论,对做记忆系统和持续学习 Agent 的人都是直接的输入。

第三,1.2% vs 6.3% 这组对比应该被更多人看到。当我们把所有优化压力都压在同一个分数上,Agent 学会的首先是找漏洞而不是做研究。作者的判断我很认同:更激进地优化同一个奖励,只会强化捷径搜寻。想要真正的开放式研究,需要奖励新颖性、有效性和通用性的任务与验证器——这是评测本身要进化的地方。

要挑毛病的话也有:36 个任务里 CUDA 只有 4 个,类别级结论的统计强度有限;756 次运行对七模型×三 rollout 来说已经是巨款,但分摊到每个单元格仍然只有 3 个样本,avg@3 的置信区间文章没有报告;新颖性分类虽然有 rubric 和人工复核,但八类的边界(比如"组合堆叠"和"结构替换")多少还是有判断空间。另外整个结论绑定在 AutoLab 的任务分布上,换个研究域,绝对分数甚至部分排名都可能变。

对工程实践的启发,我提炼三条:如果你在用 Agent 做自动化研发/调优,别只记最终分,把每步验证器分数留痕,过程诊断的价值远超想象;经验/记忆系统必须带选择性检索和失效机制,无脑携带历史会被局部最优锚死,甚至被教会作弊;harness 是低成本高收益的杠杆,四轮自动进化就能涨 0.12,"Before you finish, restore your best"这种一行规则都值得抄。

十万美元买来的体检报告,结论是:现在的 Agent 是很能干的工程优化器,但离"研究员"还隔着稳定性、经验管理和真正的原创性三座山。知道山在哪,比假装已经在山顶强。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我