Coding Agent 能复现 Nature 论文的 SOTA 吗?这个新基准给出的答案有点扎心

先抛个问题给你。

这两年「AI 自动做科研」喊得震天响——给个题目,Agent 自己写代码、跑实验、出结果,甚至号称能「自主发现」新方法。听起来很美。但有个特别朴素的问题一直没人正面回答过:让现在最强的 Coding Agent 去碰一篇真正发表在 Nature 子刊上的论文,它能复现出人家报告的那个 SOTA 吗?更进一步——它能超过吗?

这篇叫 NatureBench 的论文,就是冲着这个问题来的。它从 90 篇 Nature 系列同行评审论文里蒸馏出 90 个任务,把 10 个前沿 Agent 拉进同一个标准化的「考场」里考了一遍。结论我先剧透:最强的那个,也只在 17.8% 的任务上真正超过了已发表的 SOTA。

更有意思的是它对「成功」和「失败」的解剖。后面慢慢聊。


一段话讲清楚这篇论文在干嘛

NatureBench 是一个跨学科基准,包含从 10 个 Nature 系列期刊、约 5500 篇论文里筛出来的 90 个任务,覆盖细胞组学、蛋白生物学、生物医学建模、物理建模、分子设计、关系推理六大科学领域。它真正的硬骨头不在「出题」,而在 NatureGym——一套能把一篇论文自动转化成标准化、容器化、可自动评分的任务环境的流水线,专门解决以前同类基准「环境碎片化、跑都跑不起来」的老毛病。评估时全程禁用网络搜索,用一个 SOTA 归一化的相对 gap 指标 \(g\) 来衡量 Agent 离已发表结果有多远。结果是:最强的 Claude Opus 4.7 在 g>0.1(超越 SOTA)这条线上只拿到 17.8%,匹配 SOTA 也只有 47.8%。而且分析 900 次运行后发现,Agent 之所以能成,主要靠把科学问题「翻译」成它熟悉的监督学习预测题,而不是真的搞出了什么科学创新。

我的判断:这篇论文最值钱的不是那个排行榜,而是 NatureGym 这套把论文工业化拆解成可评测环境的管道,以及它对「Agent 到底是在发现还是在拟合」这个问题给出的、有数据支撑的冷静回答。

论文标题:NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers? 作者:Yuru Wang, Lejun Cheng, Yuxin Zuo, Sihang Zeng, Bingxiang He, Che Jiang, Junlin Yang, Yuchong Wang, Kaikai Zhao, Weifeng Huang, Kai Tian, Zhenzhao Yuan, Jincheng Zhong, Weizhi Wang, Ning Ding, Bowen Zhou, Kaiyan Zhang 机构:Horizon Research, Frontis.AI, Tsinghua University arXiv:2606.24530,提交于 2026 年 6 月 23 日 代码:https://github.com/FrontisAI/NatureBench


为什么需要再造一个基准?现有的不够用吗

说实话,我第一反应也是这个:PaperBench、CORE-Bench、MLE-bench 一大堆,还差这一个?

但仔细想想,现有基准其实卡在两个维度上,谁都没跨过去。

第一类是「论文复现」基准,比如 PaperBench、CORE-Bench。它们考的是:「这篇论文的方法,你能照着重新实现一遍吗?」——衡量的是理解和编码能力。问题在于,它默认你已经知道方法是什么了。可科研真正难的地方,恰恰是在不知道答案的情况下,自己想出一个有竞争力的方法。复现,终究只是抄作业。

第二类是「工程优化」基准,比如 MLE-bench、PostTrainBench。它们大多围着 Kaggle 竞赛或者模型后训练转,本质是调参和工程优化。这类任务不太需要自然科学研究里那种领域推理、专用工具、跨学科知识。而且它们普遍有个老大难——环境碎片化,每个任务的依赖、数据、跑法都不一样,复现起来一地鸡毛。

NatureBench 的想法,是把这两条轴都往前捅一截:

已有范式 衡量什么 NatureBench 的扩展
PaperBench 这一类 Understanding → Coding(理解与复现) 再往前推到 Discovery(发现)
PostTrainBench 这一类 Engineering Optimization(工程优化) 再往上抬到 Science(科学)

一句话:它想看的不是「你能不能抄」,而是「在不让你看原方法的前提下,你能不能自己摸出一个不输甚至更好的方法」。

为了堵死「偷看」这条路,作者设计了一个叫信息防火墙的机制——把源论文里的方法部分直接抹掉,只留任务定义和数据。Agent 拿到手的,是一个「知道要解决什么问题,但不知道前人怎么解决」的环境。这就逼着它去发现,而不是复现。


先看全景:90 个任务长什么样

图1:NatureBench 全景概览

图1(Figure 1):NatureBench 全景。上半部分 (a) 展示了六大任务领域及各自的代表性源论文配图——细胞组学 31 个任务、蛋白生物学 16 个、生物医学建模 14 个、物理建模 13 个、分子设计 11 个、关系推理 5 个;下半部分 (b) 是核心排行榜,按 Surpass-SOTA(g>0.1)率排列十个模型,Claude Opus 4.7 以 17.8% 居首,MiniMax-M2.7 垫底只有 1.1%。

这张图基本把论文的骨架立起来了。上面是「考什么」——六个跨度极大的科学领域,从单细胞测序数据的聚类整合,到蛋白质结构预测,到物理系统建模,到分子 linker 设计。下面是「考得怎么样」——一个肉眼可见落差巨大的排行榜。

注意看那个柱状图的整体高度。最高的也就 17.8%。 换句话说,哪怕是当下最能打的 Agent,面对真实的 Nature 级科学任务,超过五分之四的题目它做不到比已发表的方法更好。这个数字本身,就是这篇论文最想让你记住的东西。


NatureGym:把一篇论文「工业化」成一个考场

聊到这儿,我得说这篇论文真正的技术含量在哪。不是排行榜,是 NatureGym 这套流水线。

你想想看,要把一篇 Nature 论文变成一个能让 Agent 自动跑、还能自动打分的标准化环境,中间要趟多少坑:论文 PDF 怎么解析?数据在哪、怎么下?哪些文件能给 Agent 看、哪些必须藏起来(不然就泄题了)?评分脚本怎么写才确定性可复现?这些事一篇论文手工做做还行,5500 篇?没有自动化管道根本玩不转。

图2:NatureGym 自动化管道

图2(Figure 2):NatureGym 管道。三个带独立审查关卡(review-gated)的阶段,把一篇 Nature 系列论文转化为容器化任务包,沿途不断精炼一条共享的逐论文记录 T=(A, D, M, S, B)。信息防火墙在此过程中移除源论文的方法部分。

整个管道把每个任务抽象成一个五元组 T = (A, D, M, S, B):A 是核心算法,D 是数据集,M 是评估指标,S 是 SOTA 分数,B 是可选基线。三个阶段层层把关,每一关都带一个独立的「审查 + 验证-修复」循环。

第一阶段——论文筛选。 先把每篇论文拆成三块结构化素材:保留公式和结构的 markdown 正文、每个图表的整页截图、按 data/code/supplementary 分类的超链接列表。然后过三道筛子:

  • Level 1(任务可提取性):核心贡献必须能抽成一个 ML 任务。纯湿实验、纯理论、硬件研究,以及 ML 只是打辅助的,统统排除。
  • Level 2(可评估性):必须是在「质量类指标」(不是速度、成本、可解释性这种)上声称 SOTA,而且这个指标得能被确定性地、全自动地算出来。
  • Level 3(数据可得性):数据必须公开可下、无需申请认证,还得能切分出开发集和评估集。这里有个挺务实的分级——按数据量分 Tier S(小于 1 GB)、Tier M(1 到 50 GB)、Tier L(大于 50 GB),超过 50 GB 的直接拒收。毕竟下载和存储都是真金白银。

筛完还要过一道「对抗式审查」专门抓假阳性,确认没问题才进入下一步——因为后面的数据采集很贵,不能浪费在不合格的论文上。

第二阶段——数据采集与验证。 这里最妙的是那个文件级防火墙。判定准则就一句话:「无论用什么方法,这个文件是不是都必须用来定义任务?」 是,就保留(共享的输入数据);不是,就排除(核心算法 A 特有的、或者 A 产生出来的中间/最终文件)。这样 Agent 拿到的,恰好是「算法 A 的输入起点」,但完全看不到 A 本身怎么做、产出了什么。泄题这条路被堵死了。

验证阶段重点查两件事:可分解性(开发集能不能只靠样本划分和方法无关的预处理,从评估集里干净分出来)和实例有效性(保留的评估实例对应单一研究目标、含核心实验)。只要有一个实例完整,就放行。

第三阶段——任务包构建。 最终产出的任务包长这样:

可见性 组件 内容
Agent 可见 problem/README.md 任务定义、评估指标、输出格式、提交规范
Agent 可见 problem/data_description.md 数据集概述、文件格式与 schema
Agent 可见 problem/data/ 逐实例输入(不含 ground truth)
隐藏 evaluation/evaluator.py 带输入校验的确定性打分函数
隐藏 evaluation/ground_truth/ 逐实例参考答案
基础设施 environment/Dockerfile 共享基础镜像上的逐任务覆盖层
基础设施 metadata.json 领域、计算需求、逐实例 SOTA 分数

构建遵循三条原则:证据扎根的保真性、信息防火墙、可执行完整性。最后这道审查关卡尤其狠——36 项自动检查,覆盖产物完整性、跨组件一致性、防火墙是否漏了、基准设计是否合规、端到端动态测试。还要在物理机上真把 Docker 镜像 build 出来跑个 smoke test。自动修不了的,才升级到人工。

我是真的觉得,这套管道才是这篇论文能复用、能往下做的根基。排行榜会过时,但「怎么把论文自动变成可评测环境」这件事,是能沉淀下来的资产。


这 90 个任务,覆盖面到底有多广

图3:NatureBench 覆盖范围

图3(Figure 3):NatureBench 覆盖范围。90 个任务横跨六大科学领域和多样的 ML 任务族,在数据模态、数据特性、源论文贡献类型上变化极大。

几个值得记的统计数字:

  • 90 个任务、333 个评估实例。 这 90 个最终来自 10 个候选期刊中的六个,另外四个筛完一个任务都没留下。
  • 来源期刊分布:Nature Machine Intelligence 贡献最多(36 个),其次 Nature Methods(26 个)、Nature Computational Science(16 个)。
  • 年份分布偏向近期,2022 到 2025 年分别是 11、17、28、34 个——越新的论文占比越高。
  • 指标极度多样:用了 81 种不同的主指标,AUROC、RMSE、Spearman ρ、ARI、F1、MAE……每个任务平均还有 3.7 个主指标加 5.1 个辅助指标。

这种异质性恰恰是它要用归一化 gap 指标的原因——不同任务的指标根本没法直接比,必须先归一化。


怎么打分:一个绕不开的归一化 gap

评估的核心是一个对实例 \(i\) 定义的 SOTA 归一化相对 gap:

\[g_i = \mathrm{dir}_i \cdot \frac{m_i - m_i^{\mathrm{sota}}}{|m_i^{\mathrm{sota}}|}\]

其中 \(m_i\) 是 Agent 拿到的指标值,\(m_i^{\mathrm{sota}}\) 是论文报告的 SOTA,\(\mathrm{dir}_i \in \{+1, -1\}\) 用来编码指标方向(有的指标越大越好,有的越小越好)。

这个公式的工程直觉其实很简单:它把「Agent 离 SOTA 多远」这件事变成了一个不带量纲、方向统一的百分比。 \(g_i \ge 0\) 就意味着 Agent 追平或超过了已发表结果。任务级分数取各实例 \(g_i\) 的平均;如果某个实例 Agent 压根没交出有效结果,记 \(g_i = -1.0\)。正因为 scale-free,81 种五花八门的指标才能放在一张表里横向比。

两条关键判定线: - Surpass-SOTA\(g > 0.1\)(真正超过) - Match-SOTA\(g \ge 0\)(追平或超过)

跑法也设计得挺较真。每个 Agent 在隔离的、任务专属的 Docker 容器里跑,对 problem/ 只读、对 workspace/ 读写,4 小时墙钟预算,需要时配 1 个 GPU。evaluator、ground truth、SOTA 目标全都放在 Agent 碰不到的 host 侧评估服务里。运行中 Agent 可以调三个端点:/evaluate(打分)、/best_score(查当前最优)、/time_remaining(查剩余预算),而且打分时墙钟会暂停——评估开销不算进 Agent 的时间预算,这个细节挺贴心。

最关键的是全程禁用网络搜索。这一刀下去,就是不让 Agent 去网上把原论文或原数据集搜出来抄。同时运行结束后还有个 Claude Sonnet 4.6 当裁判,专门查五种作弊行为:编造输出、偷换规则、捞答案、刷反馈、绕过训练。被抓到的运行直接判零分。


主结果:最强也就 17.8%

好,到了见真章的时候。

10 个 Agent 配置,跨三种 harness:Claude Code(挂了 7 个模型)、Codex CLI(2 个)、Gemini CLI(1 个)。

模型 Surpass-SOTA (%) Match-SOTA (%)
Claude Opus 4.7 17.8 47.8
Gemini 3.5 Flash 15.6 37.8
GPT-5.5 14.4 44.4
Claude Opus 4.6 12.2 36.7
Qwen 3.7 Max 10.0 28.9
Kimi K2.6 8.9 30.0
GPT-5.4 8.9 27.8
GLM-5.1 7.8 28.9
DeepSeek-V4-Pro 4.4 26.7
MiniMax-M2.7 1.1 13.3

表4(Table 4):NatureBench 主结果,按整体 Surpass-SOTA 率排序。S = Surpass-SOTA(g>0.1),M = Match-SOTA(g≥0),单位为任务百分比。

冠军 Claude Opus 4.7:超越 SOTA 17.8%,匹配 SOTA 47.8%。注意,连追平 SOTA 都不到一半。 紧随其后的 Gemini 3.5 Flash(15.6%)和 GPT-5.5(14.4%)。最弱的 MiniMax-M2.7 只有 1.1%——基本可以说在这个考场上交了白卷。

再看一张更细的提交质量表,这里藏着一些有意思的东西:

模型 g̃_all(中位) CR(完成率) SR(打分率)
Claude Opus 4.7 −0.007 100.0 100.0
Gemini 3.5 Flash −0.083 94.4 98.9
GPT-5.5 −0.055 84.4 98.9
Claude Opus 4.6 −0.061 100.0 100.0
Qwen 3.7 Max −0.121 95.6 98.9
Kimi K2.6 −0.142 92.2 94.4
GPT-5.4 −0.123 94.4 100.0
GLM-5.1 −0.150 93.3 93.3
DeepSeek-V4-Pro −0.242 98.9 98.9
MiniMax-M2.7 −0.401 93.3 98.9

表5(Table 5):各 Agent 的 gap 摘要与提交率。g̃ 为中位数;·all 列对无有效分的任务设 g = −1.0。CR = 完成率,SR = 打分率。

几个细节值得品:

第一,两个 Claude Opus 是最「干净」的——完成率和打分率都是 100%,没有一个无效提交。

第二,GPT-5.5 是抄近道最多的,有 13 个提交被裁判判无效过滤掉了。但有意思的是,它在裁判接受的那些任务上,g̃_valid 是 +0.001,是唯一一个在「干净任务」上中位数非负的模型。这个对比挺微妙——它要么老老实实做对,要么就想走捷径,中间地带少。

第三,看 g̃_all 这一列,从冠军的 −0.007 一路滑到 MiniMax 的 −0.40。绝大多数任务都是略微低于 SOTA,但少数任务因为归一化 gap 被放大,会拖出极端负值,所以你会看到 mean 远低于 median。


最扎心的部分:Agent 是怎么「成功」的

如果说前面的排行榜只是让人觉得「哦,还不够强」,那这一节才真正让我皱了眉。

作者分析了全部 900 次 task–agent 运行(10 个 Agent × 90 个任务),整体 Match-SOTA 率是 32.2%。然后他们做了件特别较真的事——去看这些成功到底是怎么来的。

图7:900次运行的解题机制

图7(Figure 7):900 次运行的解题机制。(a) Match-SOTA 整体结果——32.2% 成功、67.8% 其他;(b) 同方法族 vs 异方法族的 Match-SOTA 率对比;(c) 成功运行中的成功模式分布;(d) 低于 SOTA 及无效运行的失败层分布。

看子图 (c),成功运行里的模式分布:

  • 监督式代理预测(Proxy prediction):45.5%
  • 搜索/调参:17.6%
  • 工程流水线:11.0%
  • 预训练/模型放大:8.6%
  • 领域推理型替代方案:8.3%
  • 方法对齐的解法:9.0%

把前四类「工程驱动」的加起来,占了成功的 82.7%。而真正靠领域科学推理(domain-reasoned)的,只有可怜的 8.3%。

这说明什么?Agent 之所以能成,绝大多数是因为它把一个科学问题,硬生生翻译成了它最熟悉的那套「监督学习预测题」。 你给我一个细胞组学的科学问题,我不管你背后的生物学结构,我先把它变成一个「给特征、预测标签」的回归或分类任务,然后用我练得滚瓜烂熟的那套 ML 流水线去碾。能 work,但 work 的方式跟「科学发现」基本不沾边。

作者管这个叫 methodological translation(方法学转译)。子图 (b) 还有个佐证:跟源论文同属一个方法族的运行,Match-SOTA 率 37.7%;不同族的只有 29.6%。越是贴近原始科学结构的方法越有效——可惜 Agent 大多数时候选的不是这条路。

这就是这篇论文最有价值的洞察。它没有简单地说「Agent 还不够强」,而是精准地指出:Agent 现在的「强」,强在工程拟合,不强在科学创造。它是个极其优秀的「问题转译器」,而不是「问题发现者」。


失败又是怎么失败的

回到图7的子图 (d),剩下 67.8% 没成功的运行,失败到底卡在哪一层:

失败层 占比
方法层(主导) 61.1%
└ 其中「选错方法」 45.1%
执行层 28.7%
└ 其中「算力/时间不够」 24.4%
策略层 7.0%
理解层 3.1%

这张表我看了两遍。理解层失败只有 3.1%。 也就是说,Agent 几乎都看懂了题——它知道要干什么。问题压倒性地出在方法选择(45.1%)和算力预算不足(24.4%)上。

换个说法:大部分失败的运行,其实都跑出了一个能运行的方案,只是方法太弱、或者实现太浅。不是不会写代码,是不知道该写什么样的方法,或者 4 小时跑不完它想跑的东西。

这跟成功侧的结论形成了一个完整闭环:Agent 在「编码」这件事上已经基本毕业了,瓶颈整体上移到了「方法论」这一层——选什么方法、把方法做到多深。这恰恰是科研里最难、最依赖领域直觉的部分。


它的校准做得够不够硬

我一向对这类基准的一个警惕是:SOTA anchor 是不是定得太松,导致 Agent 随便糊一个就「超越」了? 如果锚点本身不准,整个排行榜都是空中楼阁。

这点上作者做得算扎实。他们用了一套质量校准流程:先用 Claude Opus 4.6 在 base 模式跑所有任务做诊断,再用 Claude Opus 4.6 和 DeepSeek-V4-Pro 在 reproduce 模式(允许看方法、就是单纯复现)跑一遍。人工审查后砍掉了 45 个有系统性缺陷的任务,对 17 个做了小修复,才定下最终的 90 个。

最有说服力的是这个数字:在两个复现模型都成功的 16 个任务上,g 紧紧聚在零附近——中位数 −0.0026,90% 的偏差不超过 0.031。这说明 SOTA 锚点校得相当准,复现模式下确实能稳定地「贴着 SOTA 跑」,那 discovery 模式下超不过 SOTA 就是真的难,不是锚点虚高造成的假象。

这个对照设计我给个好评——它把「任务本身有没有问题」和「Agent 强不强」这两件事干净地分开了。


难易分层:哪些科学领域是 Agent 的软肋

顺带提一个挺直觉的发现。作者按领域算了 consensus Match-SOTA 率,分出难易两层:

较易层:关系推理(60.0%)、蛋白生物学(37.5%)、细胞组学(35.5%)。 较难层:物理建模(26.9%)、分子设计(18.2%)、生物医学建模(17.9%)。

分子设计和生物医学建模明显是硬骨头。还有个值得记的点:跨学科任务更难。15 个跨学科任务的 pooled median g̃ 从单学科的 −0.13 掉到 −0.21,Match-SOTA 率从 33.1% 降到 28.0%。需要同时调动多个领域知识的题,Agent 明显更吃力——这也合理,毕竟「把问题转译成监督学习」这招在边界清晰的单领域问题上最好使。


我的判断

这篇论文,值得读。

亮点有两个。 一是 NatureGym 这套自动化管道,把「论文 → 可评测容器环境」这件脏活累活工业化了,36 项自动检查 + 信息防火墙 + 物理机 smoke test,工程上是真下了功夫。这东西的价值会超过排行榜本身——作者最后也提了,长期目标是把这套底座转成未来科学发现 Agent 的训练数据,这个想法我觉得比基准本身更有想象力。二是它对「成功机制」的解剖,用 900 次运行的数据,冷静地戳破了「Agent 自主科研」的部分泡沫:现在的成功,82.7% 靠工程化转译,真正的领域推理只有 8.3%。这个数字应该被更多人看到。

要说保留意见。 全程禁用网络搜索这一刀,我理解是为了防作弊,但它也让评测偏离了真实科研场景——真实研究者是会查文献、会站在前人肩膀上的。所以这个基准衡量的更像是「零外部信息下的从头发现能力」,是一种偏严苛的下界。另外,把 SOTA-normalized gap 取实例平均、失败记 −1.0,会让 mean 被极端值带跑偏,所以看结论时盯 median 更靠谱——作者自己也是这么呈现的,这点没问题,只是读者别被 mean 的吓人负值误导。

对工程的启发。 如果你在做科研 Agent 或者 AutoML 方向,这篇论文给的信号很明确:别再卷代码生成能力了,那块基本饱和;真正的护城河在「方法选择」和「领域推理」。 怎么让 Agent 在不退化成「无脑监督学习」的前提下,选对甚至想出贴合科学结构的方法——这才是下一个值得砸资源的方向。

科研自动化这条路还很长。NatureBench 的意义,不在于宣告 Agent 行或不行,而在于它第一次用一套足够硬的标尺,把「Agent 到底是在发现还是在拟合」这个模糊的争论,钉成了一个有数字、可追踪的问题。

arXiv 编号 2606.24530,感兴趣的可以去翻原文,附录里那几个 representative trajectory 的逐步诊断(癌症基因识别、基因组序列预测、反应产物预测)也挺值得一看。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我