分数高就叫"发现"吗?这篇论文给 AI 科研智能体立了一套审计规矩

上周读到一篇思路很对我胃口的论文。起因是我一直在关注一个越来越尴尬的现象:各种 AI 科研智能体的榜单分数节节高,动辄"自动发现新算法"、"自动优化出更好的催化剂配方",但你仔细想想——一个分数到底能证明什么

智能体跑出一个 0.99 的分数,可能性至少有三种:它真的做了研究(提出假设、做实验、从反馈中学习);它在网上搜到了现成答案直接抄;或者它单纯就是运气好、暴力搜到了。光看最终分数,这三者完全无法区分。而这篇论文做的事情,就是给"发现"这件事本身立一套可执行的审计协议。

核心摘要:这篇 arXiv:2609.09219 提出了 Discovery Certification Protocol(DCP,发现认证协议),把"AI 智能体做出了有用发现"这种模糊声明,拆成三个可以被机器检验的问题:结果真的比 baseline 好吗(Gate 1)?换一个只拿到相同起始信息、但没看过研究过程的新智能体,能不能复原出同样的结果(Gate 2)?实验反馈本身到底有没有因果贡献(Gate 3)?作者在 SQLite 索引优化和虚拟催化剂配方搜索两个任务上做了完整审计:96 个挑战者 episode 零复原、复原概率上界压到 0.0468、真实反馈组 30/30 成功而中性反馈组 0/30。说实话,这不是一篇刷榜论文,更像是一份"给 AI 科研结果发证"的基建提案——它值钱的不是某个数字,而是那套把口头声明变成可重放证据的思维方式。

论文信息: - 标题:Scores Alone Do Not Prove Discovery: The Discovery Certification Protocol for Auditing AI Research Agents - 作者:Jingjie Ning、Shanshan Zhong、Xiaochuan Li、Ji Zeng(arXiv 页面未列出机构信息) - 链接:https://arxiv.org/abs/2609.09219 - 提交日期:2026 年 9 月 7 日


🎯 为什么"分数"不够用

先看一组背景。2026 年这一年,AI 科研智能体的评测突然成了热门赛道:ResearchClawBench 让智能体对着 40 篇真实论文做"再发现",最强的 Claude Code 也只拿到 21.5 分(满分 100);SciAgentArena 铺了约 200 个任务做分级验证;Snorkel 的 Terminal-Bench-Science 收集了 70 个真实科研工作流,Claude Opus 5 的解决率也只有 30%。

这些工作都在回答"智能体能做到多好"。但注意,它们的评分逻辑有个共同的隐含假设:分数就是能力。智能体交出产物,评委(人或 LLM)对着 rubric 打分,完事。

DCP 这篇论文直接掀了这张桌子。它问的是一个更尖锐的问题:就算分数是真的、没有作弊、评测集也没泄露——这个分数背后,真的发生过"研究"吗?

你想想看。一个 SQL 优化智能体把查询加速了 88%,成绩亮眼。但如果有一个从来没看过它研究过程的新智能体,只凭公开文档和任务初始信息,就能独立做出一模一样的方案——那原来的智能体到底"发现"了什么?答案可能写在 SQLite 官方文档的第几页上,谁认真读谁都能做出来。反过来,如果 96 个这样的挑战者全军覆没,而原智能体只有拿到自己实验的真实反馈才能走到终点,这个分数才开始有点"研究含量"。

这就是 DCP 的核心直觉:发现与否,不由分数定义,而由"信息边界"定义

🏗️ DCP 的三道门

DCP 协议总览

图 1:DCP 协议总览。左上角是研究智能体的正常工作循环(实验→自适应反馈→测量→积累运行历史 L,最终产出 A 并在密封测试上得到分数 x)。02 区块是恢复测试:全新的匹配智能体拿到 K(背景知识)、E₀(初始观测)和 W_obs(观测到的 Web 内容),但被扣留运行历史 L——任何一个有效复原都会否决 Core 认证。03 区块是可选的反馈效应检验:从共享检查点分出真实反馈和中性反馈两臂,配对比较,并通过 null 校准后才发 Evidence 证书。*

DCP 把一个数值结果放在三道门前审。先说清楚几个关键对象,这个划分是整套协议的地基:

对象 含义 例子
K 运行前就固定的背景 模型、任务规则、起始代码、工具、公开方法
E₀ 与研究行为无关的初始任务观测 初始测量、任务自带的数据和标签
L* 目标运行中产生、并被后续行为使用的研究历史 假设、提交的候选、实验结果、分数、错误分析
A* 密封测试前固定规则选出的最终输出 程序、模型、策略
P 用于检验"恢复声明"的机器可检查条件 有效性规则、资源限制、数值阈值

K、E₀、L 的边界按信息来源划分:开始就存在的样本归 E₀;因为智能体选择了某个动作才返回的测量归 L。这个区分看着学究,其实是整套协议的灵魂——"发现"的定义被操作化成了:A 这个结果是否实质依赖 L 里的信息

Gate 1:这个结果有用吗?

最朴素的一门:在密封评估上,最终产物 A* 相对 baseline b 的平均效用提升,其置信下界要超过注册的最小增益:

\[LCB[\mu(A^*) - \mu(b)] \geq \delta_{min}\]

注意这里的设计细节——评估是密封的,所有注册(任务、阈值、预算、模型身份)都在看到任何私有结果之前冻结。baseline 还必须低于恢复区域,防止拿一个本来就接近天花板的 baseline 刷"提升"。

Gate 1 本身没什么新意,把它单独列出来的意义在于:先把"有用"和"是发现"解耦。过不了 Gate 1,后面免谈;但过了 Gate 1,什么也证明不了——这只是入场券。

Gate 2:别人拿着同样的牌,能不能打出同样的结果?

这是整套协议最狠的一门,也是我最喜欢的设计。

拿一个全新的、同模型同接口的匹配智能体,给它完整的 K 和 E₀,还给它原运行期间观测到的全部 Web 字节(W_obs)——是的,连原智能体上网查了什么都一字不差地给它。唯独扣下 L*:原智能体的假设、实验记录、分数反馈、错误分析,一概不给。

然后让这样的挑战者跑 n 个独立 episode。只要任何一个候选 a 满足:

\[P(a) = Valid(a) \land score(a) \geq x - \varepsilon\]

且符合注册的执行和来源条件,就构成一个合格复原见证,直接触发 Core veto——审计关闭,结论记为 recovered:这个结果用公开信息就能拿到,谈不上发现。

如果 n 个 episode 全部零复原,可以给复原概率算一个有限样本上界:

\[p_{upper} = 1 - \alpha_{recovery}^{1/n}\]

工程直觉是这样的:96 次独立尝试零命中,在 \(\alpha = 0.01\) 的置信水平下,真实复原概率的上界是 \(1 - 0.01^{1/96} \approx 0.0468\)。要拿到 Core 认证,需要三件事同时成立——零合格见证、\(p_{upper} \leq \rho\)(论文注册 \(\rho = 0.05\))、以及审计充分性:阳性对照必须在提供必要信息时能解开已知实例(防止挑战者集体哑火是因为 harness 坏了)、机会预算和独立抽样都得达标。

有一说一,这个"挑战者"机制说到底是一种对抗式可复现性检验。传统复现是"把作者的代码给我,我跑跑看";DCP 反过来,"代码和历史都不给你,只给你作者开局时的信息,你自己重新发现一次试试"。前者检验工程诚实度,后者检验信息量——检验"这段研究历史到底值多少钱"。

Gate 3:反馈真的在干活吗?

过了 Core 只说明结果难复原,还有最后一个疑点:迭代反馈本身有没有用?会不会 agent 闭着眼瞎猜也能到终点?

Gate 3 的做法是从一个共享检查点 c 分出新鲜配对的两臂:一臂收到自己实验的真实反馈,另一臂收到中性消息——保持相同的消息时序、schema 和大致长度,但剥掉所有指向正确下一步的信息。估计量是两种注册反馈策略在 c 条件下的总效应:

\[\Delta_{feedback} = E[u(A_{truthful}) - u(A_{neutral}) \mid c]\]

光有这个对比还不够。中性通道本身可能有安慰剂效应——消息来了这件事也许就能激励模型表现变好。所以 DCP 加了一个独立的 null 校准:在答案由 E₀ 决定的任务上,比较中性策略和另一个非方向性策略,要求这个差异落在注册的等价带 \(\pm\delta_{sham}\) 内。Evidence 认证的最终条件是:

\[LCB(\Delta_{feedback}) \geq \delta_{evidence} + \delta_{sham}\]

这个设计让我想起临床试验里安慰剂对照的逻辑——不但要和安慰剂比,还得先证明你的安慰剂本身没有疗效。说实话,在 LLM 评测里看到这种级别的因果推断洁癖,挺少见的。

🧪 两个完整审计:数字说话

论文跑了五个审计案例,其中两个是完整的三门全检。

SQLite-Web(DeepSeek-v4-flash)。模拟一个 SQLite 事件服务:16 个查询族,每族有一个部分索引候选,恰好 4 个族藏着高流量,智能体最多选 4 个索引。密封评估器在私有数据库上用确定性的 SQLite 虚拟机步数计工作量。智能体开工前通过记录网关读了 2 页公开的 SQLite 文档,首个方案得分只有 0.0369,靠着 harness 返回的按族交通加权反馈逐步迭代,最终方案精准选中 4 个高流量族,密封分数 0.8855——相当于把交通加权的 VM 工作量砍掉 88.55%。

Virtual Catalyst(DeepSeek-v4-pro)。虚拟催化剂配方搜索:5 个控制变量各 8 个合法水平,共 \(8^5 = 32768\) 种组合。智能体先提交锚定配方,harness 扩展成 36 孔单因子板并返回产率和选择性测量,然后提交最终配方。baseline 得分 0.5990,最终配方拿到满分 1.0(5 个隐藏最优水平全部选中,且在 256 个密封条件上行为最优)。

两个审计的 Gate 2 / Gate 3 结果:

案例 主分数 / baseline 恢复线 Gate 2 复原 挑战者最佳 决策
SQLite-Web 0.8855 / 0 0.8805 0/96 0.6734 Core + Evidence
Virtual Catalyst 1.0000 / 0.5990 0.9500 0/96 0.8146 Core + Evidence
Device calibration 1.0000 / 0.3667 0.9500 0/80 0.7133 Core
Multidim. knapsack 0.9349 / 0.9140 0.9329 复原于 0.9363 Dev. refuted

96 个挑战者 episode,零复原,复原概率上界 0.0468。SQLite 案例里挑战者的分数只取 4 个值,最高 0.6734,离 0.8805 的恢复线差得远——挑战者不是没努力,是手里那副牌(公开文档 + 初始信息)真的不够。45 个阳性对照全部成功,说明挑战者管道本身是好的,给它必要信息就能解题。

反馈效应更夸张:30 个新鲜配对里,真实反馈臂 30/30 全部复原目标,中性臂 0/30。配对的精确 99% 置信区间 \([0.6379, 1.0]\)。而 60 对 null 校准的差异是 0,区间 \([-0.0950, 0.0950]\) 稳稳落在 \(\pm 0.17\) 的等价带里。记录的余量计算 \(0.6379 - 0.17 = 0.4679\),高于注册的效应阈值 0.34。

30/30 对 0/30。看到这个数据的时候我愣了一下——这个效应大到几乎不需要统计检验。反馈不是"有帮助",反馈就是全部。

四门案例的分数对比

图 2:四个案例中 baseline(灰圈)、主结果(蓝菱形)、恢复线(橙色竖线)和最佳挑战者(叉号,颜色代表决策)的位置。前三个案例里最佳挑战者都被压在恢复线左侧;knapsack 案例中挑战者越过恢复线,直接被判 recovered。同一条结果规则横跨完全不同的任务产物。

两个完整审计的三门证据

图 3:上排是两个审计各自全部 96 个无谱系挑战者分数的分布——SQLite 的挑战者分数挤在 0.65 以下,催化剂的集中在 0.55-0.85,都摸不到恢复线(虚线)。下排是 Gate 3 的配对效应:绿色菱形是目标反馈效应(n=30,区间显著超过要求的 LCB 0.51),蓝色圆点是 sham 差异(n=60,贴着 0)。每一列是一次独立注册审计,估计不做跨审计合并。

还有几个用来覆盖决策空间的校准案例值得一提。多维背包案例里,挑战者在一个 episode 内两次机会打出 0.9363 和 0.9356,双双越过 0.9329 的恢复线——合格复原见证成立,Core 被否决。注意这个案例的主结果 0.9349 其实"有用"(增益 0.0209 超过注册的 δ_min 0.01),但有用不等于有发现含量,Gate 2 一票否决。这恰好演示了协议存在的意义。

affine parity 案例展示了另一种失败:主分数和反馈对比都是满分 1.0,但阳性对照的 recall 下界只有 0.0707——挑战者管道连已知实例都解不开,零复原什么都说明不了。verifier 干脆返回 audit incomplete。样本不够、对照不够,就不发证,宁可承认"审不出来"。这个克制我觉得很对。

五个案例的决策分布

图 4:决策空间全景。两个完整 Evidence 阳性(SQLite-Web、Virtual catalyst)、一个 Core 阳性(Device calibration)、一个复原否决(knapsack)、一个故意欠采样导致的 audit incomplete(Affine)。空心环是声明的校准角色,实心点是确定性 verifier 的实际决策——五案全部 match。

🔧 让审计可重放:无 LLM 的确定性 verifier

整套协议还有一个容易被忽视但很关键的工程决定:证据生产和决策判定分离。任务适配器负责定义有效性、打分和反馈格式,产出的记录交给一个共享的、确定性的、完全不用 LLM 的 verifier 去重算决策。

为什么这重要?因为凡是判断环节里有 LLM,你就得再问一遍"这个 LLM 评委可信吗",审计就无穷递归了。DCP 把决策规则全部变成算术:置信区间比大小、误差预算分配(两个完整审计里,主验证、候选分类、对照充分性、中性复原各分 0.005,挑战者复原、反馈效应、null 校准各分 0.01,合计 0.05)、Bonferroni 校正。任何人拿着冻结的证据 bundle,离线就能重放出一模一样的判定。

成本也顺便交代了:SQLite 审计 507 个模型会话、61.17 美元;催化剂审计冻结的开发加确认执行合计 435 会话、56.40 美元。坦率讲,一次认证几十美元、几百个会话,不算便宜,但对"给一个重要发现发证"这种场景,这个开销完全在合理范围。

🤔 我的判断

这篇论文最值钱的地方,在于它把一个哲学问题("什么算发现")硬生生翻译成了一个统计决策问题。翻译过程必然有损失,但换来的是可执行、可重放、可对抗检验。对于正在疯狂涌现的"AI 自动科研"叙事,这是一剂急需的冷静剂——下次再有智能体宣称"自主发现"了什么,你可以问一句:过了 Gate 2 吗?

但问题也不少,直说。

其一,两个完整审计的任务都是合成环境。 SQLite 案例的 16 查询族、催化剂案例的 32768 组合,都是精心构造的密封玩具任务。在真实科研里,"全部公开信息"的边界根本划不清——W_obs 抓得住智能体浏览过的网页字节,抓不住模型预训练时吞进去的整个人类知识库。一个在预训练里背过答案的模型,Gate 2 的挑战者可能也背过,这时候零复原反而说明不了什么。论文的威胁模型章节承认了信任边界的存在,但预训练知识污染这个洞,协议框架内无解。

其二,Core 认证的实际语义比名字保守得多。 它证明的是"在注册的信息边界和预算内, matched 挑战者复原不了",而不是"这是人类意义上的新发现"。knapsack 案例已经演示了:有用且真实的结果照样被一票否决,因为问题本身太容易。把 DCP Core 当成"新颖性证书"来宣传会是一种误用——它更像"过程依赖性证书"。

其三,效应量大到可疑的程度。 30/30 对 0/30,漂亮得像教科书插图。这恰恰是因为任务是合成的、反馈通道是任务里唯一的信息源。真实场景里反馈质量参差不齐,\(\Delta_{feedback}\) 大概率落在 inconclusive 区间里,Evidence 的门槛会难迈得多。

不过话说回来,就算有这些保留意见,我依然觉得这是今年评测方向里少见的"定义级"工作。别人在卷榜单,它在问榜单到底在测什么。如果你在做科研智能体、自动化实验平台,或者要给"AI 自主发现"写新闻稿——建议先把这篇读完,把"我们发现"改成"我们观察到分数提升",除非你能拿出三门证据。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。