别让大模型当裁判了:看它自己的 logit 就知道哪个科研假设是真的

你有没有想过一个问题——现在各种 AI 科学家系统(Google 的 AI Co-Scientist、Sakana 的 AI Scientist)都在批量生产科研假设,但生产出来之后,谁来判断哪个假设靠谱?

主流做法是再拉一个更大的模型来当裁判(LLM-as-a-Judge),让 GPT-5 这类旗舰模型读一堆候选假设然后打分排序。听起来很合理。但橡树岭国家实验室这篇论文(arXiv 2608.17270)给出了一个让人有点坐不住的结果:一个 10 亿参数的 Llama 3.2 1B,不给任何指令、不做任何推理,就看它自己读假设文本时的 logit 置信度,识别正确假设的准确率是 53%——而 GPT-5 被明确要求排序时,只有 17%。

三倍差距。裁判席上坐的那个最大最贵的模型,输得干脆利落。

核心摘要:这篇论文提出了 Logit-based Energy Scoring——不 prompt、不对话、不要求模型输出任何判断,直接用模型前向传播时假设文本区间的 logit 信号(softmax NLL 或原始 logit 能量)给候选假设打分排序。在 ResearchBench 基准(1323 篇论文、12 个学科、每篇配 15 个干扰假设)上,内在置信度打分的平均 Hit@1 为 33%,而 prompt 式 LLM 裁判只有 16.6%。最值钱的地方不是某个具体数字,而是它指向的一个结论:模型"说出来的判断"和"内部的置信度"是两回事,而后者可能更诚实


📖 论文信息

  • 标题:Do LLMs Know a Good Hypothesis When They See One? Logit-Based Energy Scoring Outperforms Prompted LLM-as-Judge for Scientific Hypothesis Ranking
  • 作者:Swati Rajwal、Sanjay Das、Tirthankar Ghosal(共同一作)
  • 机构:Oak Ridge National Laboratory(橡树岭国家实验室)
  • 链接:https://arxiv.org/abs/2608.17270
  • 日期:2026 年 8 月 18 日

图1:研究总览

图1:论文的四段式总览。左起:现状是 LLM 被广泛用于跨学科假设生成;问题在于 LLM 裁判偏向熟悉、常规的假设,语义相似度又会过滤掉真正新颖的想法;提出的方案是把候选假设喂给语言模型,用 logit 能量分(内在置信度)而非显式判断来打分;结果是 1B 模型的 logit 打分 53% vs 大模型直接询问 17%,三倍差距。


🎯 为什么这个问题值得做

先说清楚这篇论文在解决什么。它不是在做"生成假设",而是在做评估假设——一个比生成更基础、也更没被解决好的环节。

逻辑链条是这样的:在信任模型能提出新科学想法之前,它起码得能从一堆"听起来都像那么回事"的候选里认出哪个是专家真正验证过的假设。如果连判别都做不到,生成出来的东西你敢用吗?

而现有的判别手段都有硬伤:

评估方式 问题
LLM-as-a-Judge(大模型裁判) 位置偏差、冗长偏差、偏爱常规想法,真正新颖的假设反而被打低分
语义相似度(embedding 余弦) 假设"正确"和"与参考文献相似"强绑定——但面向未来的科学假设,恰恰是文献里还没写过的
人类专家评审 准,但不可扩展,又慢又贵

我之前在做生成质量评估的时候也踩过类似的坑:让模型自己当裁判,它会给"写得长、写得像教科书"的答案打高分,哪怕内容平淡。这和人审稿时的"流畅性偏好"如出一辙。这篇论文把这个问题在科学假设场景下量化了。


🧠 方法:一次前向传播,不跟模型说一句话

核心思路一句话讲完:把候选假设接在"背景 + 研究问题"后面,看模型预测这段文本时有多"惊讶"。越不惊讶,说明它越觉得这段话合理。

固定 prompt 模板长这样:

Background: [背景调研]
Research Question: [研究问题]
Hypothesis: [候选假设文本]

整个序列 tokenize 后跑一次前向传播(teacher forcing),然后只取 Hypothesis 那一段的 logit 来算分——因为背景和研究问题对 16 个候选完全一样,算进去只会引入共享噪声。span 的定位也做得干净:单独 tokenize "Hypothesis:" 之前的前缀,用它的 token 长度当偏移量。

打分有两个互补的准则:

准则一:Softmax NLL(归一化的)。就是标准的逐 token 交叉熵:

\[\ell_t = -\log \operatorname{softmax}(z_t)[x_t]\]

值越小,说明模型归一化后的概率分布把更多质量放在了实际出现的 token 上。

准则二:Raw Target-Logit 能量分(未归一化的)。直接取目标 token 的原始 logit 取负:

\[E_t = -z_t[x_t]\]

这个设计有点意思。两者的差别只在配分项——softmax 会把整个词表的 logit 做归一化,这个过程可能把"模型到底有多笃定"的信号压缩掉。两个假设 softmax 概率相同,但如果底层 logit 分布的锐度不同,Raw 能量分就能区分出来。这是能量模型(EBM)的老思路:不过 softmax,直接把 logit 当未归一化的兼容性度量。

然后在假设 span 上取平均,得到每个候选的标量分数 \(S_{\mathrm{NLL}}(h)\)\(S_{\mathrm{Raw}}(h)\),越低越好。16 个候选按分数升序排,看金标准假设排第几。

整个流程的工程开销值得强调:每个候选只需一次前向传播,无采样、无额外调用、完全确定性。评估一篇论文的成本随候选数线性增长(16 次前向)。对比一下 LLM 裁判方案:要把 16 个候选全塞进一个 prompt,要求模型输出结构化 JSON 排序,还得处理格式错误的解析问题。


🧪 实验:1323 篇论文,16 选 1

数据集用的是 ResearchBench(ACL 2026 Findings),1323 篇 2024 年及之后发表的论文,覆盖天文、生物、化学、物理、法律、商学等 12 个学科。每篇论文拆出背景调研、研究问题,配 16 个候选假设——1 个真的,15 个似是而非的干扰项。

模型阵容:7 个开源模型(Llama 3.2 1B/3B、Gemma 2 2B、Gemma 4 12B、Mistral 7B、Phi-4 14B、GPT OSS 20B),加上 GPT-5 走 Azure API 做 prompt 式裁判(只要求输出 top-5 排序)。

主结果

模型 Hit@1 Hit@5 MRR
NLL 准则
Llama 3.2 3B 0.368 0.649 0.506
Gemma 2 2B 0.352 0.640 0.493
Gemma 4 12B 0.346 0.636 0.487
Llama 3.2 1B 0.322 0.587 0.460
Mistral 7B 0.327 0.602 0.464
Phi-4 14B 0.327 0.621 0.471
GPT OSS 20B 0.278 0.614 0.437
Raw 能量准则
Llama 3.2 1B 0.531 0.774 0.641
Llama 3.2 3B 0.458 0.732 0.586
Mistral 7B 0.411 0.676 0.538
Gemma 4 12B 0.263 0.531 0.402
Gemma 2 2B 0.135 0.336 0.260
Prompt 裁判
GPT-5 0.166 0.417

置信区间是 2000 次 bootstrap 重采样算的 95% 区间。

几个值得停下来看的点:

第一,GPT-5 裁判输得很彻底。 Hit@1 只有 16.6%,低于所有 NLL 打分的开源模型,也低于除 Gemma 2 2B 之外所有 Raw 打分的模型。要知道随机猜的基线是 1/16 ≈ 6.25%,GPT-5 确实比随机强,但被一堆比它小一个数量级的模型按在地上摩擦。

第二,Raw 能量分的效果严重依赖模型。 对 Llama 3.2 1B/3B 和 Mistral 7B 是巨大提升(1B 从 32% 涨到 53%),但对 Gemma 2 2B 是灾难(从 35% 掉到 13.5%)。作者给的机理猜想挺有说服力:Gemma 2 对最终 logit 做了 tanh soft-capping,恰好把 Raw 准则依赖的原始 logit 幅度压扁了,而归一化的 NLL 不受影响。不做 capping 的 Gemma 4 12B 在 Raw 下就恢复到了 26.3%。

第三,53% 这个数字要打折扣看。 作者自己很坦诚——这是 14 个"模型×打分器"组合里事后挑出来的最大值,应该读作"匹配得好时能达到的上界",而不是无偏估计。两种准则整体平均其实打平(NLL 33.1% vs Raw 32.8%,差距在噪声内)。模型间的方差远大于打分器间的方差,这句话我觉得是全文最诚实的一句。

逐对比较:比随机还差

另一个更狠的指标:对每篇论文,把正确假设和每个干扰假设逐对比较,看正确假设排更高的比例。随机水平是 50%。

NLL 打分稳定在 69%-74%;Raw 打分中 Llama 1B 达到 82.2%;而 GPT-5 裁判只有 37.4%——低于随机

看到这个数我愣了一下。一个旗舰模型被明确要求"挑出最合理的假设",两两比较胜率居然不如抛硬币。当然这里有个口径问题:GPT-5 只输出 top-5,没进 top-5 的候选被打成并列末位,这在对比口径上有点吃亏。但即便只看它给出的 top-5 内部排序质量,也谈不上好。

记忆化检验:方向反了

读到"1B 小模型最强",我的第一反应是:是不是训练数据里见过这些论文,背下来了?

作者提前堵了这个质疑:ResearchBench 用的是 2024 年之后发表的论文,而表现最好的 Llama 3.2 1B/3B 训练数据截止于 2023 年 12 月——早于所有测试论文。反倒是 cutoff 更晚的模型表现更差。这不能完全排除记忆化,但模式跟记忆化的预测正好相反。

学科差异与一致性

分学科看,likelihood 打分在 12 个学科里的大多数都占优;GPT-5 只在物理和材料科学上名义领先——但每个学科只有约 110-125 篇论文,差距在采样噪声内。作者明确说这只是"值得后续检验的假设",不是结论。这种克制在现在的论文里不多见。

还有一个有意思的发现:7 个开源模型在 NLL 下对 167 篇论文(12.6%)一致把金标准排第一,而 Raw 下只有 3 篇(0.2%)。说明 NLL 捕捉到的是跨模型共享的稳定信号,Raw 虽然峰值更高,但每个模型各说各话。这留下一个悬而未决的问题:Raw 高分到底是科学正确性的信号,还是每个模型各自捡到了不同的表面线索?


🤔 我的判断

这篇论文最打动我的不是"1B 吊打 GPT-5"这个标题党式的数字,而是它背后的机理暗示:让模型外化一个判断,和直接读它的内部状态,得到的是两个东西。

prompt 式排序其实是一条更绕的路——模型得同时在上下文里装下 16 个候选、忠实执行排序指令、再把内部的合理性估计翻译成结构化输出。每一步都在引入失真。这跟之前"模型的口头回答和内部概率不一致"的一系列研究(比如 Kadavath 等人的 Language Models Mostly Know What They Know)是一条线上的。如果你在做评估系统,这个结论值得记住:能读 logit 就别问模型"你觉得呢"。

但也要泼几盆冷水:

  • 金标准假设是专家写的,干扰项是后配的。正确假设可能天然更流畅、更像"正式论文语言",likelihood 打分捕获的可能部分是写作质量而非科学合理性。作者承认当前设计无法分离这两个因素。这是个实打实的混淆变量。
  • 任务本质是"识别已知假设",不是评估真正开放的新想法。对 AI 科学家系统真正有用的场景——一堆谁都没验证过的新假设——这篇论文没测,只是列为未来工作。
  • 裁判方案只测了一个模型一种 prompt。零样本、要求 top-5、JSON 输出,这个 baseline 未必是 LLM-as-a-Judge 的最强形态。换个 prompt 策略或者带推理的模型,差距可能缩小。不过 37.4% 的逐对胜率实在太难看,我对"缩小到反超"持怀疑态度。

跟同期工作比,这不算底层突破——logit 当置信度信号、能量模型重解释输出层,都是已有的工具。它的价值在于把这套工具第一次系统地用在科学假设排序上,并且把一个大家隐约感觉到但没量化的事情说清楚了:内在信号比外化判断可靠。

工程启发很直接:如果你的 pipeline 里还在用大模型裁判做候选排序,不妨试试换成小模型的 NLL 打分——成本可能降一个数量级,效果可能还更好。但用 Raw logit 能量分之前,先查一下你的模型有没有做 logit soft-capping,Gemma 2 的坑别踩第二次。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我