盲人摸象式的大模型:闭卷考试一测,32 个模型没一个能及格

你有没有遇到过这种情况:问大模型一个冷门事实,它答得特别自信,细节也对得上——但你隐约觉得哪儿不对。后来一查才发现,关于这件事其实有两种说法,模型只告诉你了流传最广的那一种,另一种它压根没提。

这不是幻觉,也不是答错。它答的每一个字都是"对"的,只是对得不完整

8 月 28 号挂在 arXiv 上的这篇论文(编号 2608.28478),给这种毛病起了个挺形象的名字:认知近视(epistemic myopia)——就像盲人摸象,摸到腿的说是柱子,摸到耳朵的说是扇子,每个人说的都是自己真实摸到的东西,但没一个人说出了整头大象。作者们造了一个叫 ElephantBench 的基准,专门揪这个问题。结果说实话有点扎心:32 个模型测下来,最强的那个也只有 52.4% 的题目能把两种说法都回忆出来。

核心摘要

现有的事实性 QA 基准基本都假设"一个问题一个标准答案",这就掩盖了一个问题:模型到底记不记得长尾事实的多种分歧版本?ElephantBench 的思路是反着来——从被质量过滤器筛掉的低曝光网页语料里,用一套图结构的流水线挖出自然存在的跨源分歧(比如特蕾莎修女的生日,IMDb 写 8 月 26 日,另一个来源写 8 月 27 日),每个答案都经过来源追溯、独立网络验证和人工审核,最后得到 1,094 道闭卷题。测下来,最强模型 Kimi-K3 的完整召回率只有 52.38%,几乎从不完全答不上来(失败率仅 2.4% 左右),但就是会漏掉其中一种说法。我的判断:这不是一篇"刷榜"论文,而是一篇诊断工具论文——它最值钱的不是那个排行榜,而是把"记忆不完整"这个模糊体感变成了可测量、可归因的指标,并且把锅精准地甩给了预训练语料的曝光失衡。

论文信息

  • 标题:Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge
  • 作者:Zhuoshi Pan、Junru Lu、Yan Qian、H. Vicky Zhao、Di Yin、Xing Sun
  • 机构:Tsinghua University、Tencent Youtu Lab、University of Warwick
  • 日期:2026 年 8 月 28 日提交
  • 链接arXiv:2608.28478代码 GitHub: Tencent/ElephantBench数据 HuggingFace

🎯 为什么需要这篇论文:单答案 QA 测不出"漏答"

先说清楚这篇论文卡位的缝隙在哪。

长尾知识评测这个方向不算新了,之前的基准用实体流行度或语料频率来定义"长尾",考的是"模型记不记得住冷门事实"。但它们有个共同假设:每个问题只有一个标准答案。知识冲突(knowledge conflict)方向的基准倒是研究分歧,但基本都是开卷设定——把互相矛盾的段落直接喂给模型,考的是阅读理解和多跳推理,跟模型自己记没记住没关系。

你想想看,这两类基准合在一起,恰好漏掉了一个问题:闭卷状态下,模型的参数化记忆里到底有没有同时存住一个事实的多个版本?

这个问题的实际意义比看上去大。现实中大量长尾事实本来就没有唯一答案——不同来源记载不同的日期、不同的票数、不同的死因。模型如果只记住了主流版本,回答时言之凿凿地给出"那个"答案,用户根本无从察觉它漏了东西。这比幻觉更隐蔽,因为幻觉至少内容是错的,而这种"片面的正确"很难被发现。

🏗️ 方法核心:把被扔掉的数据变成探针

ElephantBench 的构建思路里有个让我眼前一亮的反转。

常规数据筛选是留下高质量数据、扔掉低质量数据。这篇论文反着来:专门去翻被 DCLM fastText 质量过滤器筛掉的那部分语料 \(D_{low}\)。为什么?因为标准过滤会保留下来的高频事实,模型大概率已经见烂了;而被筛掉的低曝光文档里,才藏着真正能考验参数化记忆的长尾知识。这些文档在预训练里也不太可能被定向上采样——考它们,才知道模型是真记住了还是蒙对的。

ElephantBench 总体框架

图 2:ElephantBench 总览。(a) 从低曝光网页文档中发现并验证知识冲突,转成 1,094 道闭卷 QA;(b) 每道题包含两个各自有源可溯的说法(如特蕾莎修女生日的 26 日 vs 27 日);(c) 探针从两个维度诊断认知近视——长尾知识是否留住、跨源记忆是否完整。

整个流水线分三步走:

第一步是建文档图,但不能蛮干。\(D_{low}\) 里每篇文档当节点,朴素做法是让 LLM 两两判断 \(O(n^2)\) 对文档的关系,成本直接爆炸。作者的解法是先粗后细:用 Qwen3.6-27B 按 SuperGPQA taxonomy 给每篇文档打知识点标签,同簇内两两配对;再用 T-NER 抽实体和事件提及,建倒排索引,把跨簇但共享实体的文档对也捞回来。只在候选对上跑边分类,每对打 support / conflict / none 三标签之一。这一步把图构建成本压到了可承受范围,也是这篇论文自称"可复用"的底气——任何低曝光语料都能套这套流程。

第二步是从冲突边生成题目。 对每条 conflict 边,把两个端点加上各自的 support 邻居抽成一个局部子图,让 GPT-5.6-Sol 看着子图结构和全文生成 QA。每道题配一个参考答案集合 \(\mathcal{A}=\{v_i\}\)\(k \geq 2\)),每个答案都要能追溯到具体文档的证据片段。还有个细节挺讲究:每道题生成两种问法——直接点名的 named-entity 版和用至少两个属性描述的 clue-based 版,共享同一答案集,用来隔离"问法"这个变量。

第三步是三重验证,这是整个 benchmark 可信度的根基。 LLM 先验证每个答案确实被子图里的文档显式支持;然后一个带 WebSearch 和 WebFetch 的 agent(底层用 GLM-5.2)独立去公网找权威来源(比如 Wikipedia)给两边说法都找佐证;最后人工审核,剔除实体错配、答案无支撑、答案泄露进题干等问题。从 4,127 条冲突边、8,254 道候选题一路筛下来,只剩 1,094 道。这个淘汰率说明他们没在凑数。

评测是闭卷的:模型只拿到问题,没有来源、没有检索、没有工具。判分用 LLM-as-a-judge(GPT-5.6-Sol),给三档结果——完整召回 \(C\)(所有参考答案都答对且无错误)、部分召回 \(P\)(答出至少一个但不全)、失败 \(F\)(一个没答中或答错)。另外定义了一个条件完整度:

\[K=\frac{N_C}{N_C+N_P}=\frac{C}{C+P}\]

这个 \(K\) 设计得很妙:在"至少答出点什么"的响应里,单独看完整性。它把"根本不记得这个事实"和"记得但漏了一半"两种失败模式拆开了。

题目领域分布

图 3:1,094 道题横跨 22 个知识领域。最大的"新闻与公共信息"占 39.4%,其余 16 个小领域合计 23.2%。

📊 实验结果:答得出,但答不全

先看主表。32 个模型(26 开源 + 6 闭源),默认开推理、effort 拉满。挑代表性的几行:

模型 完整召回 C↑ 部分召回 P↓ 失败 F↓ 条件完整度 K↑
Kimi-K3 52.38 45.25 2.38 53.65
Gemini-3.1-Pro 50.37 47.44 2.19 51.50
GPT-5.5 50.18 47.17 2.65 51.55
Claude-Opus-4.8 44.15 50.46 5.39 46.67
Qwen3.5-397B 32.27 59.23 8.50 35.26
Qwen3.5-35B 21.02 55.94 23.03 27.32
Qwen3.5-2B 1.65 17.00 81.35 8.82

这张表最值得琢磨的不是谁第一,而是前三名的 \(F\) 值:2.19% 到 2.65%。也就是说,顶级模型几乎从不"完全不知道"这些长尾事实——它们总能答出至少一种说法。但 \(P\) 高达 45% 以上。主导性的失败模式不是遗忘,是漏答

这就是标题里"认知近视"的实锤:大象就在记忆里,但模型只摸到了一条腿。

规模有用,但不根治。 Qwen3.5 家族从 2B 涨到 397B,\(C\) 从 1.65% 爬到 32.27%,\(F\) 从 81.35% 降到 8.50%——可 \(P\) 同时从 17.00% 涨到 59.23%。参数变多让模型"记得更多事实",但记住的那部分里,不完整的比例反而更高了。

开源家族内规模趋势

图 4:开源模型家族内的 scaling 曲线。实线是完整召回 \(C\),虚线是部分召回 \(P\)——注意虚线始终在实线上方,且随规模一起涨。

推理模式是把双刃剑。 开推理对强模型增益明显:GPT-5.6-Sol 涨 13.99 个百分点,GPT-OSS-120B 涨 12.89 个,Hy3 涨 10.60 个。但看到 Gemini-3.1-Pro 只涨 0.27 个点的时候,再往下看 Qwen3.5 小模型的数据,我愣了一下:9B 到 397B 开推理涨 0.73 到 4.39 个点,而 2B 和 4B 开推理反而了 0.64 和 0.37 个点。论文附录里给了具体案例:小模型一思考,容易把其中一种说法当成"共识",然后理直气壮地把另一种略掉——推理把完整召回变成了部分召回。

推理模式对完整召回的影响

图 5:开关推理对 \(C\) 的影响。深灰是关推理,浅蓝是开推理。增益高度不均:有的模型涨 14 个点,有的几乎不动。

跨模型 oracle 揭示了集体盲区。 把模型贪心组队,从 Kimi-K3 出发逐个加入提升最大的模型,32 个配置全上,\(C\) 从 52.4% 拉到 81.2%,\(F\) 直接清零——所有题加在一起,总有一个模型能答出点什么。但还有 206 道题(18.8%),没有任何一个模型能凑齐所有说法。这 206 道就是整个模型族群的共享盲区,附录里给了四个案例:被更正的票数、死因的冲突报道、刑期的不同解读、发行日期的地区范围——全都双源可验证,全都没人答全。

跨模型 oracle 覆盖曲线

图 9:贪心扩充 oracle 模型池的召回构成。23 个配置后饱和在 81.2%,剩下 18.7% 的黄色段(部分召回)怎么都啃不动。

🔬 最有价值的分析:锅在语料的曝光失衡

这部分是我觉得全文最值钱的地方。作者做了件聪明事:既然各家预训练语料不公开,就用他们手里这个低曝光语料库做观测代理——数每个冲突两边各自有多少篇文档支持,多的一侧记 \(N_{maj}\),少的一侧记 \(N_{min}\)

两个互补的现象。曝光差距 \(N_{maj}-N_{min}\) 越大,部分召回率越高(从 41.0% 爬到 51.6%)——模型更容易只记住主流说法。反过来,少数派曝光 \(N_{min}\) 越大,完整召回越高、部分召回越低(58.4% 一路降到 45% 附近)。

曝光差距与召回构成

少数派曝光与召回构成

图 7:上:按两侧支持文档数之差分桶,差距越大黄色段(只记住主流说法)越大;下:按少数派曝光 \(N_{min}\) 分桶,少数派见得越多,完整召回(蓝色段)越高。

更狠的是联合回归,把两边的效应拆开(对数化、标准化后各加 1 个标准差):

曝光侧 ΔC ΔP ΔF
主流侧 +1σ 降 4.01 个点 涨 14.18 个点 降 10.17 个点
少数派侧 +1σ 涨 15.13 个点 降 15.41 个点 基本不变

读法很直白:主流侧曝光决定模型"记不记得这个事实",少数派曝光决定模型"记不记得全"。 给主流说法加曝光,效果是把失败变成半对;给少数派加曝光,才能把半对变成全对。这对数据配比是个相当直接的启示:想让模型记忆完整,堆主流数据没用,得保住少数派来源的曝光。

当然这里要泼点冷水:论文自己也承认这是观测性关联,不是因果。低曝光语料的分布跟各家真实的预训练混合未必一致。不过作为"探针反过来指导数据治理"的思路,方向是对的。

冲突机制的难度差异也很有意思。 作者把冲突分四类:计量/估计约定类最好答(C=38.9%),范围/定义差异次之(30.5%),时间变更类和直接报道分歧最难(18.3% 和 18.0%),部分召回都在 56% 以上。

不同冲突机制的召回表现

图 15:四类冲突机制的召回构成(32 模型平均)。计量类冲突还算友好,时间边界和报道分歧类就是重灾区。另外推理对时间类冲突增益最大,平均涨 4.12 个点(Wilcoxon p=0.011),其他类不显著。

还有两个值得一提的工程结论。一是问法鲁棒性:named-entity 和 clue-based 两种问法在 8 个前沿模型上的完整召回差平均只有 0.65 个百分点(p=0.470),说明测的不是字面形式。二是 PPL 可以当廉价代理:Qwen3.6-27B 上,高 PPL 桶里完整回答更少、失败更多,跟生成式评测的结果对齐得很好——跑不起大规模生成评测的时候,算个条件困惑度就能摸底。另外判分 judge 跟人类标注的一致率 92.22%、Cohen's κ 0.854,温度消融显示 T=0 和 T=1 差别在 1 个百分点上下,评测本身还算稳。

🤔 我的判断

先说亮点。这个 benchmark 的设计哲学我很认:它不追求"又一个排行榜",而是把一种模糊的失败模式(记忆不完整)拆成了可测量的指标(C/P/F/K),还做了归因(曝光不对称)。三重验证加 74% 的淘汰率,质量比很多拍脑袋构造的 benchmark 扎实。pipeline 本身——知识点聚类加实体倒排索引压候选空间、LLM 只做边分类——是个可复用的工程资产,换个语料库就能再造一个探针。

再说几个让我皱眉的地方。

生成和判分同源的问题。 题目是 GPT-5.6-Sol 生成的,判分也是 GPT-5.6-Sol。虽然人类一致性实验(92.22% 一致率)给了背书,但生成模型对答案表达的偏好会不会渗入评分标准,这个没法完全排除。更微妙的是,GPT-5.6-Sol 自己也在被评测的 32 个模型里,成绩还排不进前三——当裁判又当运动员,虽然没有直接证据表明有偏,但下次换个独立 judge 复测一遍会更让人放心。

52.4% 这个天花板到底有多硬的约束? 闭卷、单次生成、不开工具——这个设定本身就是最严苛的。现实部署里模型可以采样多次、可以开检索。这个数测的是参数化记忆的纯度,不是系统能力的天花板,读者别拿去直接推导"RAG 没用"。

跟同期工作的位置。 多答案 QA 这个坑不算无人区——AmbigQA 枚举歧义解释,SituatedQA 考条件化答案,DYNAMICQA 从 Wikipedia 编辑历史挖争议事实。ElephantBench 的差异化在于:所有说法针对同一主语-属性对、源自自然发生的网络分歧、且评测时完全藏起来源。这个组合确实是新的,但说它"开创"了分歧知识评测就过了,它更像是把几条线拧成了一股。

💡 工程启发

如果你在做数据配比,那组回归系数值得抄下来贴在工位上:少数派来源的曝光才是记忆完整性的杠杆,主流数据堆再多也只是把"不知道"变成"知道一半"。如果你在搭评测,C/P/F 三分加条件完整度 \(K\) 的拆法,比单一准确率信息量大得多,而且 PPL 代理能帮你省掉大量生成和判分开销。如果你发现自家模型开推理后某些任务反而变差——别急着怀疑人生,小模型推理时"认定共识、丢掉异见"的退化模式,这篇论文给了具体案例。

最后说句实话:这个 benchmark 规模还不大(1,094 题、22 个领域),曝光分析也只是关联不是因果。但它指出的问题是真问题——模型回答得越流利,"漏掉的那一半"就越难被发现。52.4% 这个数,大概会挂在不少模型卡上,成为下一代模型绕不过去的一栏。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我