给大模型的"元认知"泼一盆冷水:严格神经反馈下,LLM 根本控制不了自己的内部表征

你有没有想过一个问题:如果大模型真的能"感觉到"自己脑子里在想什么,并且能主动调整——那我们现在依赖的那些安全监控手段,比如读它的思维链、用 probe 探测它的内部激活,是不是全都白搭了?

去年 NeurIPS 上有一篇论文(Ji-An et al., 2025)报告了一个相当耸动的结论:LLM 能够监控并控制自己的内部激活。如果这是真的,AI 安全的很多根基都要动摇。但早稻田大学和东京大学的几位研究者看完这篇论文后皱起了眉头——他们发现那个实验里有个不算小、但很要命的漏洞。于是他们重新设计了一个更严格的实验,结果相当打脸:在排除掉所有投机取巧的可能性之后,模型并没有表现出可靠的控制能力

这篇论文(arXiv:2609.00904)就是那种我特别喜欢的"验尸报告"型工作——不造新轮子,专门检验别人造的轮子是不是真的能转。

核心摘要

LLM 能否控制自己的内部表征,这个问题同时关系到机器元认知和 AI 安全。此前 Ji-An et al. 把认知神经科学里的神经反馈(neurofeedback)范式搬到 LLM 上,报告模型能控制内部激活。但这篇论文指出:那个实验的控制目标不满足特权访问(privileged access)要求——第三方只看 prompt 和输出文本就能猜出模型在被要求控制什么,所以观察到的"控制"可能只是模型在文本层面玩了花招。作者重新设计了 in-context neurofeedback(ICN)范式:强制模型每轮输出同一句话,只给它一个 0-100 的标量分数反馈,让它通过试错去推高分数。在这个严格设定下,4 个开源模型 × 3 个数据集共 120 个检验里只有 45 个显著,而且即便显著的设定,效应量也很小(Cohen's d 和 h 均小于 0.5)。结论很直白:当前 LLM 对特权内部表征的控制能力,可能远低于先前工作暗示的水平。

论文信息

  • 标题:In-Context Neurofeedback: Can LLMs Control Their Internal Representations through Privileged Access?
  • 作者:Koshiro Aoki(早稻田大学)、Ryota Takatsuki(萨塞克斯大学意识科学中心 / AI Alignment Network)、Gouki Minegishi(东京大学)、Yusuke Haruki(东京大学)、Daisuke Kawahara(早稻田大学)
  • 链接:https://arxiv.org/abs/2609.00904
  • 代码:https://github.com/AokiKoshiro/in-context-neurofeedback
  • 发表时间:2026 年 9 月 1 日

🎯 问题动机:那个"LLM 能控制自己大脑"的实验,漏了一个关键条件

先交代一下背景。神经反馈在人类认知神经科学里是个成熟范式:给被试实时看自己脑活动算出来的分数(比如屏幕上圆圈的大小),不告诉他们分数怎么算的,让他们自己摸索着把分数推高。如果训练一段时间后脑活动模式真的改变了,说明人能通过内隐学习调节自己的神经活动。这个范式有个专门的缩写叫 DecNef(decoded neurofeedback)。

Ji-An et al. 2025 年那篇 NeurIPS 论文把这个范式搬到了 LLM 上:给模型看一批带标签的句子(标签来自内部激活上训练的 probe,比如区分"道德上可接受/不可接受"),然后让模型生成模仿某个标签的新句子。结果发现,模型模仿 label 1 时 probe 输出确实比模仿 label 0 时高——于是他们宣布 LLM 能控制自己的内部表征。

说实话我第一次看到那篇论文的时候就觉得哪里不对。现在这篇论文把"哪里不对"讲得清清楚楚:控制目标不是特权的

"特权访问"这个概念来自心灵哲学。你感到饥饿,不需要观察自己的行为就知道自己饿了;但别人只能从你的表情、言语、生理指标去推断。你对自己心理状态有一种外人拿不到的访问通道——这就是 privileged access。一个合格的元认知实验,必须让控制目标满足这个条件:第三方光看输入输出,推不出来模型在被要求控制什么。

Ji-An et al. 的实验恰恰不满足。想想看,模型被要求"生成像 label 1 那样的句子",它只要写出"help"、"kind"这类明显亲社会的词就行了——这些 token 本身就会在 probe 的"道德"方向上打出很强的投影。一个外人拿着同样的 prompt 和输出,也能算出 probe 会往哪边跑。所以那个实验根本无法区分两种机制:模型是真的访问并调节了内部状态(元认知机制),还是仅仅在文本表层做了文章(琐碎机制,trivial mechanism)。

等等,你可能会说:Ji-An et al. 不是还有个 implicit control 设定吗,用 prefill 强制固定输出 token,这总该算内部控制了吧?论文在附录里也把这个口子堵上了:模型在 few-shot 示例阶段看到标签模式后,完全可能在内部提前计划好要生成道德相关内容,prefill token 处的隐藏状态反映的是这个"计划中的输出",而不是被覆写进去的文本。probe 检测到的偏移,用生成计划就能解释。

这个质疑不是孤例。Song et al. 2025 年就干过类似的事:之前有研究说 LLM 能内省自己的采样温度,Song 他们发现模型报告的温度其实追踪的是生成文本的风格——让它写"疯狂"的句子它就报高温,写"事实性"句子就报低温。同样的 prompt 给外部观察者,推断准确率一点不差。所谓内省,可能只是读自己的文字猜的。

🏗️ 方法核心:把 output 钉死,只给一个分数

这篇论文的方案叫 in-context neurofeedback(ICN),设计思路一句话就能说清:让模型每轮必须输出完全相同的一句话,只给它标量分数反馈。这样文本表层就被锁死了,想提高分数只能动"脑子"。

图1:ICN 实验流程总览

图1:ICN 的六步流程。Step 1 指示模型玩"分数最大化游戏"且每轮只能输出指定固定句子(图中例子是 "The movie is based on a book.");Step 2 提取隐藏层激活;Step 3 用预训练 probe 把激活转成标量分数;Step 4 把分数反馈给模型;Step 5 模型继续输出同一句子并尝试提分;Step 6 评估内部表征和自报告的变化。整个流程严格对应人类 DecNef 实验的结构。

几个关键设计值得展开说:

固定句子对应人类实验里的视觉刺激。人类 DecNef 里,被试每轮看的是同一张人脸图片——图片是固定的,但被试照样能学会调节脑活动。所以"输出被固定"并不构成对 LLM 的额外苛责,这在人类实验里就是标准做法。作者在讨论里专门花了 6.3 一节论证这一点,因为审稿人一定会问:你的负面结果是不是纯粹因为固定输出导致的?他们的回答是:如果固定输出完全决定了内部表征、模型再怎么努力也动不了,那这个发现本身就回答了研究问题——LLM 的内部表征无法通过元认知独立控制。

三种计分条件。probe 输出 label 1 的概率 \(p\),label-1-rewarding 条件下分数 \(s_1 = \lfloor 100p \rfloor\);label-0-rewarding 条件下 \(s_0 = 100 - s_1\);再加一个 random-rewarding 对照组,分数纯随机。如果模型真的能控制内部表征,label-1 条件的 probe 输出应该往上走,label-0 条件应该往下走,随机条件则是基线。

双重评估。除了看 probe 输出的变化(内部评估),还在反馈循环之外问模型"你觉得这个句子是正面还是负面"(行为评估/self-report)。内外两个角度互相印证。

和 Ji-An et al. 的设计对比,差异一目了然(论文 Table 1):

维度 Ji-An et al. 本文 ICN
控制目标 非特权(可从文本推断) 特权(必须内部访问)
固定输出的方式 直接编辑输出(prefill) 通过 prompt 指令
反馈格式 二值标签(0 或 1) 0-100 定量分数
控制轮次 单轮 50 轮
评估方式 仅内部评估 probe 内部评估 + 自报告行为评估

实验配置:4 个模型(Llama-3.1-8B-Instruct、Llama-3.1-70B-Instruct、Qwen3-8B、Qwen3-32B,greedy sampling,Qwen 关闭 thinking 模式),3 个数据集(SST 情感、ETHICS commonsense 道德、True-False 真伪,每个采样 256 个固定句子,True-False 只有 245 句),每个模型取 5 个层深度(0%、25%、50%、75%、100% 分位点),每个 session 跑 50 轮反馈。probe 是带 L2 正则的 logistic 回归,每个"模型×层×数据集"组合用 5000 个激活-标签对训练,正则系数用 leave-one-sentence-out 交叉验证选——这块做得挺规矩的。

🧪 实验结果:45/120 显著,但效应量全是"小"

先看两个预备数字。probe 的平均测试准确率是 73.1%(中层尤其高,接近 90%),说明目标特征确实能从内部表征里线性解码出来——控制的目标在"脑子"里是存在的,不是虚空打靶。固定句子的输出遵从率平均 93.7%,Qwen3-8B 在 True-False 上做到了 100%,最低的 Llama-3.1-70B 在 True-False 上也有 87.8%。实验本身是有效执行的。

图2:probe 测试准确率随层深度的变化

图2:probe 测试准确率沿归一化层深度的分布。四个模型都在中层附近达到峰值(80-90% 区间),输入层和输出层附近较低。这符合"中层编码语义概念"的常见观察。

然后是最关键的图。Llama-3.1-8B 中层(layer 15)在 SST 数据集上,50 轮反馈中 probe 输出的变化:

图3:Llama-3.1-8B 中层 probe 输出随轮次变化

图3:SST 数据集、Llama-3.1-8B 第 15 层,三种计分条件下 probe 输出(正面概率)随反馈轮次的变化。注意看——绿线(label-1-rewarding)、红线(label-0-rewarding)、灰线(random-rewarding)三条线一起从 0.5 附近爬升到 0.8 左右

看到这个图我愣了一下。理论上红线应该往下走才对(label-0 条件下负面才给高分),结果它跟绿线、跟纯随机对照组几乎肩并肩往上爬。这就有意思了:连给随机分数,probe 输出都在涨。这说明驱动 probe 输出变化的主要力量根本不是"模型学会了控制内部表征",而是某种与反馈内容无关的漂移——可能是重复输出同一句话本身就在改变激活分布。

自报告那边稍微好看一点:

图4:Llama-3.1-8B 中层自报告正面比例随轮次变化

图4:同一设定下模型自报告"正面"的比例变化。绿线最终确实高于红线(约 0.7 vs 0.6),方向符合预期,但差距不大,且灰线(随机)也混在一起往上走。

统计检验的结果。作者对 120 个设定(3 数据集 × 4 模型 × 5 层 × 2 指标)做单侧检验,Benjamini-Hochberg 校正控制 FDR,α=0.05。结果 45/120 在预期方向上显著。听起来还行?但分布非常不均:SST 数据集贡献了 24/40,Qwen3-8B 一个模型贡献了 19/30;而 True-False 只有 8/40,Qwen3-32B 只有 6/30。效应不是普遍存在的,它挑模型、挑数据集。

更扎心的是效应量:

图5:三种数据集上各模型的效应量随层深度分布

图5:Figure 5,probe 输出用 Cohen's d、自报告用 Cohen's h 衡量的效应量,横轴是归一化层深度。可以看到绝大多数效应量落在 0 到 0.3 之间,全部小于 0.5,阴影区域(置信区间)大范围跨过 0。

所有效应量都是小效应(d 和 h 均小于 0.5)。即便在那些统计显著的设定里,模型对内部表征的实际影响相对于整体变异也有限。统计显著但效应微小——大样本下的常见剧情,p 值过了门槛,实际意义存疑。

🔬 我的判断

这篇论文最值钱的地方,不是那个负面结果本身,而是它立起来的方法论标杆:检验 LLM 元认知,必须先问一句"第三方能不能从文本推出来"。推得出来,那你测的可能只是文本生成能力换了个马甲。这个 privileged access 的检验标准,我觉得应该成为这个领域的准入门槛——之前 Song et al. 拆穿温度内省那次也是同一个逻辑,但本文把它系统化成了完整的实验范式。

批判性地说几点。

其一,负面结果的解释空间要当心。作者自己也承认,任务成功是"LLM 拥有特权控制能力"的充分条件而非必要条件——模型在这个任务上失败,不能证明它完全没有这种能力。可能是 50 轮反馈不够(人类 DecNef 被试往往训练好几天),可能是 greedy decoding 限制了探索,也可能是 Instruct 模型的对齐训练压制了这类"奇怪"的行为。论文把 scope of claims 划得比较克制,这点是加分的。

其二,那个"三条线一起涨"的现象,论文没有深挖机制。重复输出同一句话为什么会让 SST probe 输出系统性上漂?是激活分布随 context 增长的漂移,还是 probe 本身对这种漂移敏感?搞清楚这个,对设计下一轮实验很重要。我猜想这跟注意力在长重复上下文里的熵变化有关,但这只是直觉,原文没给答案。

其三,Qwen3-8B 贡献了近半数显著结果、Qwen3-32B 却垫底——更大不等于更能控制自己。这个倒挂挺反直觉的,如果坐实了,说明"特权控制"不随通用能力 scale,这对 AI 安全反而是个好消息:前沿模型未必因为更强就更会藏心思。

对工程的启示很实际:如果你在依赖内部 probe 或思维链监控做安全检测,这篇论文是个定心丸——至少当前这一代开源模型,还没展现出通过元认知掩盖内部状态、逃避监控的能力。但这个结论的保质期有限,作者也明说:模型能力进步了就应该重新测。ICN 这套评估协议已经开源,直接拿来当未来模型的"元认知体检"工具,是个现成的用法。

收尾

元认知研究里最贵的错误,就是把"看起来像在思考自己"当成"真的在思考自己"。这篇论文做的事情说到底就一件:把实验里所有能靠文本耍小聪明的通道全部焊死,再看模型还剩多少真本事。答案是——没剩多少。

这不是一篇让人兴奋的论文,但它是一篇让人清醒的论文。这个领域需要更多这样的工作。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我