不动模型权重,也能给万亿参数的 Kimi 2.6 装上"科学家的大脑开关"
上周刷到一篇让我停下来的论文。不是因为它又刷了什么榜——恰恰相反,它一个 benchmark 分数都没报。它干的事是:从真实科学家做研究时的操作痕迹里,提取出一种叫"科学判断力"的东西,然后把它变成一组可以直接注入模型残差流的方向向量,在推理时动态地切换模型的"认知档位"——该探索时探索,该收敛时收敛,该质疑时质疑。
更夸张的是落地结果:用这套方法搭的自主研究系统 Columbus-1,在 Linux 蓝牙协议栈 BlueZ 里找到了 8 个经独立实验室复现的漏洞,其中一个是零点击远程代码执行;还主导设计了一枚 10 英尺长、用不可调推力的固体发动机实现动力着陆的火箭。说实话,看到"零点击 RCE"和"固体火箭动力着陆"出现在同一篇论文里的时候,我的第一反应是:这公司是不是在写营销稿?但把方法部分读完,我觉得底层那套可解释性分析是认真的,值得细聊。
核心摘要
这篇论文解决的是一个越来越扎眼的问题:模型会执行科学工作流,但不会"做科学"——论文引用的一项覆盖 25000 多次科学智能体运行的研究显示,68% 的轨迹里智能体无视了已有证据,被反驳后真正修正信念的只有 26%。作者的思路是:科学判断力不是从论文文本里学的(论文只记录最终路径,不记录被否决的假设和失败的实验),得从科学家真实研究过程的交互数据里提取。他们在自己的 AI Co-Scientist 平台上收集科学家干预记录,构造对比对,用激活转向的方法在冻结的万亿参数 Kimi 2.6 上定位出一个中层控制面(第 36、38、42、48 层),然后做了一个推理时闭环控制器 Metacognitive Steering(MCS),在三种认知状态、五种干预模式间动态路由。我的评价:可解释性分析部分(残差对齐 + 冻结权重子空间对齐 + 跨层 SVD 三重证据收敛)是这篇论文最扎实的地方;行为评估偏定性,真实世界成果震撼但属于公司自报,需要第三方持续验证。
论文信息
- 标题:Metacognitive Steering: Learning the Structure of Scientific Judgment
- 作者:Vincent Karpf, Joseph Reth, Eike Gerhardt, Audrey Wang, Anna Butz, Jiehao Xing, Jialing Song, Larry Callahan
- 机构:Autopoiesis Sciences
- 链接:https://arxiv.org/abs/2609.16245 (arXiv:2609.16245v1 [cs.AI],2026 年 9 月 14 日)
🎯 问题动机:模型继承的是科学的"成品",不是科学的"过程"
先聊一个我觉得这篇论文点得很准的观察。
现在训练推理模型的主流范式是 RLVR——可验证奖励的强化学习。数学能验证,代码能执行,所以这两个领域卷得飞起。但科学发现坐在这条"可验证性光谱"的最远端:假设提出来很容易,证实它可能要花好几年;一次实验失败,到底是假设错了还是有个没建模的变量在捣乱,结果本身不会告诉你。
更要命的是数据层面的缺口。一篇发表的论文记录的是"最终走通的那条路",不记录被放弃的竞争假设、方向反转、以及那些深夜里的自我怀疑。模型从文本里学到的是"不确定性已经消解之后科学是怎么被写出来的",而不是"答案还未知时科学是怎么被做出来的"。作者把这个叫监督缺口(supervision gap)——不是模型能力不够,是根本没有捕获"在不确定性下推理"的训练数据。
这个判断我自己是买账的。之前做长程 Agent 项目时最头疼的就不是单步推理质量,而是模型不会在证据变化时切换策略——它会一条路走到黑,把最初的假设当成信仰来捍卫。论文引用的那组数据(68% 无视证据、26% 修正信念)跟这个体感完全对得上。
那怎么办?作者的答案是:既然文本里没有,就从科学家的操作痕迹里挖。
📖 数据:科学家的"反悔"和"搁置"才是金矿
他们建了一个 AI Co-Scientist 平台,让经过认证的科学家在上面做真实的长程研究,系统负责查文献、生成假设、分析结果,而交互过程恰好记录下了发表文献会删掉的东西——运动中的科学判断。
一个科学家可能明确要求系统"挑战一下这个假设";也可能无视某个结果、 revisit 另一个、收窄假设、否决一个看似合理的解释、或者在证据很弱的时候选择继续。这些决策在长程视野下暴露出科学家关注什么、不信任什么、认为什么值得追。
从这些会话里,他们构造了一个专有的判断数据集,每条干预用 LLM 分类管线归入六类:假设生成/修正、证据间张力识别、战略转向、假设浮现、结果解读、实验设计。然后是关键一步——构造对比对:保持科学上下文完全不变,只改变科学家的认知姿态(探索 vs 收敛、质疑 vs 接受),用 LLM 验证器筛掉内容重叠度低的对子。保留下来的真对子,在词和 bigram 的 TF-IDF 余弦相似度上是随机重配对的 3.6 倍(单侧置换检验 p = 0.001,bootstrap 95% CI 3.3–3.8)。也就是说,对子里的差异确实不是"聊的话题不同",而是"思考方式不同"。
这个数据构造思路其实沿用了激活转向领域的标准做法(对比对提取行为方向),但把它用在了"认知姿态"这种比"诚实/有害"细得多的对象上。说实话,这是我觉得全文最有野心的一步——数据本身不公开,你没法独立验证它的质量,这是后话。
🧠 方法核心:先找到"判断力写在哪一层",再写一个读状态、打方向的控制器
三重证据定位控制面
实验对象是 Kimi 2.6——DeepSeek-V3 式架构,61 层,残差流宽度 \(d = 7168\),64 个 MLA 头,万亿参数 MoE,每 token 激活约 32B。
对每个对比对、每一层 \(\ell\),计算残差激活差:
这里有个很实在的坑:所有对子都共享一个"有干预发生了"的通用成分——因为每条 rollout 都被要求改变了点什么。不除掉它,对齐分析会在每一层都"重新发现"这个伪信号。所以他们用了一个受 LEACE 启发的秩一概念擦除投影:
其中 \(c\) 是归一化的平均干预方向。擦掉的是"干预存在"本身,剩下的才是"模型被要求以什么方式思考"的变异。这个细节我很欣赏——很多 steering 论文就死在这种共享成分上,结论全是 artifact。
然后是三重独立证据:
证据一:残差流对齐矩阵。\(A_{ij} = \cos(u^{(i)}, v^{(j)})\),衡量第 \(i\) 层写入的方向能被第 \(j\) 层读到多少。如果认知控制是弥散的,对齐质量会平铺在 61×61 矩阵上。实际不是——第 36 到 38 行和第 48 行出现明显的水平亮带,其平均出向余弦超过置换零分布的 95 分位。

图1:61×61 的层间余弦对齐矩阵。被黑框标出的第 36–38 行、第 48 行是"写入枢纽"——这些层写下的认知方向会被后面很多层持续读取。
证据二:冻结注意力权重的子空间对齐。这个分析完全不碰判断数据,只看权重。MLA 架构下第 \(i\) 层通过 \(W_O^{(i)}\) 写入,第 \(j\) 层通过查询下投影 \(W_{Qa}^{(j)}\) 读取。用 top-50 奇异向量构造写入/读取子空间,算:
零分布是 200 对 Haar 随机 50 维子空间,95 分位只有 0.170,而中层亮带上的观测值是零分布的好几倍。第 36、38 层再次作为写入枢纽出现,第 42 层则是注意力侧的读取枢纽。

图2:纯权重分析(不碰任何激活数据)收敛到同一深度区间。两个互补证据指向同一位置,说明不是在自己数据里自嗨。
证据三:跨层 SVD。把第 36、38、42、48 层的擦除后差向量拼接成 \(X \in \mathbb{R}^{N_{\text{pairs}} \times 4d}\) 做 SVD,跟"打乱跨层配对、保留层内结构"的置换零分布(1000 次采样)比:前三个主成分超过零分布的 97.5 分位,信号/零分布比约 1.55、1.3、1.25,而且堆叠谱超过任何单层谱。

图3:左图显示四层堆叠谱(青色粗线)高于任何单层谱;右图显示前三个奇异值显著越过零分布 97.5 分位线。认知姿态的变异是跨层耦合的低维结构,不是各层独立噪声。
三个分析探的是同一个对象的不同侧面,却收敛到同一个深度区间:36、38 层确立推理配置,42 层协调注意力如何读它,48 层承载输出前最强的晚期激活签名。控制面就是这四层。
三种认知状态、五种干预模式
接下来是状态发现。在第 36 层的未差分激活上(代表转向前的研究上下文)做标准化、PCA 到 50 维、k-means 聚类,用轮廓系数选簇数:三状态方案得分 0.457,次优值只有 0.304。在第 48 层对比差向量上独立聚类得到干预模式,初识六个、剔除一个弥散模式后保留五个。
注意,两边聚类时都不喂标签,功能命名是科学家事后看推理轨迹和干预效果才标上去的:
| 控制 regime | 功能行为 | 质心几何 |
|---|---|---|
| Deliberative(审慎) | 探索:广泛搜索、投机性分支、抵抗过早承诺 | 主推理流形 |
| Methodical(条理) | 收敛:控制变量、指标、证伪标准、预算感知执行 | 与审慎态约 85°,近乎正交 |
| Challenging(质疑) | 审视:约束执行、错误检测、过度延伸后的反转 | 与其余两者成 130°–142°,方向相反 |
这个几何直接决定了路由策略:条理态和审慎态近正交,质疑态跟两者都对冲——所以控制器在 regime 间离散切换,只在 regime 内的兼容模式间做混合。质疑态不是"另一种思考",而是刹车。
状态到模式的映射锐得有点惊人:条理态几乎确定性地映射到单一模式,审慎态和质疑态各拆成两个模式;独立聚出的状态分配和模式分配之间,Cramér's V 达到 0.993——接近一一对应。

图5:左图是第 36 层激活的三状态聚类(审慎/条理/质疑),右图是第 48 层转向方向的五模式聚类,颜色按状态着色。两个空间独立聚类却严丝合缝对应。
还有一个稀疏性发现:探索性五折分析里,只用 10 个精选神经元就能以约 99% 的准确率恢复三种认知状态。

图6:左——神经元 6865 的激活分布在三种状态下明显可分;中——状态到模式的映射矩阵(条理态 100% 走 M0);右——状态内转向预测的交叉验证准确率 84%–100%。
推理时的闭环控制器
推理时的流程是:在第一个生成 token 位置读第 36 层残差,一个紧凑的神经控制器判定当前 regime,状态专属的小预测器给兼容模式分配概率。第 \(\ell\) 层的干预是模式方向的加权混合:
生成过程中的残差更新为:
转向强度依赖所选模式,当状态读出落在训练分布外时会衰减。每次响应路由一次,解码期间施加,不算梯度、不动参数。
跟之前的动态转向工作比,规模跳了一个数量级——此前 PDS、DMS、CLAS、A-LQR 最多在 70B 上验证,SVF 在 14B,DAC、SADI 在 7B,而 MCS 直接在 1T 总参数的 MoE 上跑。

图4:已有动态激活转向方法的验证规模集中在 7B–70B,MCS 把演示规模推到了万亿参数。
🔬 行为分析:转向后的模型"会反悔了"
行为对比用了两个任务。第一个是闭环推理研究任务(带网络搜索、代码执行、笔记工具):基线 Kimi 2.6 的探索是前置的——开头浅尝几个分支,然后锁定一条路径走到底,全程没有显式修剪过任何已发展的方案。转向后的轨迹形状明显不同:工作流切换更多、且持续到更后期,反复回到竞争方案上做比较;然后进入一个较长的深度检验期(条理态集中),最终因为"直接优化稀疏状态检测器可能诱发表征博弈"这个理由显式修剪了该方案,把幸存路径从第一性原理重构,合并成带明确证伪标准的提案。

图7:左(转向,40 步)vs 右(基线,38 步)。转向轨迹在工作流层面切换更频繁且持续到后期,并出现显式修剪;基线早早锁定单一路径。
第二个任务更硬核:设计一枚只用固体火箭发动机实现动力着陆的火箭。难点是原理性的——固体发动机点火后推力曲线基本固定,不能节流不能关机。基线像个能干但直线思维的工程师:早早选了自旋回收方案一路做到底。转向轨迹几乎全程保持审慎态,同时维持着陆发动机、下降姿态、航电、整车设计、认证、项目规划六条并行工作流,在约束跨域传播时反复 revisit 决策,只在必须固化流程时短暂进入条理态。

图8:左(转向,90 步)保持审慎探索并维护六条并行工作流;右(基线,66 步)约 20 步后收敛到单一自旋回收分支。火箭设计可以局部正确而全局不可能——这正是需要维持全局模型的问题。
说实话,这两组轨迹图是定性的"形状对比",没有量化指标。作者自己也承认:这不证明每个转向后的结论都对,只证明认知控制把过程推向了预期的方向——持续探索、深度检验、显式修剪、果断综合。这个自我设限的表述是诚实的,但也意味着行为层面的证据强度有限。
🚀 真实世界验证:Columbus-1 的两个战场
他们把 MCS 装进了一个叫 Columbus-1 的自主研究系统:一个 32B 的偏置策略模型(用同一份判断数据训练)负责层级规划和探索,往主推理模型的上下文里注入"战略提示";一个语义记忆图跟踪假设、证据、决策、教训、方法和事实,用来消解矛盾、反思假设、从因果链生成新假设。

图9:Columbus-1 架构。Goal 提供软硬约束给 bias policy,后者与 steered model 互传 nudge 和 context,两者共享持久语义记忆,模型侧挂搜索/代码/数据/CAD/仿真/人类专家六类工具。
战场一:BlueZ 漏洞挖掘。 动机来自与纽约网络安全实验室 Xchg Labs 的交流——AI 安全工具在模式坍塌,反复找到同一类漏洞。蓝牙 2025 年出货量超 54 亿台设备,BlueZ 是 Linux 官方蓝牙协议栈,跑在包括医疗设备网关在内的海量系统上。Columbus-1 找到 10 个崩溃点,对应 8 个确认的、攻击者可触达的发现,Xchg Labs 针对 BlueZ 5.86 独立重建 PoC 并复现。其中最狠的一个:扫描附近设备时,BlueZ 把攻击者控制的广播名拷进特权守护进程 bluetoothd 里一个 250 字节的固定栈缓冲区并写穿末尾——输入来自蓝牙广播数据,认证前、配对前、目标同意任何事情之前。零点击、全链路远程代码执行。披露已于 2026 年 7 月 6 日发给 BlueZ 维护者。
战场二:固体火箭动力着陆。 10 英尺火箭,只用商用 G 级固体发动机,常规发射、动力着陆。Columbus-1 拿了预算、采购约束和压缩工期,负责整个工程项目:选架构、生成参数化 CAD、出制造级 STL/STEP/DXF 文件,通过 iMessage 跟制造团队闭环(人类动手打印组装,它维护系统级模型)。仿真用 OpenRocket 上升模型耦合闭环六自由度着陆仿真。过程中它自主发现了两条反直觉的设计规则:最小化触地速度是错误目标(残余冲量足够大时火箭会被自己的发动机二次发射),得联合优化到达速度和剩余冲量;姿态必须在终端动力段之前就稳定,发动机分级应由预测触地时间和剩余冲量驱动而非固定高度阈值。由此产生了"阶梯点火走廊"——跟踪高度-下降速度的目标关系,偏离走廊时逐个小增量点火,用离散点火逼近节流。一位 SpaceX 推进工程师和一位航电 PhD 独立审查了仿真环境、假设和结果,未要求纠正性干预。

图10:着陆仿真界面。主刹车阶段高度 41.9 米、垂直速度 -28.46 m/s,19 台发动机中 7 台点火,右下角是发动机舱的实时点火布局。阶梯点火用离散点火事件逼近不可节流的固体发动机推力调节。
🤔 我的判断
先说亮点。
可解释性部分的方法论是教科书级的认真。 共享成分擦除、三重独立证据互验、每个统计量都配置换零分布——这个标准比 steering 领域的平均水平高出一截。特别是证据二完全不碰自己的判断数据、纯从冻结权重出发还收敛到同一深度区间,这一手基本排除了"在自己数据里找自己信号"的循环论证。Cramér's V = 0.993 的状态-模式对应,如果这个数经得起复现,说明"认知状态"在万亿模型里真的是一个低维、稀疏可读的客观结构,而不是聚类算法强行切出来的。
问题选得好。 "模型会执行科学流程但不会做科学"是真实痛点,68%/26% 那组数字我看完记了很久。
再说让我皱眉的地方。
数据是黑盒。 整个方法的地基是那个专有的科学家交互数据集,不公开、不可审计。六类干预的分类质量靠 LLM 管线加人工子集迭代优化,这个链条里的每一步都可能引入系统性偏差。论文的价值主张"过程数据比结果数据重要"我很认同,但正因如此,数据本身的代表性(哪些学科、多少科学家、什么水平)需要远比现在详细的披露。
行为评估全是定性的。 两个轨迹对比靠"看图说话",没有盲评、没有量化 rubric 打分的报表(论文提到开发了 LLM judge 但没给数据)。真实世界成果里,BlueZ 漏洞有独立实验室复现,这个算硬证据;但"国家级别能力"这种修辞、以及火箭"数周内从矛盾约束到在制硬件"的叙事,说到底还是公司公告,物理首飞还没发生。作者自己在 Limitations 里也承认火箭只在仿真中验证过。
跨模型迁移完全是开放问题。 控制面定位在 Kimi 2.6 的特定四层,换个模型全套都要重做。论文最后也坦白:这是控制范式的初步演示,不是普适迁移的证据。这个坦诚值得肯定,但也意味着 MCS 目前是"一个模型一套定制控制器"的重工程路线。
跟同期工作比定位:动态激活转向这条线(DAC、SADI、SVF、PDS 等)过去两年一直在往"情境条件化"走,MCS 的独特贡献不在于"动态"本身,而在于动态路由的语义来自真实专家的过程数据,而不是人造的行为标签,以及把验证规模推到了万亿。是工程整合还是底层突破?我的判断:数据资产 + 严肃的可解释性工程 + 系统集成,三者都扎实,但科学上最大的赌注——"科学判断力是可蒸馏、可迁移的低维结构"——目前只有一个模型、一个私有数据集上的证据。
📝 收尾
如果你在做长程 Agent 或 AI for Science,这篇论文有两样东西值得拿走:一是"从专家操作痕迹构造对比对"的数据思路,二是"共享成分擦除 + 多重零分布检验"的 steering 分析范式。至于 Columbus-1 的传奇故事,建议保持关注但保留判断——等那枚火箭真的用固体发动机站着落地,再开香槟不迟。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我