把"背书"和"做题"拆开的 Mobius:知识推理解耦架构,推理快了近 4 倍

你有没有发现一个挺怪的现象:现在的推理模型,碰到简单问题也要洋洋洒洒写一大段思维链,碰到难题更是动辄几千 token 的"试错-检查-再试错"。token 越烧越多,答案却不一定更对。上周读到上海人工智能实验室 Intern 系列的新论文(arXiv: 2608.14290),他们的诊断让我眼前一亮——问题可能不在模型不够聪明,而在于 Transformer 把"存知识"和"做推理"死死捆在了一条单向流水线上,模型想把深层知识和浅层推理对上号,唯一的办法就是不停生成 token 来"绕道"。

这篇论文提出的 Mobius 架构,干的事用一句话说:把知识库(FFN)和推理算子(Self-Attention)解耦,让所有推理层共享一个全局知识库,反复查询、迭代精炼,最后一次性吐出精炼的高密度 token。效果相当能打:7B 从头训练只用 62.6% 的数据追平 Transformer 基线;从 Qwen3.5-35B 继续预训练出的 Intern-S2-Mobius,性能基本持平的同时端到端推理快了近 4 倍。

核心摘要

Scaling Law 边际收益递减、Long CoT 冗长烧钱、线性注意力牺牲能力换效率——三条主流路线都遇到了墙。Mobius 选了第四条路:增加架构复杂度来抬高智能上限。它把 FFN 水平拼接成一个全局共享的 Memory(知识向量数据库),多个 Reasoner(Self-Attn)以 hidden states 为缓存和载体反复查询知识,原生实现了"反向残差连接"和"动态潜推理"两个机制。7B 模型数据效率 1.6 倍,35B 模型推理加速近 4 倍,科学类 benchmark 平均分从 18.20 涨到 52.14。这是今年我看到的架构层面最有想法的工作之一,但论文对训练细节和公式的披露相当克制,不少结论还停在"机制假设"层面。

论文信息

  • 标题:Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
  • 作者:Kai Chen、Jifeng Ding、Ning Ding、Jiaye Ge 等 48 人(含 Dahua Lin、Bowen Zhou 等)
  • 机构:上海人工智能实验室(Shanghai AI Laboratory)
  • 发表:2026 年 8 月 14 日,arXiv: 2608.14290
  • 模型开源:https://huggingface.co/internlm/Intern-S2-Mobius

🎯 问题动机:Transformer 的单向流水线,逼模型用 token 绕路

先把 Transformer 内部的分工摆清楚,这是理解整篇论文的钥匙:

组件 角色
FFN 知识存储(可以看作一个 Key-Value 知识向量池)
Hidden States 信息传输
Self-Attention 组合推理(compositional reasoning)

问题出在这三者之间的信息只能单向流动。层级结构决定了:浅层的 hidden states 能顺着残差连接访问深层知识,但深层的 Self-Attention 只能处理来自浅层的知识——反过来走不通。

那模型想回答一个需要"深层知识 + 浅层推理"组合的问题时怎么办?只有一个笨办法:生成 token。每生成一个新 token,就等于把当前状态"固化"下来送回输入,激活下一步推理需要的知识,如此迭代,直到攒够知识产出关键 token。这就是思维链的架构级解释——CoT 不是 feature,是 Transformer 单向信息流逼出来的 workaround。

作者的判断相当直接:只靠层级结构 + 前向残差连接 + token 中介的思维链来构建模型,是低效的。大量算力被浪费在产生冗长、冗余的推理链上。论文里还有句挺损的话——模型无论问题难易都倾向于产生冗长离题的输出,"这个特征在人类社会中通常被视为智力不足的表现"。

再看另外两条路为什么也走不通。堆参数堆数据这条,Scaling Law 的边际收益在递减;线性注意力(SSM、GDN 这类)这条,用效率换了能力,而且省下来的钱也没多到能改变商业部署的账。

于是作者反其道而行:既然降复杂度走不通,那就加复杂度——把知识和推理解耦,抬高架构的智能上限,反而把端到端开销降下来。这个思路说实话挺反直觉的,因为更复杂的架构通常意味着更贵。Mobius 的赌注是:共享知识库带来的稀疏激活确实让单次前向更贵(内存访问压力更大),但推理路径更灵活、输出 token 更少,端到端算总账是赚的。

🏗️ 方法核心:一个全局知识库 + 一群反复查询的推理器

Mobius-v0 的构成用摘要里的话说:一个全局共享的 Memory(FFN,存知识向量),加上多个 Reasoner(Self-Attn,迭代完成组合推理)。Hidden states 扮演双重角色——既是 cache(缓存),又是 carrier(载体)。Reasoner 反复向 Memory 查询需要的知识向量,知识被回传给推理算子,如此循环。

知识库怎么建?直接水平拼接各层 FFN。这个做法能成立,是因为 FFN 本来就是键值对形式的知识向量池,横向拼接保留了知识向量之间的对应关系。但参数量一大,全量激活就烧不起了,所以大规模版本用了类似 MoE 的分块划分,前向时稀疏激活。

这套架构带来两个"天赋",也是论文真正的核心贡献。

天赋一:Backward Residual Connection(反向残差连接)

现有所有主流残差连接(包括 Hyper-Connection、Attention-Residual 这些变体)都是单向的,只把浅层信息往深层送。如果关键知识在浅层没被激活,这一轮推理就解码不出有价值的 token,只能靠 CoT 生成低信息量 token 混到下一步。

直接的解决方案是双向残差连接,但作者很诚实地指出这对基础设施不友好——计算图更复杂,还引入难并行化的异步性。所以他们用了个间接实现:让所有层共享同一个超大知识库。这样一来,每层都能访问模型内的全部知识,深层 hidden states 也能"够到"浅层知识,等效于打通了反向通道。跨层的组合泛化因此增强,关键信息的合成更快。

这个设计我觉得挺漂亮的——不硬改计算图,用共享存储绕出同样的效果,工程上友好得多。

天赋二:Dynamic Latent Reasoning(动态潜推理)

Long CoT 的成本为什么高?表面看是 token 多,往深一层看,是推理的最小单元被锁死在 token 上——一种离散的、低信息密度的存储。模型做复杂题时的"试错-纠错"循环,每一步都要物化成文字,冗余就这么来的。

Mobius 把深思、试错、精炼这些过程内化到连续向量的优化里:latents 不绑定任何具体 token,在少数几层里对着全量知识库迭代精炼,到更深层才同步解码多个 token。作者把这个定位成 Looped Transformer 和 Diffusion Language Model 的升级综合。

这样做有两个实际好处。一是循环频率高——极少层数就完成一次表征迭代,不用像传统潜推理那样每次迭代都过一遍全层。二是KV-cache 管理变简单——一次循环同时拿到多个 token 的联合表征,缓解了多 hidden states 并行化的压力,迭代过程还保持连续可微。而且模型不被约束"第几步必须解码几个 token",计算预算可以按 token 动态分配。

最终呈现出来的效果就是:同样的推理任务,Mobius 用明显更少、更高质量的 token 完成。

🧪 实验结果

论文做了两类实验:从头训练(TFS)验证数据效率,继续预训练(CPT)验证大规模下的实用性。

从头训练:62.6% 的数据追平基线

两个 7B-A1B MoE 模型,一个 Mobius 架构、一个 Transformer 架构,都在 1TB tokens 上训练,比 MMLU。结果是 Mobius 在所有训练阶段都压着 Transformer 打;以 Transformer 吃满 1TB tokens 的分数为基准,Mobius 只用 0.626 倍的数据就达到了——1.6 倍的数据效率

作者给的解释是压缩率:Transformer 各层参数存在大量冗余,同一知识可能在多层重复存储;解耦之后知识集中存放,压缩率更优。这个假设听起来合理,但作者自己也承认"尚待充分探索"——我倾向先把它当一个有数据支撑的猜想,而不是定论。

继续预训练:性能持平,速度快近 4 倍

更接近实用的设置:从 Qwen3.5-35B-A3B 出发,用 1TB tokens 继续预训练成 Mobius 架构,再过 SFT 和 RL,得到 Intern-S2-Mobius。主实验结果如下(Table 1,加粗为该行更优):

通用任务

Benchmark Intern-S2-Mobius-35B Qwen3.5-35B
MMLU Pro 89.05 85.31
GPQA Diamond 80.81 80.24
IMO Bench 81.25 77.50
AIME 2026 95.31 92.08
HMMT 2026 85.51 78.50
UGD hard 73.02 78.02
AMO 58.00 50.00
SimpleQA 28.90 21.39
HLE 19.11 22.40
平均分 67.88 65.05

科学任务

Benchmark Intern-S2-Mobius-35B Qwen3.5-35B
Biology-Instructions 51.40 3.77
Mol-Instructions 45.73 21.70
MolecularIQ 59.29 29.13
平均分 52.14 18.20

几个观察。数学推理类提升最稳:AIME 2026 涨到 95.31,HMMT 2026 从 78.50 拉到 85.51,涨了 7 个点。科学任务的数字夸张到我不敢全信——Biology-Instructions 从 3.77 到 51.40,这种量级更像是继续预训练语料里混入了对口数据,架构本身的功劳要打个问号。另外 UGD hard 和 HLE 两项是倒退的,论文没有专门解释,说明这套架构也不是全方位无死角的强。

效率方面,多个 benchmark 聚合下来请求吞吐量显著更高,端到端近 4 倍加速。加速的来源很直接:CoT 更短。同样的题,Mobius 用明显更短的推理链就能解出来。

案例解剖:516 vs 2364 个 token

短 CoT 是真变聪明了还是学会了偷懒?论文用案例研究回应了这个质疑。Table 2 是一道 MMLU-Pro 的线性代数题,两个模型都选对了,把推理过程按步骤对齐后数 token(统一用 Qwen3.5-35B 的 tokenizer):

对齐步骤 Intern-S2-Mobius-35B Qwen3.5-35B
题意 framing 17 20
Statement 1 178 283
Statement 2 142 197
选项匹配 22 122
重复推导与检查 0 1,147
最终答案 157 595
总计 516 2,364

最扎眼的是"重复推导与检查"那一行:Qwen3.5 花了 1,147 个 token 在反复验算,Mobius 是零。总 token 数 516 对 2,364,差了 4.6 倍。附录里还有一道生物题(Table 3),472 对 1,649,模式完全一样——Transformer 的重复推导 205 tokens、重复选项检查 143 tokens,Mobius 都没有。

看到这里我基本接受了作者的说法:省下来的 token 主要是消除了重复推导和检查,不是跳步蒙答案。那些"试错-纠错"的循环被内化成了潜空间里连续可微的向量优化,不用再物化成文字了。

🔬 三张图里的架构行为证据

论文正文的几张示意图(Transformer vs Mobius 对比、RNN/Transformer/Mobius 对比)在 arXiv HTML 版里没有渲染出来,但附录的三张实证图信息量很大,值得逐张看。

专家激活模式:从头训练 vs 转换训练

图6:两种训练范式下跨层的专家激活模式

图 6:专家激活热力图,横轴是层号,纵轴是 expert id,颜色是该 expert 的选择频率(log10)。左图是从头训练的 Mobius-7B,各层激活分布比较均匀;右图是从 Qwen3.5-35B 转换继续预训练的 Intern-S2-Mobius,激活范围更广,但保留明显的块对角结构——路由仍受源 checkpoint 层级组织的影响。

右图那个对角带特别有意思:第 0 层主要激活前几百号 expert,第 40 层主要激活尾部的 expert,中间呈阶梯过渡。说明"继承"来的模型还没完全学会自由访问整个共享知识池,路由习惯带着 Transformer 时代的层级烙印。作者推测从头训练可能允许更灵活地访问共享专家池——换句话说,CPT 版本可能还没把架构的潜力吃满,后面还有空间。

组合泛化:2.3 倍的准确率差

图7:组合泛化任务,Mobius 对比 Transformer

图 7:选自 Physics of LLM 的组合泛化玩具任务。训练集是 500 实体的单跳关系 + 400 实体的双跳关系,测试集是 100 个没见过的双跳组合(如"谁是 Jayla Stanley 的 manager 的 mentor"),考察模型能否学到跨知识的连接而不是死记硬背。右图显示 Mobius(蓝线)在约 2000 步后准确率冲到 0.6 附近,Transformer(橙线)停在 0.27 左右,差了 2.3 倍。

需要注意图注里的措辞:这是"a future-version of Mobius (unreleased)"——论文主模型还没放出来的一个未来版本跑的。所以这张图的证据力度要打折,它展示的是架构方向的潜力,不是当前开源模型的能力。

逐层预测透镜:潜推理到底在干嘛

图8:Mobius 与 Qwen3.5 的逐层预测透镜对比

图 8:在同一 teacher-forced 上下文(一道 AIME 风格数学题)下,用 layerwise prediction lens 解码每层 hidden state 的预测。t+1 是标准下一 token 预测,t+2 到 t+5 是 MTP 预测位;颜色深浅是预测概率,黑框表示与目标一致。左图 Mobius 的中间层预测明显更对齐目标,L40 处 5/5 全部接受,产出完整被接受的 5-token 草稿;右图 Qwen3.5 中间预测杂乱,第 3 个预测位被拒,只保住 2 个 token 的前缀。

这张图是"动态潜推理"最直观的证据:Mobius 的中间层就在做有意义的精炼,语义轨迹连贯,任务相关信息被压缩进紧凑的内部表征;而基线的中间层基本是一锅粥,要到很后面才收敛。潜推理不是黑箱玄学,至少在 lens 下是能看出结构性差异的。

💡 我的判断

这篇论文最值钱的地方,是给"为什么 CoT 这么贵"提供了一个架构级的解释,并且顺着这个解释给出了自洽的解法。知识和推理解耦之后,反向残差连接和动态潜推理两个机制是自然长出来的,不是硬贴的——这种"一个核心改动带出一串收益"的结构,通常是方向对了的信号。

数据效率 1.6 倍、推理加速近 4 倍、数学类 benchmark 普涨,这些都是硬收益。案例研究里"消除重复推导"的归因也做得比较扎实。

但几个问题要泼点冷水。其一,论文几乎没有披露架构的数学细节——知识向量怎么查询、怎么回传、路由怎么训练,全文找不到一个公式,可复现性存疑。其二,科学任务那种 3.77 到 51.40 的涨幅,很难不让人怀疑 CPT 数据配方的功劳,架构消融是缺失的。其三,4 倍加速高度依赖"CoT 变短",在不需要长推理的任务上收益会缩水;而且共享大知识库的稀疏激活会带来更大的内存访问压力,论文自己承认了这点,实际部署的硬件账还要重新算。其四,Table 3 里模型名写成了"Intern-Spin-35B",大概率是笔误,细节校对有点糙。

跟同期工作比,它像是 Looped Transformer、潜推理(如 COCONUT 一脉)和 MoE 三条线的一次交汇,但交汇的角度是新的:别人循环的是整个网络,它循环的是"对着共享知识库的少数推理层"。如果后续开源版本能复现这些数字,这个方向值得认真对待。

工程上的启发很直接:如果你在做推理成本优化,与其在 token 层面搞各种压缩和蒸馏,不如想想推理过程能不能搬进连续潜空间;如果你在设计新架构,"让每层都能访问全部知识"这个反向通道的思路,比继续堆前向连接可能更有杠杆。

但还有一个更本质的问题没解决:潜空间里的"试错"既然不可见,那它出错的时候怎么被发现、被纠正?可见的冗长 CoT 至少是可审计的,内化之后我们拿什么换可解释性——这笔账,论文没算,可能也还没人能算。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我