把"背书"和"做题"拆开的 Mobius:知识推理解耦架构,推理快了近 4 倍
你有没有发现一个挺怪的现象:现在的推理模型,碰到简单问题也要洋洋洒洒写一大段思维链,碰到难题更是动辄几千 token 的"试错-检查-再试错"。token 越烧越多,答案却不一定更对。上周读到上海人工智能实验室 Intern 系列的新论文(arXiv: 2608.14290),他们的诊断让我眼前一亮——问题可能不在模型不够聪明,而在于 Transformer 把"存知识"和"做推理"死死捆在了一条单向流水线上,模型想把深层知识和浅层推理对上号,唯一的办法就是不停生成 token 来"绕道"。
这篇论文提出的 Mobius 架构,干的事用一句话说:把知识库(FFN)和推理算子(Self-Attention)解耦,让所有推理层共享一个全局知识库,反复查询、迭代精炼,最后一次性吐出精炼的高密度 token。效果相当能打:7B 从头训练只用 62.6% 的数据追平 Transformer 基线;从 Qwen3.5-35B 继续预训练出的 Intern-S2-Mobius,性能基本持平的同时端到端推理快了近 4 倍。
核心摘要
Scaling Law 边际收益递减、Long CoT 冗长烧钱、线性注意力牺牲能力换效率——三条主流路线都遇到了墙。Mobius 选了第四条路:增加架构复杂度来抬高智能上限。它把 FFN 水平拼接成一个全局共享的 Memory(知识向量数据库),多个 Reasoner(Self-Attn)以 hidden states 为缓存和载体反复查询知识,原生实现了"反向残差连接"和"动态潜推理"两个机制。7B 模型数据效率 1.6 倍,35B 模型推理加速近 4 倍,科学类 benchmark 平均分从 18.20 涨到 52.14。这是今年我看到的架构层面最有想法的工作之一,但论文对训练细节和公式的披露相当克制,不少结论还停在"机制假设"层面。
论文信息
- 标题:Intern-S2-Mobius: Foundation Model with Decoupled Knowledge and Reasoning
- 作者:Kai Chen、Jifeng Ding、Ning Ding、Jiaye Ge 等 48 人(含 Dahua Lin、Bowen Zhou 等)
- 机构:上海人工智能实验室(Shanghai AI Laboratory)
- 发表:2026 年 8 月 14 日,arXiv: 2608.14290
- 模型开源:https://huggingface.co/internlm/Intern-S2-Mobius
🎯 问题动机:Transformer 的单向流水线,逼模型用 token 绕路
先把 Transformer 内部的分工摆清楚,这是理解整篇论文的钥匙:
| 组件 | 角色 |
|---|---|
| FFN | 知识存储(可以看作一个 Key-Value 知识向量池) |
| Hidden States | 信息传输 |
| Self-Attention | 组合推理(compositional reasoning) |
问题出在这三者之间的信息只能单向流动。层级结构决定了:浅层的 hidden states 能顺着残差连接访问深层知识,但深层的 Self-Attention 只能处理来自浅层的知识——反过来走不通。
那模型想回答一个需要"深层知识 + 浅层推理"组合的问题时怎么办?只有一个笨办法:生成 token。每生成一个新 token,就等于把当前状态"固化"下来送回输入,激活下一步推理需要的知识,如此迭代,直到攒够知识产出关键 token。这就是思维链的架构级解释——CoT 不是 feature,是 Transformer 单向信息流逼出来的 workaround。
作者的判断相当直接:只靠层级结构 + 前向残差连接 + token 中介的思维链来构建模型,是低效的。大量算力被浪费在产生冗长、冗余的推理链上。论文里还有句挺损的话——模型无论问题难易都倾向于产生冗长离题的输出,"这个特征在人类社会中通常被视为智力不足的表现"。
再看另外两条路为什么也走不通。堆参数堆数据这条,Scaling Law 的边际收益在递减;线性注意力(SSM、GDN 这类)这条,用效率换了能力,而且省下来的钱也没多到能改变商业部署的账。
于是作者反其道而行:既然降复杂度走不通,那就加复杂度——把知识和推理解耦,抬高架构的智能上限,反而把端到端开销降下来。这个思路说实话挺反直觉的,因为更复杂的架构通常意味着更贵。Mobius 的赌注是:共享知识库带来的稀疏激活确实让单次前向更贵(内存访问压力更大),但推理路径更灵活、输出 token 更少,端到端算总账是赚的。
🏗️ 方法核心:一个全局知识库 + 一群反复查询的推理器
Mobius-v0 的构成用摘要里的话说:一个全局共享的 Memory(FFN,存知识向量),加上多个 Reasoner(Self-Attn,迭代完成组合推理)。Hidden states 扮演双重角色——既是 cache(缓存),又是 carrier(载体)。Reasoner 反复向 Memory 查询需要的知识向量,知识被回传给推理算子,如此循环。
知识库怎么建?直接水平拼接各层 FFN。这个做法能成立,是因为 FFN 本来就是键值对形式的知识向量池,横向拼接保留了知识向量之间的对应关系。但参数量一大,全量激活就烧不起了,所以大规模版本用了类似 MoE 的分块划分,前向时稀疏激活。
这套架构带来两个"天赋",也是论文真正的核心贡献。
天赋一:Backward Residual Connection(反向残差连接)
现有所有主流残差连接(包括 Hyper-Connection、Attention-Residual 这些变体)都是单向的,只把浅层信息往深层送。如果关键知识在浅层没被激活,这一轮推理就解码不出有价值的 token,只能靠 CoT 生成低信息量 token 混到下一步。
直接的解决方案是双向残差连接,但作者很诚实地指出这对基础设施不友好——计算图更复杂,还引入难并行化的异步性。所以他们用了个间接实现:让所有层共享同一个超大知识库。这样一来,每层都能访问模型内的全部知识,深层 hidden states 也能"够到"浅层知识,等效于打通了反向通道。跨层的组合泛化因此增强,关键信息的合成更快。
这个设计我觉得挺漂亮的——不硬改计算图,用共享存储绕出同样的效果,工程上友好得多。
天赋二:Dynamic Latent Reasoning(动态潜推理)
Long CoT 的成本为什么高?表面看是 token 多,往深一层看,是推理的最小单元被锁死在 token 上——一种离散的、低信息密度的存储。模型做复杂题时的"试错-纠错"循环,每一步都要物化成文字,冗余就这么来的。
Mobius 把深思、试错、精炼这些过程内化到连续向量的优化里:latents 不绑定任何具体 token,在少数几层里对着全量知识库迭代精炼,到更深层才同步解码多个 token。作者把这个定位成 Looped Transformer 和 Diffusion Language Model 的升级综合。
这样做有两个实际好处。一是循环频率高——极少层数就完成一次表征迭代,不用像传统潜推理那样每次迭代都过一遍全层。二是KV-cache 管理变简单——一次循环同时拿到多个 token 的联合表征,缓解了多 hidden states 并行化的压力,迭代过程还保持连续可微。而且模型不被约束"第几步必须解码几个 token",计算预算可以按 token 动态分配。
最终呈现出来的效果就是:同样的推理任务,Mobius 用明显更少、更高质量的 token 完成。
🧪 实验结果
论文做了两类实验:从头训练(TFS)验证数据效率,继续预训练(CPT)验证大规模下的实用性。
从头训练:62.6% 的数据追平基线
两个 7B-A1B MoE 模型,一个 Mobius 架构、一个 Transformer 架构,都在 1TB tokens 上训练,比 MMLU。结果是 Mobius 在所有训练阶段都压着 Transformer 打;以 Transformer 吃满 1TB tokens 的分数为基准,Mobius 只用 0.626 倍的数据就达到了——1.6 倍的数据效率。
作者给的解释是压缩率:Transformer 各层参数存在大量冗余,同一知识可能在多层重复存储;解耦之后知识集中存放,压缩率更优。这个假设听起来合理,但作者自己也承认"尚待充分探索"——我倾向先把它当一个有数据支撑的猜想,而不是定论。
继续预训练:性能持平,速度快近 4 倍
更接近实用的设置:从 Qwen3.5-35B-A3B 出发,用 1TB tokens 继续预训练成 Mobius 架构,再过 SFT 和 RL,得到 Intern-S2-Mobius。主实验结果如下(Table 1,加粗为该行更优):
通用任务
| Benchmark | Intern-S2-Mobius-35B | Qwen3.5-35B |
|---|---|---|
| MMLU Pro | 89.05 | 85.31 |
| GPQA Diamond | 80.81 | 80.24 |
| IMO Bench | 81.25 | 77.50 |
| AIME 2026 | 95.31 | 92.08 |
| HMMT 2026 | 85.51 | 78.50 |
| UGD hard | 73.02 | 78.02 |
| AMO | 58.00 | 50.00 |
| SimpleQA | 28.90 | 21.39 |
| HLE | 19.11 | 22.40 |
| 平均分 | 67.88 | 65.05 |
科学任务
| Benchmark | Intern-S2-Mobius-35B | Qwen3.5-35B |
|---|---|---|
| Biology-Instructions | 51.40 | 3.77 |
| Mol-Instructions | 45.73 | 21.70 |
| MolecularIQ | 59.29 | 29.13 |
| 平均分 | 52.14 | 18.20 |
几个观察。数学推理类提升最稳:AIME 2026 涨到 95.31,HMMT 2026 从 78.50 拉到 85.51,涨了 7 个点。科学任务的数字夸张到我不敢全信——Biology-Instructions 从 3.77 到 51.40,这种量级更像是继续预训练语料里混入了对口数据,架构本身的功劳要打个问号。另外 UGD hard 和 HLE 两项是倒退的,论文没有专门解释,说明这套架构也不是全方位无死角的强。
效率方面,多个 benchmark 聚合下来请求吞吐量显著更高,端到端近 4 倍加速。加速的来源很直接:CoT 更短。同样的题,Mobius 用明显更短的推理链就能解出来。
案例解剖:516 vs 2364 个 token
短 CoT 是真变聪明了还是学会了偷懒?论文用案例研究回应了这个质疑。Table 2 是一道 MMLU-Pro 的线性代数题,两个模型都选对了,把推理过程按步骤对齐后数 token(统一用 Qwen3.5-35B 的 tokenizer):
| 对齐步骤 | Intern-S2-Mobius-35B | Qwen3.5-35B |
|---|---|---|
| 题意 framing | 17 | 20 |
| Statement 1 | 178 | 283 |
| Statement 2 | 142 | 197 |
| 选项匹配 | 22 | 122 |
| 重复推导与检查 | 0 | 1,147 |
| 最终答案 | 157 | 595 |
| 总计 | 516 | 2,364 |
最扎眼的是"重复推导与检查"那一行:Qwen3.5 花了 1,147 个 token 在反复验算,Mobius 是零。总 token 数 516 对 2,364,差了 4.6 倍。附录里还有一道生物题(Table 3),472 对 1,649,模式完全一样——Transformer 的重复推导 205 tokens、重复选项检查 143 tokens,Mobius 都没有。
看到这里我基本接受了作者的说法:省下来的 token 主要是消除了重复推导和检查,不是跳步蒙答案。那些"试错-纠错"的循环被内化成了潜空间里连续可微的向量优化,不用再物化成文字了。
🔬 三张图里的架构行为证据
论文正文的几张示意图(Transformer vs Mobius 对比、RNN/Transformer/Mobius 对比)在 arXiv HTML 版里没有渲染出来,但附录的三张实证图信息量很大,值得逐张看。
专家激活模式:从头训练 vs 转换训练

图 6:专家激活热力图,横轴是层号,纵轴是 expert id,颜色是该 expert 的选择频率(log10)。左图是从头训练的 Mobius-7B,各层激活分布比较均匀;右图是从 Qwen3.5-35B 转换继续预训练的 Intern-S2-Mobius,激活范围更广,但保留明显的块对角结构——路由仍受源 checkpoint 层级组织的影响。
右图那个对角带特别有意思:第 0 层主要激活前几百号 expert,第 40 层主要激活尾部的 expert,中间呈阶梯过渡。说明"继承"来的模型还没完全学会自由访问整个共享知识池,路由习惯带着 Transformer 时代的层级烙印。作者推测从头训练可能允许更灵活地访问共享专家池——换句话说,CPT 版本可能还没把架构的潜力吃满,后面还有空间。
组合泛化:2.3 倍的准确率差

图 7:选自 Physics of LLM 的组合泛化玩具任务。训练集是 500 实体的单跳关系 + 400 实体的双跳关系,测试集是 100 个没见过的双跳组合(如"谁是 Jayla Stanley 的 manager 的 mentor"),考察模型能否学到跨知识的连接而不是死记硬背。右图显示 Mobius(蓝线)在约 2000 步后准确率冲到 0.6 附近,Transformer(橙线)停在 0.27 左右,差了 2.3 倍。
需要注意图注里的措辞:这是"a future-version of Mobius (unreleased)"——论文主模型还没放出来的一个未来版本跑的。所以这张图的证据力度要打折,它展示的是架构方向的潜力,不是当前开源模型的能力。
逐层预测透镜:潜推理到底在干嘛

图 8:在同一 teacher-forced 上下文(一道 AIME 风格数学题)下,用 layerwise prediction lens 解码每层 hidden state 的预测。t+1 是标准下一 token 预测,t+2 到 t+5 是 MTP 预测位;颜色深浅是预测概率,黑框表示与目标一致。左图 Mobius 的中间层预测明显更对齐目标,L40 处 5/5 全部接受,产出完整被接受的 5-token 草稿;右图 Qwen3.5 中间预测杂乱,第 3 个预测位被拒,只保住 2 个 token 的前缀。
这张图是"动态潜推理"最直观的证据:Mobius 的中间层就在做有意义的精炼,语义轨迹连贯,任务相关信息被压缩进紧凑的内部表征;而基线的中间层基本是一锅粥,要到很后面才收敛。潜推理不是黑箱玄学,至少在 lens 下是能看出结构性差异的。
💡 我的判断
这篇论文最值钱的地方,是给"为什么 CoT 这么贵"提供了一个架构级的解释,并且顺着这个解释给出了自洽的解法。知识和推理解耦之后,反向残差连接和动态潜推理两个机制是自然长出来的,不是硬贴的——这种"一个核心改动带出一串收益"的结构,通常是方向对了的信号。
数据效率 1.6 倍、推理加速近 4 倍、数学类 benchmark 普涨,这些都是硬收益。案例研究里"消除重复推导"的归因也做得比较扎实。
但几个问题要泼点冷水。其一,论文几乎没有披露架构的数学细节——知识向量怎么查询、怎么回传、路由怎么训练,全文找不到一个公式,可复现性存疑。其二,科学任务那种 3.77 到 51.40 的涨幅,很难不让人怀疑 CPT 数据配方的功劳,架构消融是缺失的。其三,4 倍加速高度依赖"CoT 变短",在不需要长推理的任务上收益会缩水;而且共享大知识库的稀疏激活会带来更大的内存访问压力,论文自己承认了这点,实际部署的硬件账还要重新算。其四,Table 3 里模型名写成了"Intern-Spin-35B",大概率是笔误,细节校对有点糙。
跟同期工作比,它像是 Looped Transformer、潜推理(如 COCONUT 一脉)和 MoE 三条线的一次交汇,但交汇的角度是新的:别人循环的是整个网络,它循环的是"对着共享知识库的少数推理层"。如果后续开源版本能复现这些数字,这个方向值得认真对待。
工程上的启发很直接:如果你在做推理成本优化,与其在 token 层面搞各种压缩和蒸馏,不如想想推理过程能不能搬进连续潜空间;如果你在设计新架构,"让每层都能访问全部知识"这个反向通道的思路,比继续堆前向连接可能更有杠杆。
但还有一个更本质的问题没解决:潜空间里的"试错"既然不可见,那它出错的时候怎么被发现、被纠正?可见的冗长 CoT 至少是可审计的,内化之后我们拿什么换可解释性——这笔账,论文没算,可能也还没人能算。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我