老师不是终点,是方向:在隐藏状态里把 RL 的改动"再多走一步"

做蒸馏的人大概都有过这种执念:学生的天花板就是老师。老师 RL 跑到多少分,学生能追平就该烧高香了。

但去年开始有几篇工作把这个执念戳破了——比如 Generalized OPD 那一支,把 teacher 和 base 的 log-prob 差当成一个隐式奖励,加大权重往外推,学生居然能超过老师。思路很漂亮,可惜实操中经常翻车:外推系数稍微开大,训练就开始抖,格式分哗哗往下掉。

这篇 RIDE(arXiv:2609.36484)给了一个让我眼前一亮的诊断:问题不在"外推"这个念头,而在你在哪个空间里量这个方向。logit 空间看到的 RL 改动,是被 LM head 各向异性地压扁过的残影——真正的信号藏在隐藏状态里。那就别在输出空间外推了,直接在表示空间里沿着残差方向多走一步。就这么一个改动,四个模型对上全部追平或超过 RL 老师,而输出空间外推的 baseline 在每一对上都掉到了老师线以下。

核心摘要:On-policy distillation 让学生在自己采样的轨迹上对齐老师,泛化版本靠放大隐式奖励让学生超过老师,但 LM head 会把 RL 带来的表示变化按奇异值谱不均匀地衰减——最弱的 512 个方向承载了 79.8% 的隐藏态残差能量,到了 logit 上只剩 30.0%。RIDE 的做法是:在每一层、每个 token 位置算 teacher 和 pre-RL checkpoint 的隐藏态差作为"RL 方向",把回归目标放到 teacher 之外沿这个方向再推一步(λ=1.25)。结果在 R1-Distill-1.5B、Qwen3-4B、Llama-3.2-3B、Phi-4-mini 四对上,RIDE 平均分全部 ≥ 老师,比表示匹配 baseline OPRD 高 0.97 到 4.06 个点,比输出空间外推 ExOPD 平均高 9.1 个点。这不是底层理论突破,但诊断扎实、实现极简,属于"看完想立刻去试"的那类论文。

论文信息 - 标题:The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation (RIDE) - 作者:Hao Li(中科大)、MeiJia Chen(Rutgers)、Weijie Ren(浙江大学)为共同一作;Donghan Li、Zijun Tian、Jingchun Huang(Independent Researcher);Naibo Wang(浙江大学,通讯) - 链接:https://arxiv.org/abs/2609.36484 | 代码:https://github.com/xixixixixxxx/RIDE - 提交日期:2026 年 9 月 29 日


🎯 问题:输出空间的外推为什么总翻车

先把场景说清楚。典型的 same-initialization 蒸馏设定:你有一个 base 模型 \(\pi_B\),RL 之后得到 teacher \(\pi_T = \mathrm{RL}(\pi_B)\),学生从 \(\pi_B\) 出发,在自己采样的轨迹上接受老师的逐 token 监督。把 RL 的成果蒸回 base、或者合并几个共享 base 的领域专家,都是这个设定。

OPD 的标准目标是 reverse KL:

\[\mathcal{L}_{\mathrm{OPD}}(\theta)=\mathbb{E}_{x,\hat{y}\sim\pi_{\theta}}\Big[\sum_{t}D_{\mathrm{KL}}\big(\pi_\theta(\cdot|x,\hat{y}_{<t})\,\big\|\,\pi_T(\cdot|x,\hat{y}_{<t})\big)\Big]\]

用采样 token 估计的话,逐 token 更新里会出现 \(r_t = \log \pi_\theta - \log \pi_T\) 这样的对数比。而相对于 base,\(\log\pi_T - \log\pi_B\) 就是一个隐式奖励——既然是奖励,就可以乘个系数放大它,让学生"超过"老师。这就是输出空间外推(论文里叫 ExOPD,来自 Yang et al. 2026b)的核心逻辑。

听起来没毛病。但作者指出两个结构性问题。

问题一:LM head 是个"偏心"的漏斗。 logits 是 \(z = W_{\mathrm{head}}\tilde{h}\),head 按自己的奇异值谱给不同方向不同的增益。RL 引起的表示残差恰好集中在 head 增益最弱的方向上——这不是巧合,是实测。于是大部分"RL 到底改了什么"的信息,到达 logit 层时只剩一小部分权重。你在 logit 空间里量方向,量的是被压扁后的影子。

图1:LM head 对 RL 残差的各向异性衰减

图1:(a) 同一个位移在表示空间和 logit 空间的对比——head 按奇异值缩放每个方向,高增益方向被放大、低增益方向被压扁;(b) 实测能量分布:teacher-to-base 残差在隐藏态中有 79.8% 的能量落在 head 最弱的 512 个方向上,但映射到 centered logit 后这些方向只占 30.0% 的能量。whisker 是 prompt-bootstrap 的 95% 置信区间。你想想看,监督信号八成强度集中在 logit 几乎看不见的方向上,输出空间的 loss 当然"喂不饱"。

问题二:采样噪声被外推系数平方放大。 ExOPD 的优势函数 \(A_\lambda(v) = \ell(v) - (\lambda-1)\rho(v)\) 里,\(\rho(v) = \log q(v) - \log b(v)\) 是在单个采样 token 上估的。作者的 Proposition 4.1 给了条件方差分解:

\[\mathrm{Var}[A_\lambda] = \mathrm{Var}[\ell] + (\lambda-1)^2\,\mathrm{Var}[\rho] - 2(\lambda-1)\,\mathrm{Cov}[\ell,\rho]\]

关键在第二项:\((\lambda-1)^2\mathrm{Var}[\rho]\) 不会因为学生收敛到老师而消失——除非 \(\log q - \log b\) 在 q 的支撑集上是常数(实际当然不是)。也就是说,哪怕学生已经学得很像老师了,外推项还在往梯度里灌噪声,而且灌多少由 \((\lambda-1)^2\) 说了算。这解释了为什么 ExOPD 在大系数下不稳定,也解释了为什么老师离 base 越近(信号越弱、噪声占比越高),伤害越大。

🧠 方法:RIDE,把外推搬到隐藏状态里

既然输出空间又衰减又吵,那就换个地方量方向。RIDE 的构造简单到一句话:每一层、每个位置,目标是 teacher 的隐藏态加上 \((\lambda-1)\) 倍的"teacher 减 base"残差。

具体地,在学生采样的前缀 \((x, \hat{y}_{<t})\) 上,同时跑冻结的 teacher 和 base,得到逐层残差:

\[\Delta^{(l)}_t = h^{(l)}_{T,t} - h^{(l)}_{B,t}\]

然后构造外推目标并做掩码回归:

\[h^{\star(l)}_t = h^{(l)}_{T,t} + (\lambda-1)\Delta^{(l)}_t = \lambda h^{(l)}_{T,t} + (1-\lambda)h^{(l)}_{B,t}\]
\[\mathcal{L}_\lambda(\theta)=\mathbb{E}\Big[\frac{1}{|\mathcal{L}_{\mathrm{layer}}|}\sum_{l}\frac{1}{M}\sum_{t} m_t\,\frac{1}{d}\big\|h^{(l)}_{\theta,t}-\mathrm{sg}(h^{\star(l)}_t)\big\|_2^2\Big]\]

这个设计有几个我特别喜欢的性质。

第一,λ=1 时精确退化为 OPRD(逐层隐藏态匹配的 on-policy 表示蒸馏)。RIDE 和 OPRD 的唯一差别就是目标里有没有残差项,所以两者的分数差干干净净地归因于"外推"本身——这个对照设计很讲究。

第二,方向是逐上下文重算的。\(\Delta^{(l)}_t\) 不是一个固定偏移,而是"RL 在学生实际访问的这个上下文里改了什么"。两个冻结模型吃同样的 token,残差隔离的是处理方式的差异,而不是轨迹差异。

第三,学习信号是确定性的。给定 rollout,残差是两次前向算出来的,不是采出来的。λ 只改变目的地,不改变噪声水平。和 Proposition 4.1 里 ExOPD 那个 \((\lambda-1)^2\) 噪声项对照着看,高下立判。

还有个理论上的小甜点(Proposition 4.2):固定 rollout 后,最小化这个回归损失等价于最大化一个"线性方向奖励减去二次惩罚"的目标:

\[(\lambda-1)\,r(h) - \tfrac{1}{2}\|h - h_T\|_2^2,\qquad r(h) = \langle h - h_T, \Delta\rangle\]

奖励是学生位移在 RL 残差方向上的投影,惩罚把学生拴在 teacher 附近,\(\lambda-1\) 调节两者的配比。而且因为 head 是线性的,输出空间的外推目标恰好是 RIDE 目标经过 head 投影的像——RIDE 保留了"奖励外推"的解释,只是把采样对数比换成了确定性梯度。理论自洽这块,作者做得挺完整。

📊 实验:四对模型,全胜

实验设定:四个 base/RL-teacher 对,横跨不同规模、架构和预训练血统——R1-Distill-1.5B → JustRL-1.5B、Qwen3-4B → Just-Qwen3-4B、Llama-3.2-3B → Just-Llama-3.2-3B、Phi-4-mini → Just-Phi-4-mini(后三个老师是按 JustRL 配方自己跑的)。训练用 DAPO-Math-17K 提示集,500 步,AdamW 学习率 1e-5,4×H200,RIDE 监督所有层和最后 2000 个 response 位置,λ=1.25。评测是 AIME24/AIME25/AIMO 上的 Avg@16,训练方法跑 3 个种子取均值。

方法 R1-1.5B Avg. Qwen3-4B Avg. Llama-3.2-3B Avg. Phi-4-mini Avg.
Teacher(RL 上限) 55.30 65.59 13.01 17.96
Student(未训练) 39.00 62.82 6.99 15.13
OPD top-1 52.90 59.24 1.08 12.90
OPD top-16 52.53 59.74 5.97 16.76
OPRD(表示匹配) 54.50 62.01 10.94 17.33
ExOPD(输出外推) 49.87 48.75 6.95 12.22
RIDE 56.38 66.07 13.33 18.30

表1:四个 base/teacher 对上的 Avg@16 宏平均(%)。RIDE 是唯一在四对上都 ≥ 老师线的方法。

几个值得停下来看一眼的数。

ExOPD 的崩塌模式完全符合理论预测。 在 R1-Distill 对上,RL 把老师推离 base 有 16.3 个点,信号还算强,ExOPD 拿 49.87——已经低于所有 teacher-matching baseline 了。而在老师-base 差距小的三对(2.8 到 6.0 个点)上,ExOPD 连没训练的学生都不如,Qwen3-4B 上直接掉了 14.1 个点。残差信号越弱,\((\lambda-1)^2\) 放大的噪声占比越高——Proposition 4.1 不是摆设。

RIDE 对 OPRD 的优势是 0.97 到 4.06 个点。 因为两者只差目标里的残差项,这个差就是"沿 RL 方向多走一步"的净收益。不过要实话实说:作者在 Table 4 里给了跨种子标准差(RIDE 在 ±0.88 到 ±1.13 之间),四对里有三对超出老师的幅度在一个标准差以内。说"碾压老师"是过头了,说"稳定追平并略有超出"是准确的。

λ 扫描把两个方法的脾性暴露得很彻底。 RIDE 从 λ=0.5 的 48.2 单调爬到 λ=1.25 的峰值 55.4,[1.15, 1.35] 区间全部优于 OPRD,过了 1.35 也是优雅退化(λ=2 还有 52.4);ExOPD 最好的成绩出现在 λ≤1(52.9),一旦 λ>1 就早衰——λ=1.25 和 1.5 在第 150 步就见顶然后回落,λ=2 时格式分从 92% 崩到 64%,回复长度膨胀到 8700 token。还有一个有意思的细节:λ≥1 的 RIDE 把回复压短到 5.3k–5.7k token,λ<1 则拉长到 6.8k–7.4k——外推方向直接改变了学生的"话多话少",这侧面说明残差方向确实编码了 RL 学到的行为模式。

消融排除了"方向无所谓,只是位移在起作用"的平凡解释。 固定位移幅度、只改方向的四个对照组:随机方向 55.04、反向(λ=0.75)53.90、换 base 来源(用 Qwen2.5-Math-1.5B-Instruct 当假 base)54.75、轨迹错配(teacher 和 base 分别跑各自的轨迹)55.12——全部在 OPRD 的 54.50 附近一个点以内晃,只有真·RL 残差方向的 RIDE 到了 56.38。这个消融做得相当扎实,把"正则化效应""loss 规模效应""任意位移效应"都排除了。

机制分析补上了最后一环。 残差的归一化 head 增益只有 0.59(等模各向同性方向为基准);head 中心化后满秩,奇异值从 71.7 跨到 1.8,残差沿主导方向最多被衰减约 40 倍——不是没了,是只剩零头。梯度层面,最弱的 512 个方向拿到表示损失梯度的 73.0%,却只拿到输出 KL 梯度的 48.6%。学生更新方向与残差的余弦达 0.954,且在残差上的投影达到 1.69,超过目标系数 1.25——λ 定的是目标,学生实际沿这个方向走得更远。在 9152 个验证前缀上,ExOPD 优势的条件方差从 λ=1 到 λ=2 涨了 12.6 倍,而 RIDE 的逐位置梯度范数对重采样完全不变(在对数轴上贴着地板)。

图2:学生实际变化 vs 目标变化(head 可见分量)

图2(论文 Figure 5b):R1-Distill-1.5B 上,学生 hidden state 经 head 投影后的实际变化(纵轴)与目标变化 \(\lambda P_{W_B}(h_T - h_B)\)(横轴)的二维直方图,散点紧贴 y=x 红线,图内标注余弦相似度 0.915、相对 L2 误差 0.58——学生不仅方向对,head 看得见的那部分也真的跟上了目标。

顺带一提成本账(Table 6):RIDE 和 ExOPD 都需要加载 base checkpoint、每 rollout 多一次冻结前向,但 ExOPD 传输的是 \(T\times 1\) 的 log-ratio,RIDE 要传 \(T\times L\times d\) 的隐藏态——通信量大不少,不过 target 在 teacher worker 上算好,训练侧开销不变。

🤔 我的判断

这篇论文最值钱的地方,我觉得不是方法本身——λ 倍的 teacher 加 (1-λ) 倍的 base,这个构造写出来小学生都看得懂——而是它把"输出空间外推为什么不稳定"这件事从玄学变成了可测量的量。head 的奇异值谱、残差能量的方向分布、条件方差的 \((\lambda-1)^2\) 分解,每一块都给了实测数字。这种"先诊断、后开方"的论文比直接甩方法的论文耐看得多。

但也要泼几盆冷水。

一是增益的统计显著性。四对里有三对超出老师的幅度在一个种子标准差以内,RIDE 对 OPRD 在 Qwen3-4B 上 4.06 个点的优势最亮眼,但 Phi-4-mini 上只有 0.97 个点。说"超越老师"更准确的说法是"在 OPRD 基础上稳定再进一步"。

二是适用面相当窄。整个方法依赖 same-initialization 设定——学生、teacher、base 共享架构、tokenizer 和表示空间,还要留着你 RL 之前的 checkpoint。跨架构蒸馏、无 base 可用的场景,这套直接失效。而且只验证了数学推理一个领域、JustRL 一种 RL 配方,作者自己在结论里也承认了。

三是 Llama-3.2-3B 那对的 AIME 分数贴着评测地板(老师 AIME25 只有 0.42),证据主要靠 AIMO 撑着,这一对的结论强度要打个折。

工程上的启发倒是立竿见影:如果你在做 RL 模型的回蒸或专家合并,手头又有 pre-RL checkpoint,RIDE 基本是在 OPRD 管线上改几行 target 构造代码的事,λ 从 1.15–1.25 起步扫就行。反过来,如果你在用 ExOPD 类的输出空间外推且老师-base 差距不大,这篇论文的方差分析值得你重新掂量一下那个放大系数。

隐藏的表示空间比 logits 更诚实——这个观察的适用范围恐怕不止蒸馏。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我