蒸馏和 RL 别搅在一起:一个"先蒸后练"的两段式方案,干翻了所有联合优化变体
上周读了一篇让我有点意外的论文。意外不是因为方法多复杂——恰恰相反,方法简单到一句话能说完:先做 on-policy 蒸馏,再做 RLVR,分两步走,别掺和。就这么个朴素的安排,在逻辑推理和数学推理上把一堆精心设计的"联合优化"方法全部打下去了,逻辑任务上平均 pass@1 比最好的联合基线高出 11.7 个点,比纯蒸馏高出 26.7 个点。
这种"简单基线吊打复杂方法"的剧本我见得不少,但这篇值钱的地方在于:它没有停留在跑分,而是从 pass@k 行为、训练动力学、参数更新三个角度把"为什么分两步更好"讲透了,最后还顺手给了两个工程上马上能用的结论——什么时候该从蒸馏切到 RL,以及蒸馏是比 SFT 更好的 RL 冷启动。
📖 核心摘要
RLVR(带可验证奖励的强化学习)和 OPD(on-policy 蒸馏)是当前推理模型后训练的两条主线:前者信号真实但稀疏,后者信号稠密但只是"模仿老师"的代理目标。之前的思路都是把两个信号在每一步训练里融合——要么加权相加,要么用老师信号调制 RL 优势。这篇论文(arXiv: 2609.04108)系统比较后发现:所有这些联合方案都不如一个朴素的两段式安排 OPD-then-RL。机制上,OPD 负责扩能力边界(提升 pass@k 的覆盖),RL 负责在边界内锐化(把概率质量压到正确答案上);混在一起时两个信号互相掣肘,分开时各司其职。这不是底层算法突破,而是一篇把"组合方式"这件事做扎实的实证论文——但如果你正在做推理模型的后训练,它的结论可以直接抄作业。
论文信息 - 标题:Sequential Beats Joint: On the Interplay between On-Policy Distillation and RLVR - 作者:Boyan Li, Bingsen Chen(New York University)、Chenghao Yang(University of Chicago)、Ping Nie(University of Waterloo)、Chen Zhao(New York University)、Xi Ye(University of Alberta / NYU Shanghai / Amii) - 链接:https://arxiv.org/abs/2609.04108 (2026 年 9 月 3 日提交,v2)
🎯 问题动机:两个信号,一个稠密一个真实,怎么合体?
先说清楚这两种方法各自的脾气,这是理解全文的钥匙。
RLVR(以 GRPO 为代表)对一组采样回答打分,把组内归一化的优势分给每个 token:
它的好处是奖励直接对齐任务目标——答案对就是对。但一条 500 token 的推理链只换回一两个 bit 的监督信号,中间步骤全靠模型自己试错。我在实际项目里跑 GRPO 最直观的感受就是:前期涨得快,后期大量算力烧在"重复采样已经会做的题"上。
OPD(on-policy distillation,代表工作包括 MiniLLM、GKD 以及 Thinking Machines 那篇广为流传的博客)反其道而行:学生自己采样 rollout,老师对学生走过的每一条轨迹给出逐 token 的分布监督,优化的是学生分布对老师分布的 reverse KL:
逐 token 的稠密信号,样本效率极高。但问题是,"像老师"不等于"做对题"——蒸馏的天花板就是老师本人。
既然一个真实但稀疏,一个稠密但是代理目标,合体似乎是显然的方向。事实上今年已经冒出一批方法这么干了。这篇论文做的头一件事,就是把它们收进一个统一视角:所有方法都可以写成同一个 token 级策略梯度形式
区别只在优势 \(A_t\) 怎么混合两种信号。按混合方式,现有方法干净地分成两派:
| 范式 | 代表方法 | 混合方式 | 特点 |
|---|---|---|---|
| 加权相加(weighted-additive) | KDRL、KDRL-mask、SRPO、HDPO | \(A_t = w_R\hat{A}^{(i)} + w_T d_t^{(i)}\) | 老师项作为独立加项,可能与 RL 优势反号 |
| 老师调制(teacher-modulated) | TRRD、RLSD | \(A_t = m(d_t^{(i)})\cdot\hat{A}^{(i)}\) | 老师只调幅度不动符号,充当 token 级信用分配 |
看起来设计都挺讲究:KDRL-mask 只在错误轨迹上加蒸馏项,HDPO 只在全错组上激活老师,TRRD 把老师信号折进重要性比率做信任域约束。每一步都小心翼翼地在两个信号之间找平衡。
然后作者问了一个有点"煞风景"的问题:既然每一步都这么纠结,为什么不干脆分开用?先跑一段纯 OPD,到第 \(S\) 步切成纯 GRPO:
说实话,这个方案朴素到像占位符 baseline。但实验结果让所有人都尴尬了。
🏗️ 主实验:两段式全面领先
实验设置:学生是 Qwen3-1.7B-Base,老师是 Qwen3-8B。逻辑推理用 Reasoning Gym 的 Knights & Knaves(K&K)、Zebra、Countdown 三个任务,数学推理在 DeepMath 上训练、MATH-500 / AMC23 / AIME24 / AIME25 上评测。所有方法共享训练超参,pass@1 取 32 次采样平均,评测相当扎实。
主表(Table 2)数字很多,我挑最关键的列:
| 方法 | 逻辑 Avg p@1 | 逻辑 Avg p@32 | 数学 Avg p@1 |
|---|---|---|---|
| 学生基座(Qwen3-1.7B-Base) | 1.9 | 33.0 | 16.2 |
| 老师(Qwen3-8B) | 59.9 | 96.2 | 50.1 |
| GRPO(纯 RL) | 49.4 | 68.1 | 28.4 |
| OPD(纯蒸馏) | 53.9 | 94.9 | 31.0 |
| KDRL / SRPO / KDRL-mask | 62.8 / 56.0 / 62.2 | 92.4 / 94.6 / 94.1 | 29.0 / 31.6 / 29.6 |
| TRRD / RLSD | 58.6 / 56.9 | 95.6 / 94.8 | 30.1 / 30.1 |
| KDRL-Annealing(最强联合基线) | 68.9 | 95.4 | 30.0 |
| OPD-then-RL | 80.6 | 98.3 | 31.8 |
几个值得停下来看的数:
逻辑推理上领先 11.7 个点。 OPD-then-RL 平均 p@1 是 80.6,最强的联合基线 KDRL-Annealing 是 68.9,而纯 OPD 只有 53.9——也就是说两段式比纯蒸馏高出 26.7 个点。更夸张的是 K&K 单项:92.6 对老师的 56.6,学生比老师高了 36 个点。蒸馏再 RL,居然能大幅超越蒸馏信号的来源本身,这在直觉上是挺反常识的。
数学推理上优势很薄。 31.8 对 SRPO 的 31.6,基本持平。这里得说句公道话:数学任务的评测集很小(AIME 一年才 30 题),方差大,作者也意识到了,补了配对 bootstrap 检验(Table 7),宏观平均上 OPD-then-RL 对多数基线的差值置信区间不包含零,但对个别方法只是打平。这篇论文的主战场显然是逻辑推理,数学上它证明的是"不输",不是"碾压"。
联合方法集体卡在老师天花板附近。 纯 OPD 和所有联合方法的逻辑 p@1 都聚在 54-69 之间,围绕着老师的 59.9 打转。只有两个"调度类"方法——KDRL-Annealing(逐步退火蒸馏权重)和 OPD-then-RL(直接切换)——冲破了这条线。这个观察其实是全文最重要的一条线索,下面细说。

图1:逻辑推理任务平均 pass@1(横轴)对 pass@32(纵轴)。红星 OPD-then-RL 独占右上角——纯方法(灰)、加权相加(蓝)、老师调制(绿)三个家族全部落在左下方。注意左下角那个孤零零的叉是纯 GRPO:pass@1 不低但 pass@32 只有 68 左右,说明纯 RL 只会"锐化"不会"扩圈"。
🧠 机制解剖:为什么分开比混合好?
这是论文最扎实的部分。作者从三个角度切入,得出的图景高度一致:OPD 扩张,RL 锐化;串联时两者互补,并联时两者互殴。
pass@k 视角:一个扩圈,一个收圈
pass@k 曲线是区分"能力边界"和"输出集中度"的好工具:pass@128 高说明模型能解出这题(至少一次采样命中),pass@1 高说明模型稳定解出这题。

图2:左、中两图是 Countdown 和 K&K 上 pass@k 随 k 的曲线;右图是 K&K 更高难度(更多人物)的 OOD 泛化。红色三角线的 OPD-then-RL 在所有 k 值上压住所有基线。
看左中两图:OPD(绿)把整条 pass@k 曲线从基座(浅灰)上整体抬高,大 k 处提升最大——它把 pass@128 和 pass@1 之间的差距拉大了,因为它扩张了"可解问题集合"。RL(深灰)刚好相反,差距收窄——它在做概率质量的重分配,把已有的能力集中到 greedy 输出上。
联合方法(KDRL 紫、TRRD 粉)呢?卡在中间。作者的解读很犀利:每一步里 RL 项限制了 OPD 能把 pass@k 推多远,OPD 项又拽着学生不许偏离老师分布、限制了 RL 的锐化程度。两个信号在每一步互相踩刹车,最后两头都没到位。
右图是我觉得最有信息量的一幅:在更难的 OOD 题上,pass@1 随难度下降,但 OPD-then-RL 的 pass@128(红色实线)始终钉在接近 100 的位置——OPD 扩出来的能力是可以跨难度迁移的,RL 只需在这个高覆盖的基础上继续收敛 pass@1。
训练动力学:老师天花板与"假漂移"

图3:K&K 上验证 pass@1、KL 散度、交叉熵、熵随训练步的变化(左到右)。虚线是老师的 56.6 p@1。OPD(绿)和所有联合方法(粉、紫)的 pass@1 都 plateau 在老师线之下,只有切到 RL 的两条曲线(红、蓝)冲了过去。
第一联图直接解释了主表:持续的 OPD 信号把学生锚在老师分布附近,pass@1 被老师性能上界锁死。切掉 OPD 信号之后,RL 才能无干扰地为任务奖励锐化。
但这里有个更微妙的发现。看第二联:切到 RL 之后,学生对老师的 KL 散度单调上升——表面看学生正在"飘离"老师。真的是这样吗?把 KL 分解成 \(D_{\mathrm{KL}}(p_S\|p_T)=H(p_S,p_T)-H(p_S)\) 再看后两联:RL 阶段交叉熵 \(H(p_S,p_T)\) 其实在持续下降(老师给学生产出的 likelihood 越来越高),只是学生自身熵 \(H(p_S)\) 掉得更快。KL 上升是熵收缩的会计结果,不是学生离开了老师的支持集。
这个分解很漂亮。作者还用 top-K token 分析做了交叉验证:

图4:横轴是学生与老师 top-K token 集合的重叠率,纵轴是学生压在重叠 token 上的概率质量。绿色是 OPD 阶段,红色是切换后的 RL 阶段;圆圈是起点、实心点是切换点、星星是终点。RL 阶段重叠率下降但共享质量上升(K 等于 1 时最明显)——学生覆盖了更少的老师 token,但在保留的 token 上押了更多概率。
一句话:RL 阶段的学生是在老师支持集内部收缩到一个更小、但仍被老师认可的核心上,而不是跑野了。这正好回应了社区里"RL 会不会把蒸馏学到的能力冲掉"的担心——按这篇论文的证据,顺序得当的话不会。
参数更新视角:符号冲突的实锤
最后作者下潜到参数层面,定义了符号冲突率 SCR:取 OPD 更新幅度 top-K% 的参数,看其他方法在这些参数上的更新方向是否与 OPD 相反。
| 方法 | K&K top-10% | K&K top-100% | Countdown top-10% | Countdown top-100% |
|---|---|---|---|---|
| 纯 RL | 20.36 | 21.00 | 9.57 | 17.00 |
| KDRL | 7.73 | 15.02 | 6.79 | 13.71 |
| TRRD | 0.04 | 6.58 | 1.31 | 9.98 |
| OPD-then-RL | 0.00 | 3.38 | 0.02 | 3.89 |
OPD-then-RL 在 OPD 最看重的参数方向上几乎零冲突,残留的冲突集中在更新幅度的长尾(K 大于等于 80% 的次要参数)。联合方法则在关键方向上打起来了——KDRL 在 top-100% 上冲突率 15%。
更有说服力的是一个干预实验:把 KDRL 训练出的模型里与 OPD 冲突的参数,按 20%/50%/80%/100% 的比例替换回 OPD 的参数值。

图5:替换比例越高,pass@1 越低但大 k 处的 pass@k 越高,呈现单调的此消彼长;随机替换同样数量的参数(虚线)则复现不出这个 trade-off——说明这个张力特异于符号冲突子空间。
这个实验直接把"冲突子空间"和"pass@1 与 pass@k 的权衡"挂上了因果关系:KDRL 版本的这个子空间服务于锐化,OPD 版本服务于覆盖,联合训练逼两者在同一个子空间里抢地盘。OPD-then-RL 的解法是时间换空间——不同时段用不同信号,谁也不用抢。
🔧 工程配方:两个拿来即用的结论
分析完机制,论文落到两个实操问题上。
什么时候从 OPD 切到 RL?看 OPD 的验证分数。 作者在 OPD 训练的第 20、60、100 步各切一次到 RL。结果很干净:在 K&K 和 Zebra 上(OPD 到 100 步还在涨),越晚切最终精度越高;在 Countdown 上(OPD 第 20 步就饱和了),三个切换点的最终结果几乎一样。

图10:黑线是全程 OPD,彩色线分别是从第 20/60/100 步切到 RL。切换时刻的 OPD 验证分数基本决定了 RL 之后的天花板——OPD 饱和了再切没损失,没饱和就切会压低上限。主实验默认用第 60 步,位于快速提升段的末尾。
这个结论工程上很省心:你不需要什么复杂的调度器,盯着 OPD 的验证曲线,涨到平台期附近就可以切了。
OPD 是比 SFT 更好的 RL 冷启动。 同一个老师,一组用 OPD 蒸馏,另一组在老师轨迹上做传统 SFT,然后都接 GRPO。切换点上 OPD 已经领先 SFT 4.9 个 p@1(30.3 对 25.4);RL 之后差距进一步放大——OPD-then-RL 在所有 benchmark 上 p@1 继续涨,平均 p@32 还提升了 7.2 个点(51.3 到 58.5);而 SFT-then-RL 的 p@1 只有边际改善,p@32 反而全面退化。冷启动的底子弱,RL 连"扩圈"的机会都没有,只能在贫瘠的支持集里做概率重排。
这个结果其实给 DeepSeek-R1 式的"SFT 冷启动 + RL"流水线提了个醒:如果有一个强老师可用,把冷启动从 SFT 换成 OPD,可能是性价比很高的一步改动。
🤔 我的判断
这篇论文最值钱的地方,是把"RL 和蒸馏怎么结合"这个问题从"设计更精巧的逐点混合公式"拉回到了"安排好时间顺序"这个更朴素的维度,并且用三套相互印证的证据(pass@k、动力学分解、参数符号冲突)把机制讲圆了。很多论文是"方法新颖但解释薄弱",这篇反过来——方法朴素,解释扎实。我个人更喜欢后者。
但也有几处要泼冷水。
数学任务上的优势远没有逻辑任务上那么硬。 31.8 对 31.6 的差距在 AIME 这种 30 题的评测集上基本在噪声范围内,作者用 bootstrap 补救了,态度诚实,但"sequential beats joint"这个大标题的普适性是要打个折扣的。
学生太小了。 主实验是 1.7B 学生配 8B 老师,补充实验有 0.6B 和 OLMo-3-7B(配 32B 老师)。在师生差距巨大、学生能力很弱的 regime 里,"先扩圈再锐化"成立我信;但当学生本身已经很强、pass@k 覆盖已经不是瓶颈时,OPD 阶段还能扩出多少圈、两段式还剩多少优势,论文没有回答。而这个 regime 恰恰是工业界后训练的主战场。
联合方法真的被公平对待了吗? KDRL-Annealing 本质上已经是"半个 sequential"——它靠退火蒸馏权重在后期让 RL 主导,它是唯一接近 OPD-then-RL 的基线,这本身就说明"信号调度"才是关键变量。从这个角度,论文的结论可以更精确地表述为:重要的不是"顺序"这个形式,而是"OPD 信号必须在某个时刻彻底退场"。逐 token 混合的方法败因是蒸馏信号永不退场,而不是"联合"本身。
对工程的启发很直接:如果你在做推理模型的后训练且有强老师,流程可以是 OPD 起手 → 盯验证曲线 → 平台期切纯 RLVR。不用纠结每步的混合权重,不用调 \(\beta\) 退火 schedule(作者也做了 \(\beta\) 消融,加权相加方法对该超参相当敏感,而两段式几乎无超参)。简单、稳、可复现——这在 RL 后训练这个充满玄学调参的领域里,本身就是一种价值。
至于未来,我觉得真正的开放问题是:切换点之后 RL 阶段学生始终在老师支持集内锐化——那有没有办法让 RL 阶段突破老师的支持集?这篇论文的证据表明目前的做法做不到也不需要,但当学生逼近甚至超越老师时,这会成为下一个瓶颈。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我