没有更强的老师怎么办?RISE:让模型从自己的训练轨迹里"外推"出一个未来版的自己

上周翻 arXiv 的时候刷到一篇挺戳我的论文。做 RLVR(reinforcement learning with verifiable rewards,可验证奖励强化学习)的人大概都有这个隐痛:模型答对一道数学题,整条回复里几百个 token 拿到一模一样的优势值。到底哪一步推理立功了、哪一步在划水?奖励信号完全说不上话。

on-policy distillation(OPD,在线策略蒸馏)本来是治这个病的——teacher 在每个 token 位置给出完整的下一个词分布,等于逐字逐句地批改作业,比只看期末分数精细太多了。但 OPD 有个绕不开的死结:teacher 从哪来? 用外部大模型当 teacher,学生一旦走出自己的新路,teacher 面对陌生的前缀就开始胡说(分布失配);用特权信息(比如正确答案)条件化同一个模型来自蒸馏,又受限于模型的 in-context learning 能力,经常蒸馏了个寂寞。

这篇 RISE 给出的答案让我愣了一下:teacher 不需要是任何现成的模型,它可以是模型自己训练轨迹的外推点——拿当前 checkpoint 和一个滞后的锚点 checkpoint 算个位移向量,放大这个位移,你就合成出了一个"未来版"的自己来当老师。零外部模型,零特权信息。

核心摘要

RISE(Recursive Improvement via Self-Extrapolating Policy Distillation,arXiv: 2609.05295)把 RLVR 和 OPD 拧成一个互补循环:RLVR 用结果奖励保证参数更新的方向是"真进步",然后从这段更新里外推出一个更强的合成 teacher,再用 OPD 把这个 teacher 的逐 token 分布蒸馏回学生。由于 teacher 每一轮都随学生的进步而刷新,蒸馏从一次性压缩变成了递归自我改进。实验覆盖数学推理、多领域 STEM、代码生成和多轮 agentic 任务四个家族,RISE 全面超过纯 GRPO 和三种特权条件自蒸馏 baseline,代价只有 1.3–1.6 倍的 wall time,采样成本零增加。我觉得这篇论文最值钱的地方不是那几个点的提升,而是它把"teacher 应该是什么"这个被整个 OPD 文献默认搁置的问题重新拎了出来——最好的 teacher 可能不是更强的模型,而是你自己收敛方向上的未来位置

论文信息

  • 标题:RISE: Recursive Improvement via Self-Extrapolating Policy Distillation
  • 作者:Yang Li, Semih Yavuz, Shafiq Joty(arXiv 页面未标注机构;后两位作者的公开履历指向同一家工业界 AI 实验室)
  • 链接:https://arxiv.org/abs/2609.05295
  • 提交日期:2026 年 9 月 4 日

📖 问题动机:OPD 的 teacher 困境

先把背景捋清楚。RLVR 时代的后训练,不管 GRPO 还是 DAPO,梯度信号都是序列级的:

\[\mathcal{L}_{\text{PG}}=-\mathbb{E}\left[\sum_{t=1}^{T}\hat{A}_{t}\cdot\min\!\Big(\rho_{t},\operatorname{clip}(\rho_{t},1-\epsilon,1+\epsilon)\Big)\right]\]

关键点在于 \(\hat{A}_t\) 对同一条回复里的所有 token 是同一个常数。答对了,连"the answer is"这种废话 token 都跟着沾光;答错了,前面正确的推理步骤也一起背锅。这就是信用分配(credit assignment)瓶颈。

OPD 的解法很直白——别用标量奖励了,用 teacher 的完整分布做逐 token 监督:

\[\mathcal{L}_{\text{OPD}}=\mathbb{E}_{y\sim\pi_{\theta}}\left[\sum_{t=1}^{T}D_{\mathrm{KL}}\!\left(\pi_{\theta}(\cdot\mid x,y_{<t})\;\|\;\pi_{T}(\cdot\mid x,y_{<t})\right)\right]\]

信号密度上去了,但麻烦也跟着来了。现有的 teacher 方案大致两派,各有各的病:

方案 teacher 是谁 核心病灶
外部 teacher OPD 同家族更大的模型 学生探索出新推理路径后,teacher 在陌生前缀上的分布不可靠——前缀分布失配
特权条件自蒸馏(OPSD) 同一个模型+正确答案等特权上下文 受限于 ICL 能力,特权信息经常喂不进去;teacher 和学生看到的输入还不一样
启发式补丁 同上 token 级门控、散度混合、DAgger 采样、轨迹精修——全在容忍一个坏 teacher,没人问 teacher 本身该是谁

说实话,看到作者把这个病灶总结成"all these approaches accept a flawed teacher as given"的时候我是有点共鸣的。之前试过拿大模型给小模型做在线蒸馏,训练前期效果很漂亮,等学生风格跑偏之后 teacher 的监督就开始变成负资产。这篇论文的诊断和我在工程上踩的坑对得上。

🧠 方法核心:把训练轨迹变成 teacher 生产线

一句话直觉

如果后训练的参数轨迹近似是低维且接近线性的(有大量文献支持这一点,后面细说),那么"当前 checkpoint 比锚点 checkpoint 强多少"这个位移向量,就大致指向了收敛方向。把这个位移放大一倍多,你就站在了一个"还没训练到但大概率会更强"的位置上——用这个位置的策略当 teacher。

写成公式,设 \(\varphi\) 是把策略映射到某个线性空间(参数或 logit)的表示映射:

\[\varphi(\pi_{\text{future}})=\varphi(\pi_{\theta_n})+\beta\cdot\big(\varphi(\pi_{\theta_{n+1}'})-\varphi(\pi_{\theta_n})\big),\quad \beta \gt 1\]

\(\beta=1\) 时 teacher 就是刚更新完的 checkpoint,蒸馏退化成没信号;\(\beta \gt 1\) 时 teacher 站在训练方向的延长线上,超前于当前模型。

图1a:外推几何示意图

图1a:外推的几何直觉。蓝色箭头是 RLVR 把 \(\theta_n\) 推到 \(\theta'_{n+1}\);红色虚线是外推——沿相同方向再走 \(\beta\) 倍,合成出 \(\theta_{\text{future}}\);绿色箭头是蒸馏,把学生 \(\theta_{n+1}\) 拉向外推 teacher,最终落在更靠近最优点 \(\theta^*\) 的位置。整个操作发生在表示空间 \(\varphi\) 里,背景等高线显示外推方向恰好指向低 loss 区域。

两个空间的外推

\(\varphi\) 选什么,就得到一族不同的实例化:

权重空间外推\(\varphi=\theta\)),就是带外推系数的 task arithmetic:

\[\theta_{\text{future}}=\theta_n+\beta\cdot(\theta_{n+1}'-\theta_n)\]

直接物化出一个新模型的参数,teacher 是真实存在的网络。

logit 空间外推\(\varphi=\log\pi\)),在每个上下文 \(s_t=(x,y_{<t})\) 上对输出 log 概率做外推:

\[\log\pi_{\text{future}}(\cdot\mid s_t)=\log\pi_{\theta_n}(\cdot\mid s_t)+\beta\cdot\big(\log\pi_{\theta_{n+1}'}(\cdot\mid s_t)-\log\pi_{\theta_n}(\cdot\mid s_t)\big)+\text{const}\]

等价于几何混合 \(\pi_{\text{future}}\propto\pi_{\theta_n}^{1-\beta}\cdot\pi_{\theta_{n+1}'}^{\beta}\)——放大的是"新模型相对旧模型的概率比"。teacher 不需要物化参数,两次前向加缓存的 top-K logit 就能算出来。

两者的关系也挺干净:logit 空间外推是权重空间外推在 \(\theta_n\) 处的一阶泰勒近似。\(f\)(参数到 logit 的映射)是线性时两者严格相等,神经网络下会分叉。论文里两种都做了,结果互有胜负——说明增益来自"外推"这个原理本身,而不是某个具体空间的黑魔法。

一个漂亮的分解

这个设计最让我拍案的地方是 Remark 1 里的 KL 分解。对几何混合 teacher,蒸馏损失可以拆成:

\[D_{\mathrm{KL}}(\pi_{\theta}\|\pi_{\text{future}})=-(\beta-1)\,D_{\mathrm{KL}}(\pi_{\theta}\|\pi_{\theta_n})+\beta\,D_{\mathrm{KL}}(\pi_{\theta}\|\pi_{\theta_{n+1}'})+\log Z\]

\(\beta \gt 1\) 时第一项系数是负的——排斥项,把策略从旧锚点推开,延续 RLVR 的改进方向;第二项是吸引项,把策略拉向刚更新完的 checkpoint,防止 OPD 阶段冲过头。一推一拉,而且全部发生在 token 级。一个蒸馏 loss 里同时装进了"继续往前走"和"别走太猛"两种力,这个设计真的挺精巧的。

训练循环:RLVR 和 OPD 的互补咬合

图1b:RISE 训练循环

图1b:RISE 的四步递归循环。① 学生 \(\theta_n\) 生成多条 rollout;② 用结果奖励做 RLVR 更新得到 \(\theta'_{n+1}\),这一步回答"哪些回复成功了";③ 从 \(\theta_n\)\(\theta'_{n+1}\) 外推出合成 teacher \(\theta_{\text{future}}\)\(\beta \gt 1\));④ 把 teacher 的逐 token 分布蒸馏回学生得到 \(\theta_{n+1}\),这一步回答"每个 token 该怎么改进"。循环往复,teacher 每轮随学生一起变强。

每一轮迭代两个阶段,有个很实在的细节:两个阶段复用同一批 rollout。RLVR 采样的回复直接喂给 OPD 用,采样成本零增加。复用 RLVR 更新前的 rollout 会引入轻微的 off-policy 性,但分布损失对任意输入序列都是良定义的,不需要重要性采样修正——消融实验也证实影响可以忽略。

两个工程上必须有的设计:

外推衰减。固定的 \(\beta\) 全程不适用。论文附录里 Proposition 3 证明,在线性轨迹模型下,安全外推范围随策略逼近最优而收窄——早期 \(\beta\) 大一点没事,后期还猛外推就会冲过 \(\pi^*\)。所以用线性衰减 \(\beta_n=1+(\beta_0-1)(1-n/N)\),默认 \(\beta_0=1.2\) 衰减到 1。早期大胆外推,后期保守收缩。

锚点动力学。锚点默认是上一个 checkpoint,也可以用 EMA 锚点 \(\theta_{\text{anchor}}\leftarrow(1-\eta)\theta_{\text{anchor}}+\eta\theta_{n+1}\)。EMA 让锚点滞后于当前策略,既平滑了多轮的方向,又放大了位移长度。Qwen 系用 \(\eta=0.1\),OLMo 用 \(\eta=1\)——这个分歧后面消融里很有意思,细说。

最后一个值得想清楚的问题:既然外推出了 \(\theta_{\text{future}}\),为什么不直接拿它当下一轮策略,非要蒸馏一道?作者的回答是:外推点躺在策略的信任域之外,\(\beta\) 大的时候直接采用会有退化风险,还会放大 RLVR 单步更新里的噪声。OPD 在这里扮演的是信任域投影——把策略往 teacher 的逐 token 分布上靠,同时 KL/JSD 项把更新锚在 \(\theta'_{n+1}\) 附近。实际损失用的是 JSD 而不是 KL(JSD 有上界 \(\log 2\),数值更稳,且和 KL 共享唯一最优解 \(\pi_\theta=\pi_{\text{future}}\))。

凭什么外推是合法的?

这是整篇论文的地基,作者引了一串收敛的经验证据:model merging 文献里 task vector 的可组合线性性(task arithmetic)、linear mode connectivity、model soups 的 checkpoint 平均能涨点;更近的 RLVR 分析发现参数更新被一个 rank-1 子空间主导、投影系数随训练近线性演化,OPD 的累积更新也会迅速锁进一个窄低维通道。作者自己的 run 里,三个方向就捕获了约 87% 的轨迹方差。

有个类比我觉得很妙:model soups 用同样的线性结构做内插\(\beta\in[0,1]\))换鲁棒性,RISE 用同样的结构做外推\(\beta \gt 1\))换能力。一体两面。

而且 RISE 不要求严格线性——低维子空间约束本身就限制了外推能偏出真实轨迹多远。这个论证比"假设它是线性的"要诚实。

跟最像的工作划清界限

必须提一句 ExOPD:它的最优策略形式和 RISE 的 logit 空间公式(那个几何混合)结构上一模一样。区别在于 teacher 的动力学——ExOPD 的 teacher 是训练前固定好的外部强模型,Theorm 2 里那个 teacher 差距项 \(J(\pi^*)-J(\pi_T)\) 是常数,是焊死的天花板;RISE 的 teacher 每一轮都跟着学生的 RLVR 更新往前走,天花板被拆了。当然,ExOPD 需要外部强模型,而这恰是 RISE 要消灭的东西,所以两者没法直接对打。

📊 实验:四个任务家族,全面压制

实验阵容相当扎实:数学推理(Qwen3-8B / 1.7B / 1.7B-Base 训 DAPOMath,OLMo3-7B-Instruct-SFT 训 OpenR1-Math-46K)、多领域混合(Qwen3-4B-Base 训数学+STEM,沿用 Guru 的语料设置)、代码生成(Qwen3-8B-Base 训 Skywork-OR1-Code)、agentic 任务(Qwen2.5-3B-Instruct 训 ALFWorld 和 WebShop,沿用 GIGPO 设置)。模型跨度 1.7B 到 8B,架构跨 Qwen 和 OLMo 两族。

baseline 的选择很讲究:GRPO 是 RLVR-only 基线;GRPO+SDPO、SDAR、RLSD 三个都用同一个特权 teacher(学生条件化在同源正确解答上),只是融合方式不同——一个加辅助 KL loss,一个用 teacher-student 概率差门控优势,一个重加权优势估计。也就是说,对比隔离的变量恰好是"teacher 从哪来",而不是"怎么融合 teacher 信号"。这个实验设计是懂行的人做的。

数学推理主表

方法 Qwen3-8B Math Avg Qwen3-1.7B Math Avg OLMo3-7B Math Avg
Base 43.2 31.3 27.7
GRPO 60.0 45.4 47.6
GRPO+SDPO 55.9 43.2 48.2
SDAR 59.7 45.5 49.6
RLSD 59.8 43.2 45.9
RISE (logit) 62.5 50.2 56.4
RISE (weight) 62.7 49.2 53.7

几个值得盯的数:

  • OLMo3-7B 上提升最狠:RISE (logit) 把 Math Avg 从 47.6 拉到 56.4,涨了 8.8 个点;AIME'24 单项从 30.2 干到 46.9,涨了 16.7 个点。竞赛级难题上的收益远大于普通题。
  • 特权条件 baseline 集体哑火:GRPO+SDPO 在 Qwen3-8B 上 55.9,比纯 GRPO 的 60.0 还低 4 个点——特权 teacher 没帮上忙反而拖了后腿。SDAR 和 RLSD 好点,但基本贴着 GRPO 的 ±2 个点晃。这直接佐证了作者的判断:特权条件 teacher 被 ICL 能力卡了脖子,换什么融合姿势都救不回来。
  • OOD 不掉点:Qwen3-8B 的 OOD Avg 从 GRPO 的 70.6 微涨到 RISE (weight) 的 72.0,OLMo 从 51.2 涨到 55.5。逐 token 精修没有把通用能力修坏。
  • 多种子可复现:Qwen3-8B 上 RISE (weight) 62.4±0.2 对 GRPO 60.1±0.2,三个种子。

多领域、代码、agentic

多领域混合训练(Qwen3-4B-Base,数学+STEM)是个更难的场景——位移向量聚合了异质领域的进步,外推方向会不会被"稀释"?结果没有:RISE (weight) Math Avg 44.8(GRPO 40.2)、STEM Avg 47.5(GRPO 45.5)双料第一,AIME'24 涨 5.0 个点的同时 TheoremQA 也涨 3.7 个点。

代码生成(HumanEval+/MBPP+)上 RISE 收敛更快——RISE (logit) 第 50 步追平 GRPO 第 90 步的最终精度——但最终精度打平,作者也坦诚说这些 benchmark 饱和太快。

agentic 任务是我觉得最能说明泛化性的一组:

方法 ALFWorld WebShop Score WebShop Acc
Base 21.9 6.7 0.8
GRPO 75.0 79.8 63.3
RISE (logit) 78.1 78.8 68.0
RISE (weight) 84.4 86.3 74.2

ALFWorld 成功率 +9.4,WebShop Acc +10.9。奖励稀疏、延迟、多轮决策的场景下外推原理照样成立。等等,这里 logit 版在 WebShop Score 上甚至比 GRPO 略低(78.8 vs 79.8)——不是每个格子都赢,但整体趋势是清楚的。

🔬 分析实验:外推到底帮了什么?

这部分是全文我最喜欢的部分,作者把两个阶段的各自贡献拆得很干净。

拆掉 RLVR → 当场暴毙。把 RLVR 阶段整个拿掉,只靠自蒸馏产生位移再外推,60 步内训练崩溃:MATH-500 从 base 水平跌到 2.4%,回复长度从 2K 爆炸到 8K 上限,奖励归零。原因不难想——没有结果奖励锚定,位移是纯自指的,每轮都沿"自己上一轮的移动方向"放大,几轮下来就把策略推进了不停生成、永不终止的退化区。这个实验把"RLVR 负责接地"这件事证得很死。

拆掉 OPD → 增益消失。直接把外推出的 \(\theta_{\text{future}}\) 当下一轮策略(相当于在权重空间迈更长的步子),训练稳定但平均分几乎不动:Qwen3-8B 从 60.0 到 60.3,1.7B 从 45.4 到 45.6。对比 RISE 的 +2.7 和 +4.8,可以下结论:增益来自蒸馏这个投影动作,不是来自步子大。长步只是搬动了策略,蒸馏才把外推方向兑换成跨 benchmark 的一致提升。

安全外推范围随训练收窄。这个实验做得很直接:拿 Qwen3-1.7B 的 GRPO checkpoint,物化 \(\theta_{\text{base}}+\beta(\theta_n-\theta_{\text{base}})\) 测 AIME'24。第 50 步时 \(\beta=2.0\) 还能加 7.3 个点;到第 100 步同样的 \(\beta\) 直接掉 15 个点;到第 200 步 \(\beta=1.5\) 都要亏 7.7 个点。这就是 \(\beta\) 必须衰减的实证依据,也是预实验里 \(\beta_0=2.0\) 会发散的原因——线性衰减降得不够快,躲不开后期那个危险区。

覆盖面没缩。蒸馏的常见担忧是把策略锐化在已有解上、牺牲多样性。测了 avg@16 和 pass@16 的差:1.7B 上 RISE (logit) 把 AIME'24 pass@16 拉了 9.6 个点(avg@16 只涨 6.3)——外推 teacher 扩大的是可解问题集合,不只是把已有解磨得更亮。8B 上这个效应弱一些,base 已经强了,头部空间本来就小。

🔧 消融:哪些设计真的重要

消融项 结论
\(\beta_0\)(Qwen3-8B,线性衰减) 1.2→62.5,1.3→62.3,1.5→61.9,\(\beta_0=2.0\) 预实验直接发散;1.2 到 1.5 都稳
衰减 schedule cosine 63.0 / linear 62.5 / exp 62.0 / 固定 61.8——衰减形式不敏感,但任何形式都好过不衰减
锚点 \(\eta\)(Qwen3-1.7B logit) \(\eta=1.0\)→46.2,\(\eta=0.3\)→48.4,\(\eta=0.1\)→50.2,EMA 单调更优;但 OLMo 上反过来\(\eta=1.0\) 的 56.4 吊打 \(\eta=0.1\) 的 50.1
rollout 复用 vs 重采样 8B 上打平(62.5 对 62.5),1.7B-Base 上复用还略好(29.2 对 28.4)——复用是实用的默认选择,采样成本直接减半
计算量对齐(GRPO-2×) GRPO 多做一个梯度 pass 只涨 +1.9(1.7B)/ +0.5(8B),RISE 同预算涨 +4.8 / +2.7——增益来自监督质量,不是多算了几步

OLMo 和 Qwen 在 \(\eta\) 上的对立值得单独说一句。作者的解释是:OLMo 上 GRPO 的单步更新本身就大而稳,EMA 平滑没必要,锚点滞后反而拖了后腿。这个观察挺诚实的——说明 RISE 不是"一套超参打天下",锚点策略得看底层 RL 动力学的噪声水平。

成本账也得算清楚:OPD 复用 RLVR 的 rollout,额外开销只有 OPD 梯度阶段和锚点前向。8B 上约 1.6 倍 GRPO wall time,1.7B 上约 1.3 倍。小模型相对开销更低,因为采样(两种方法共享)在小模型上占了大头——1.7B 时占 GRPO 墙钟的 73%。

💡 我的判断

亮点

第一,问题提得好。整个 OPD 文献在"怎么容忍一个坏 teacher"上卷了一整年,token 门控、散度混合、DAgger、轨迹精修,全是对症下药;RISE 是少数回头问"teacher 该是什么"的工作,而且答案出人意料地简单——你自己的训练轨迹里就藏着 teacher。

第二,外推这个动作的理论支撑不是空口白话。rank-1 子空间主导、近线性演化、自己 run 里三个方向 87% 方差,加上附录的次优性分解(Theorem 2)和安全范围命题(Proposition 3),还有图 6 那个"安全范围收窄"的直接实证。理论和实验咬合得很紧。

第三,实验矩阵的变量隔离做得干净。三个特权条件 baseline 共享同一个特权 teacher、只改融合方式,这让"teacher 来源才是瓶颈"这个结论相当有说服力。GRPO+SDPO 比纯 GRPO 还差,是个很有冲击力的负结果。

疑虑

一是天花板问题。RISE 的 teacher 是自己轨迹的外推,它能把已有的改进方向放大,但不能引入 RLVR 奖励信号里没有的新信息——作者自己也承认了这点。如果 base 模型在某个能力维度上完全没有起步迹象,位移向量里就没有这个方向,外推放大零还是零。所以 RISE 更像是"RLVR 的放大器"而不是能力发现器,它替代不了更好的奖励设计。

二是 reward hacking 的放大风险。论文局限性里写得很坦白:RISE 继承 RLVR 奖励里的一切偏差,奖励可被 hack 时,外推放大的是虚假方向。考虑到图 5a 里无接地的外推 60 步就崩,我对"带偏见奖励下的长期递归外推"是有点担心的——崩溃和缓慢腐化之间的边界在哪,论文没回答。

三是 8B 以上的可扩展性没测。低秩线性假设在 1.7B–8B 上成立,到了 30B、70B 这个量级,轨迹还高维不高维、\(\beta\) 安全区会不会窄到没法用,都是开放问题。作者局限里也承认"何时外推变得不可靠"缺乏原理性的检测手段,目前靠衰减 schedule 和 EMA 锚点这些经验补丁兜底。

跟同期工作比:相比 ExOPD(固定外部 teacher 的奖励外推),RISE 干掉了外部依赖和静态天花板;相比 SDPO/SDAR/RLSD 这一票特权条件自蒸馏,RISE 干掉了特权上下文。定位上它不是融合策略的微创新,而是 teacher 构造这个更底层环节的替换——我觉得算范式层面的小突破,虽然每个零件(task arithmetic、几何混合、EMA 锚点)单拎出来都不新。

📝 收尾

如果你正在做 RLVR 后训练,RISE 大概是目前"零外部资源增强 RLVR"这条线上最值得试的方案之一:改动小(两阶段循环、复用 rollout)、超参不敏感(\(\beta_0\in[1.2,1.5]\) 都稳)、成本可控(1.3–1.6 倍墙钟)。真正要盯的是两件事——你的奖励信号够不够干净(外推会放大一切方向,包括错的),以及你的轨迹低秩假设成不成立(三个方向能不能扛住大部分方差)。

还有一个更本质的问题被这篇论文撩起来了:如果训练轨迹本身就能当 teacher,那"自我改进"的极限到底在哪?RLVR 接地保证了方向不假,但方向的源头仍然是奖励。递归外推会不会只是把有限的奖励信息摊得更薄、摊得更细?这个问题,恐怕要留给下一篇论文了。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我