RSTG:只在失败处蒸馏——自适应教师指导恢复负零方差组的学习信号
论文:Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance arXiv:2608.00782(2026-08-01 提交,cs.CL) 作者:Zhuowen Han, Jinwei Xiao, Zhengxi Lu, Renren Jin, Zhiyuan Yao, Yuxin Liu, Hongyan Hao, Yueqing Sun, Yu Yang, Qi Gu, Xunliang Cai, Deyi Xiong(天津大学 TJUNLP Lab × 美团 LongCat 团队,通讯作者 Deyi Xiong) 链接:https://arxiv.org/abs/2608.00782
一、一句话总结
GRPO 在组内 rollout 全错(负零方差提示)时梯度为零,而朴素地把在线策略蒸馏(OPD)加进 GRPO 反而更差;RSTG 提出"只在学生失败且教师擅长的地方蒸馏"——样本级按教师置信度加权、token 级只选高熵/大分歧 token、再辅以教师正确轨迹的 SFT 注入正梯度,在数学上比 naive GRPO+OPD 提升 +4.02%、代码上 +3.05%。
二、研究背景与动机
2.1 RLVR 与 GRPO 的梯度消失问题
基于可验证奖励的强化学习(RLVR)已成为 LLM 后训练标准范式(Qwen3、DeepSeek-R1、Gemini 2.5 等)。GRPO 对一组 rollout 的结果奖励做组内归一化得到标量优势,统一施加到每个 token,导致两个痛点:
- 奖励稀疏:只有序列级 0/1 奖励;
- 梯度消失:当组内所有 rollout 全对或全错时,优势坍缩为零,梯度完全消失。论文将这两类提示分别称为正零方差提示(positive zero-variance prompts)与负零方差提示(negative zero-variance prompts)。
2.2 OPD 是天然补救,但 naive 组合会失败
在线策略蒸馏(OPD)让学生生成自己的 rollout,用教师的逐 token log 概率提供密集监督,理论上正好弥补 GRPO 的稀疏性。然而实验发现(Figure 1),直接相加 GRPO 与 OPD 损失效果甚至不如纯 GRPO。论文归因于三点:
- 样本级均匀性(Sample-level Uniformity):并非所有样本都受益于蒸馏,教师指导质量取决于教师对该样本的熟练程度;
- 教师有界性(Teacher-boundedness):OPD 收敛快但上限被教师封顶,过早向教师收敛会严重损害 RL 的探索能力;
- 优势不对称(Advantage Asymmetry):教师通常给学生生成的 token 分配低概率,导致大多数 token 级优势为负,学习信号被抑制;且 OPD 本质上是局部的——以可能错误的学生前缀为条件,产生不可靠梯度。
三、方法:RSTG
核心思想:仅在"学生失败而教师擅长"的地方精确施加蒸馏。整体流程(Figure 2):遇到负零方差提示时激活 RSTG 分支,其余提示走标准 GRPO 分支。
3.1 样本级选择 + 教师置信度加权
动机实验:将 57K 数学数据集 𝒟 按模型表现划分为嵌套子集: - 𝒟_sw(9K):学生 8 次 rollout 全失败(mean@8 = 0); - 𝒟_swtr(2K):𝒟_sw 的子集,教师成功率满分(mean@8 = 1)。
关键发现(Figure 3):只在"学生错且教师对"的样本上做 OPD,仅用 3.63% 的数据就超过在全量数据上做 OPD。这类样本恰好对应 GRPO 中的负零方差提示。
混合优势函数(Eq. 9):
其中 ω_i ∈ [0,1] 为教师的 mean@8 分数(教师置信度代理),β 为控制 OPD 信号强度的缩放超参(线性退火)。教师越自信,蒸馏权重越大。
3.2 Token 级选择
目的:减缓学生向教师收敛、降低梯度噪声。受 TIP 启发,选取两类高价值 token:
- 高熵 token(学生不确定,通常是关键推理节点):h_t = −Σ_v p_{t,v} log p_{t,v}(Eq. 10)
- 大分歧 token(师生差异大、信息量更丰富):d_t = |A^OPD_{i,t}|(Eq. 11)
对二者做 min-max 归一化后用 Soft-OR 合成选择分数(Eq. 12):
Token 掩码 OPD 优势(Eq. 13):仅保留按 s_t 排序的 top-k% token,其余置零。
3.3 辅助 SFT 增强
问题:负零方差提示上的 OPD 优势在整个训练过程中始终比正零方差提示更负(Figure 4),形成纯惩罚性、无建设性的优化信号。
方案:对负零方差提示,在教师预生成的正确轨迹上附加 SFT 损失。论文从统一 RL 视角论证:SFT 等价于给教师轨迹每个 token 赋予均匀正优势 A^SFT_t = 1,从而注入纯正梯度、提供解空间全局视角、缓解优势不对称。
最终训练目标(Eq. 14):
J_Final(θ) = J_GRPO(θ; β·ω_i·Â^OPD_{i,t}) + β·J_SFT(θ) 若 r_j = 0, ∀j ∈ G
= J_GRPO(θ; A^GRPO_{i,t}) 否则
SFT 与 OPD 共享同一系数 β,保证正则强度一致。SFT 数据构建:每提示从教师预采样 n=8 个响应,保留最短的正确响应作为参考;离线生成,零训练成本(57K 数据、2 张 A100 约 2 小时)。
四、实验设置
4.1 模型对(3 对师生,覆盖 2 个模型家族)
| 编号 | Student | Teacher |
|---|---|---|
| Pair ❶ | Qwen3-1.7B-Instruct | Qwen3-4B-Instruct-2507 |
| Pair ❷ | Qwen3-4B-Instruct | Qwen3-4B-Instruct-2507 |
| Pair ❸ | Qwen2.5-3B-Instruct | Qwen2.5-14B-Instruct |
4.2 数据与评估
- 训练数据:数学为 DeepMath 中筛选难度 ≥6 的 57K 样本;代码为 Eurus-RL-Code(25K)。
- 评估基准:数学——AIME 2024 / AIME 2025 / MATH-500 / OLMPIAD Bench;代码——APPS(均匀抽 500 题、三难度等量)、MBPP+。
- 采样:temperature=1.0,top-p=1.0,最大长度 8192;数学每题 16 解、代码每题 4 解。
4.3 实现细节
batch size=256,rollout 数 8,学习率 1e-6,禁用 thinking 模式;数学训 550 步、代码 400 步;β 线性退火(β_init=5e-3,δ=5e-5,β_min=1e-3);基于 VeRL,8×A100。
4.4 Baselines(5 个)
GRPO、OPD、GRPO+OPD(naive 组合,遵循 KDRL 配置,从全样本/学生失败样本/负零方差提示三种变体取最佳)、ReLIFT(负零方差提示上用 ground-truth 做 SFT)、RL-ZVP(对零方差提示设计基于 token 熵的非对称优势)。
五、主要结果(Table 1)
Pair ❶:Qwen3-1.7B → Qwen3-4B-2507
| Method | AIME24 | AIME25 | MATH500 | OLMPIAD | MATH AVG | APPS | MBPP+ | CODE AVG |
|---|---|---|---|---|---|---|---|---|
| Vanilla | 12.08 | 10.83 | 72.66 | 40.26 | 39.96 | 30.80 | 49.22 | 40.01 |
| OPD | 32.29 | 20.62 | 84.32 | 53.46 | 47.67 | 32.41 | 75.10 | 53.76 |
| GRPO | 34.79 | 27.71 | 88.64 | 55.15 | 51.57 | 50.39 | 69.66 | 60.03 |
| GRPO+OPD | 35.21 | 26.88 | 88.27 | 55.13 | 51.37 | 57.03 | 72.06 | 64.55 |
| ReLIFT | 35.21 | 30.42 | 88.65 | 55.79 | 52.52 | 60.17 | 60.98 | 60.58 |
| RL-ZVP | 31.87 | 25.62 | 86.99 | 53.46 | 49.49 | 49.73 | 70.12 | 59.93 |
| RSTG | 42.98 | 31.87 | 89.36 | 57.36 | 55.39 | 61.81 | 72.41 | 67.11 |
Pair ❷:Qwen3-4B → Qwen3-4B-2507
| Method | AIME24 | AIME25 | MATH500 | OLMPIAD | MATH AVG | APPS | MBPP+ | CODE AVG |
|---|---|---|---|---|---|---|---|---|
| Vanilla | 24.38 | 18.33 | 83.84 | 52.20 | 44.69 | 43.93 | 74.22 | 59.08 |
| OPD | 50.83 | 40.63 | 91.93 | 63.71 | 61.78 | 53.10 | 86.19 | 69.65 |
| GRPO | 54.37 | 45.00 | 94.29 | 66.08 | 64.94 | 65.29 | 77.82 | 71.56 |
| GRPO+OPD | 50.42 | 41.87 | 93.95 | 67.25 | 63.37 | 73.46 | 84.53 | 79.00 |
| ReLIFT | 58.13 | 42.71 | 94.74 | 64.61 | 65.05 | 76.12 | 85.41 | 80.77 |
| RL-ZVP | 50.42 | 42.71 | 93.54 | 63.41 | 62.52 | 68.16 | 82.98 | 75.57 |
| RSTG | 57.08 | 47.92 | 95.30 | 67.24 | 66.89 | 75.68 | 88.42 | 82.05 |
Pair ❸:Qwen2.5-3B → Qwen2.5-14B
| Method | AIME24 | AIME25 | MATH500 | OLMPIAD | MATH AVG | APPS | MBPP+ | CODE AVG |
|---|---|---|---|---|---|---|---|---|
| Vanilla | 4.58 | 1.25 | 62.14 | 27.04 | 23.75 | 16.60 | 62.84 | 39.72 |
| OPD | 6.67 | 1.46 | 63.56 | 28.98 | 25.17 | 23.14 | 66.63 | 44.89 |
| GRPO | 6.04 | 3.33 | 68.16 | 32.09 | 27.41 | 37.18 | 66.63 | 51.91 |
| GRPO+OPD | 6.88 | 4.58 | 67.68 | 31.95 | 27.77 | 49.72 | 73.37 | 61.55 |
| ReLIFT | 6.46 | 2.71 | 67.44 | 32.05 | 27.17 | 52.60 | 71.50 | 62.05 |
| RL-ZVP | 6.46 | 3.33 | 67.24 | 31.72 | 27.19 | 42.03 | 71.01 | 57.52 |
| RSTG | 8.33 | 5.42 | 68.14 | 32.74 | 28.66 | 53.01 | 74.03 | 63.52 |
结果要点
- 数学:naive GRPO+OPD 相对 GRPO 变化 −0.2% / −1.57% / +0.36%(基本无效甚至有害);RSTG 相对 naive GRPO+OPD 提升 +4.02% / +3.52% / +0.89%。
- 代码:naive GRPO+OPD 相对 GRPO +4.52% / +7.44% / +9.64%;RSTG 再进一步提升 +2.56% / +3.05% / +1.97%。
- Pair ❷ 师生同为 4B、能力差距小,收益相对较弱——印证 OPD 依赖师生能力差。
- 训练动态(Figure 5):RSTG 在几乎每个训练步都优于所有基线。
附加分析
- 优势不对称缓解(Figure 6):RSTG 的优势值更高,更多 token 获得正向学习信号。
- 收敛速度:以师生 top-16 token 重叠率衡量,step 200 时 OPD=69.7%、naive GRPO+OPD=67.6%、RSTG=65.81%——RSTG 减慢向教师收敛,保留更大探索空间。
- 响应长度(Figure 7):OPD 存在长度骤胀问题,RSTG 有效抑制,与 GRPO 相当。
- 计算成本:负零方差提示初始约占训练步的 15.6%,随模型提升而下降;RSTG 相对标准 GRPO 额外开销很小(8×A100、550 步约 +12 小时)。
六、消融实验
6.1 组件逐步叠加(Table 3,Pair ❶,数学)
| 配置 | AIME24 | AIME25 | MATH500 | OLYMPIAD | AVG |
|---|---|---|---|---|---|
| GRPO | 34.79 | 27.71 | 88.64 | 55.15 | 51.57 |
| GRPO+OPD(全样本) | 35.62 | 24.79 | 86.76 | 55.55 | 50.68 |
| GRPO+OPD(仅负零方差) | 35.21 | 26.88 | 88.27 | 55.13 | 51.37 |
| +优势加权 | 36.88 | 28.75 | 88.74 | 56.39 | 52.69 |
| +Token 选择 | 37.92 | 29.58 | 88.75 | 56.69 | 53.24 |
| +SFT(完整 RSTG) | 42.98 | 31.87 | 89.36 | 57.36 | 55.39 |
每个组件均有实质贡献,其中 SFT 增强提升最大(+2.15 AVG)。反证实验:移除教师置信度加权和 token 选择后,数学 AVG 降至 51.74%,甚至低于 ReLIFT(52.52%)——说明没有精心设计的 OPD 反而有害。
6.2 β 系数策略(Table 2,数学)
| 策略 | AIME24 | AIME25 | MATH500 | OLMPIAD | AVG |
|---|---|---|---|---|---|
| 退火 β_init=5e-3 | 35.21 | 26.88 | 88.27 | 55.13 | 51.37 |
| 退火 β_init=1e-2 | 36.04 | 26.46 | 87.35 | 54.01 | 50.97 |
| 常数 β=5e-3 | 35.00 | 25.21 | 87.40 | 53.32 | 50.23 |
| 常数 β=5e-2 | 34.79 | 24.58 | 86.55 | 52.18 | 49.53 |
| 常数 β=1e-1 | 32.08 | 24.38 | 85.81 | 51.51 | 48.45 |
结论:常数 β 始终损害性能(OPD 上限低于 GRPO,过拟合教师);退火初值过大导致过早收敛、过小则信号太弱。
七、图表索引
| 图表 | 内容 |
|---|---|
| Figure 1 | MATH 训练动态:naive GRPO+OPD 无效,RSTG 更高 |
| Figure 2 | RSTG 框架:负零方差提示走 RSTG 分支(置信度加权 OPD + token 掩码 + 教师参考答案 SFT),否则走标准 GRPO |
| Figure 3 | 不同数据划分(全量 𝒟 / 学生错 𝒟_sw / 学生错且教师对 𝒟_swtr)上做 OPD 的表现,验证样本选择动机 |
| Figure 4 | 训练中正/负零方差提示上的 OPD 优势曲线:负零方差优势持续更负 |
| Figure 5 | 三个模型对在 MATH500 上的训练动态 |
| Figure 6 | RSTG vs naive GRPO+OPD 训练期间优势值对比 |
| Figure 7 | RSTG vs OPD 响应长度曲线:RSTG 抑制长度骤胀 |
| Figure 8 | 组件逐步添加时数学基准性能变化 |
| Figure 9/10 | Pair ❶ / ❸ 全程训练在数学各基准上的表现 |
| Table 1 | 三对模型主结果;Table 2 β 策略消融;Table 3 组件消融 |
八、结论与局限
结论:RSTG 通过三项设计解决 naive GRPO+OPD 的性能退化——(1) 仅在学生未掌握的困难样本(负零方差提示)上施加 OPD 并按教师熟练度加权;(2) 细粒度 token 选择减缓收敛、降低梯度噪声;(3) 辅助 SFT 注入正梯度并提供全局视角。在两个领域、三对模型上均一致优于标准 GRPO 与 naive GRPO+OPD。
局限:仅在数学和代码两个领域验证,未探索 agentic 任务;受算力限制及 OPD 对师生能力差距的要求,实验规模有限,更大规模的有效性留待未来工作。
九、个人点评
- 问题定位精准:把"GRPO 零梯度"与"OPD 教师封顶"两个已知痛点对齐到同一批样本(负零方差提示)上,"distill where you fail"的样本选择逻辑简洁且有数据支撑(3.63% 数据超过全量蒸馏)。
- SFT 的统一 RL 视角(SFT ≡ 全 token 正优势)为"RL+SFT 混合训练"提供了干净的理论解释,这一视角本身有迁移价值。
- 工程上友好:SFT 数据离线预生成、额外开销仅约 12 小时/550 步,易于复现落地。
- 隐忧:方法依赖一个足够强且与学生有合适能力差的教师(Pair ❷ 收益明显变弱),ω_i 需要教师额外 rollout 估计 mean@8;top-k% 的 k 值与 β 退火计划是新的调参面。