固定谱、自由帧:ISO 把 RLVR 训练提速 2.7×,还不丢点
你有没有过这种别扭感觉——RLVR(可验证奖励强化学习)现在如火如荼地把模型从 Qwen 训到 DeepSeek,从 AIME 训到 Codeforces,但你手里那把"优化器",说到底还是预训练留下的 AdamW?
论文 arXiv:2607.19331 的作者们显然也觉得别扭。他们做了一件简单但漂亮的事:把权重矩阵做 SVD 分解 \(W = U\Sigma V^\top\),然后盯着 RLVR 训练全程看——\(\Sigma\)(谱)到底变了没?
答案是:基本没变。
谱不变,方向变。这个观察被他们命名为 spectral inheritance(谱继承),并由此设计出一整套叫 ISO(Isospectral Optimization,等谱优化)的优化栈:复用基模型的谱 \(\Sigma_0\),只优化两侧奇异方向 \((U, V)\)。在 1.5B–8B 规模上,ISO-AdamW 在 Qwen3-8B-Base 上用 100 步就达到了 AdamW 270 步的聚合精度,少了 2.7× 训练步数,并且还能再涨到 0.509(vs AdamW 的 0.495)。离线版本 ISO-Merger 还能把多个 RL 专家无数据、无 rollout、无蒸馏地合到一起,拿到当下 data-free 合并方法里最强的聚合表现。
核心摘要
论文来自 UT Austin(Hanqing Zhu、Zhangyang "Atlas" Wang 等)+ Meta AI(Yuandong Tian)+ 普渡大学,由 11 位作者于 2026 年 7 月 21 日挂在 arXiv 上。完整作者列表:Hanqing Zhu、Wenyan Cong、Zhizhou Sha、Sagnik Mukherjee、Xinyuan Song、David González-Martínez、Xiaoxia Wu、Yuandong Tian、Shiwei Liu、David Z. Pan、Zhangyang "Atlas" Wang。
痛点:RLVR 把奖励信号翻译成权重更新的那层"优化器 + 参数化",基本是预训练直接搬过来的,AdamW 统治一切。但预训练是稠密 token 级监督,RLVR 是稀疏 outcome 级奖励——这个 inheritance 到底合不合理,没人系统研究过。
核心方案:把每个权重矩阵做 SVD \(W = U\Sigma V^\top\),定义"固定谱族" \(\mathcal{F}(W_0)\)。通过三个层次实验证明:RLVR 训练中 \(\Sigma\) 几乎不动(近等谱性 near-isospectrality)、恢复 \(\Sigma_0\) 性能不掉、训练时全程固定 \(\Sigma_0\) 也能学好——但只优化 \(\Sigma\) 冻住两侧方向,性能就涨不动。结论:\(\Sigma\) 是"继承",\((U, V)\) 才是"学习"。ISO 把这条经验规律变成设计原则,落地两个版本:ISO-Merger(offline,组合多专家)和 ISO-Optimizer(online,把 AdamW/Muon 的更新规则套到 frame 变量上)。
关键效果: - Qwen3-8B-Base 数学:AdamW 270 步 0.495,ISO-AdamW 100 步就 0.495,210 步 0.509。 - Qwen3-4B-Base 数学:ISO-AdamW 比最强 AdamW 少 2.2× 步达到同等精度,且最终精度更高。 - ISO-Merger 在 Qwen2.5-7B 三个专家上聚合分 63.80(最强 baseline 62.88),在 DS-R1-1.5B 两个专家上 44.38(最强 baseline 43.52)。 - SVD 引入的 retraction 开销只占端到端 RL 步的 7%。
一针见血的评价:这是一个漂亮的"现象 → 设计"工作。Spectral inheritance 的经验观察扎实(多层校验 + 维度校准),ISO 的实现也很工程友好(不用新优化器,只换参数化)。但它不是底层突破——它其实是把 Muon/POET 这类正交化/谱保持优化的思想,从"为什么能 work"的理论角度做了一次"先看 RLVR 的 SVD,再决定怎么约束"的反向工程。如果你在做 RLVR 训练,这份工作值得细看方法论;如果只是关心 AdamW/Muon 本身,意义有限。
论文信息
- 标题:ISO: An RLVR-Native Optimization Stack
- 作者:Hanqing Zhu, Wenyan Cong, Zhizhou Sha, Sagnik Mukherjee, Xinyuan Song, David González-Martínez, Xiaoxia Wu, Yuandong Tian, Shiwei Liu, David Z. Pan, Zhangyang "Atlas" Wang
- 机构:UT Austin(主)、Meta AI(Yuandong Tian)、Purdue
- 链接:arXiv:2607.19331
- 日期:2026-07-21
为什么要重新设计 RLVR 的优化器?
在聊 ISO 之前,得先问一个朴素的问题:为什么 AdamW 统治了 RLVR 这么久?
答案很现实——因为没人仔细看过 RLVR 训练时权重"长什么样"。预训练时代我们有个直觉:dense token-level cross-entropy + AdamW 是经过大规模验证的"默认配方"。到 RLVR 这里,大家觉得既然基模型已经训好了、只是在 policy 上做 sparse reward 调整,那优化器沿用就行。Muon、Apollo 这些新优化器号称是为 LLM 训练设计的,但也都是面向预训练验证的。
但这真的合理吗?
- 预训练:稠密 token 级监督,梯度信号稳定且噪声小。
- RLVR:sparse outcome-level 奖励,梯度信号往往很"尖"——一个 roll-out 全对或全错。
直觉上,这两种学习范式对参数化空间的需求应该不同。作者从一个极其朴素的实验入手:把 RLVR 训练前后的权重矩阵做 SVD,对比 \(\Sigma\) 变化。

图 1:SFT(蓝→红实线)和 RLVR(红实线→红虚线)的奇异值谱对比。RLVR 训练前后谱几乎完全重合,红色虚线(RL end)贴在红色实线(RL base = SFT end)上。而 SFT(蓝→红)虽然变化幅度小但谱发生了肉眼可见的形变。下方 (b)–(e) 的量化指标显示 RLVR 的 \(\rho_\Sigma\)(相对谱残差)几乎贴在 0%,而 SFT 在 25–40% 区间。(f) 的几何示意把这点画成箭头:RLVR 的更新"几乎垂直于谱方向"(stays near \(\mathcal{F}(W_0^{RL})\)),SFT 则有显著残差。
这就是核心观察:RLVR 训练时,权重矩阵的奇异值几乎不动,动的只是输入和输出两个方向的子空间。 论文把这叫 near-isospectrality(近等谱性),并通过 Proposition 2.1 给出精确距离公式:
也就是说,到固定谱族 \(\mathcal{F}(W_0)\) 的距离,就是奇异值向量的 L2 距离。RLVR 训练全程这个距离几乎为 0(量级 \(10^{-5}\) 到 \(10^{-4}\)),而 SFT 同一指标在 \(10^{-1}\) 量级。差了两个数量级。
但作者没有停在"谱不变"这个表象。他们做了个更扎实的校准:维度归一化谱变化能量 \(\kappa_{\mathrm{spec}}\)(各向同性参考值 = 1)。结果 RLVR 的 \(\kappa_{\mathrm{spec}}\) 在 1.02–1.35 之间——也就是说,仅靠高维空间的"自然倾向"就足以解释 RLVR 的近等谱性了,并不是优化器有什么特殊偏好。
那这个现象到底有没有用?问题变成:那些"几乎为 0 的谱变化"功能上是不是必要的?
Spectral inheritance:谱在功能上可以继承
作者做了两个互补的实验,把"谱不变"从观察升格为功能性质。
实验 1:恢复基础谱,看性能掉不掉。
设 \(W_{\mathrm{RL}} = U_{\mathrm{RL}}\Sigma_{\mathrm{RL}}V_{\mathrm{RL}}^\top\),定义谱插值
\(\alpha = 0\) 时谱恢复到 \(\Sigma_0\),但 frame 仍是 RL 训练出来的。结果在数学/代码/工具调用一系列任务上,性能曲线在 \(\alpha\) 从 0 到 1 几乎是一条平线——把谱改回基础值,性能基本不掉。
实验 2:训练时全程冻住谱,只更新 frame。
这个才是关键设计上的测试——从第一个 RL step 起就用 ISO 的固定谱参数化 \(W(U, V) = U\Sigma_0 V^\top\),AdamW 同样能跑起来。
但作者也没少做"反向控制":如果冻住两侧 frame、只更新 \(\Sigma\)(spectrum-only control),性能提升非常有限。谱可以继承,但 frame 必须能更新。
到这里,"spectral inheritance"就从一个观察变成了设计原则:继承谱,优化帧。(Inherit the spectrum, optimize the frames.)
Both frames must remain adaptable:两边都不能省
到这里还没完。下一个问题更尖锐:是不是"两边都更新"是必要的,还是只更新某一侧就行?
作者定义了"unexplained-update ratio"\(u_h\)——用某种受限结构重建 \(\widehat{W}_h\) 后,更新无法被解释的比例。对四种结构(proposition 3.1):
| 重建方式 | 含义 | 累积转换 \(W_0 \to W_2\) 的中位未解释率 |
|---|---|---|
| \(\widehat{W}_{\mathrm{mix}}\) | 在传入的两个子空间内 remix | 87% |
| \(\widehat{W}_L\) | 保留输入输出子空间 | 45% |
| \(\widehat{W}_R\) | 保留输入子空间 | 42% |
| \(\widehat{W}_{\mathrm{iso}}\) | 保留谱、适应两侧 frame | 1.8% |

图 2:语言模块和视觉模块上 \(u_h\) 的层分布。红色 \(u_{\mathrm{iso}}\)(保留谱、适应两侧 frame)整层都贴在 \(10^{-2}\) 附近,意味着 98% 以上的检查点更新都能用 ISO 结构解释。其余三色(\(u_{\mathrm{mix}}\), \(u_L\), \(u_R\))都在 0.3–1.0 区间。
这个数字很关键:在 \(W_0 \to W_2\) 这种累积转换上,"两边都 remix"留下了 87% 残差——这意味着 RLVR 的权重更新远不是简单的子空间旋转,必须两边 frame 都能动。"只冻住一侧、放开另一侧"也不行(残差 42–45%)。只有"两边都动 + 谱不动"才能 98% 解释更新。
这个结论在视觉-语言-动作(VLA)两阶段 RL 流程上同样成立——spectral inheritance 不是某个数据集的特殊现象,是 RLVR 训练的结构性特征。
ISO 框架:把观察变成优化器
有了"spectrum 继承、frame 学习"这条设计原则,剩下的问题就是怎么落地。ISO 给出两个互补版本,覆盖 RLVR 训练全流程。
ISO 的统一参数化
无论离线还是在线,核心参数化是同一个:
\(\Sigma_0\) 从基模型继承,全程不动。\((U, V)\) 是要优化的变量。Proposition 4.1 证明:任何可行(Stiefel 切空间)的 frame 更新都满足 \(\operatorname{diag}(U^\top \dot{W} V) = 0\)——一阶谱不变。
离线版:ISO-Merger
场景:已经从共享基模型训了 K 个领域专家(coding、tool use、memory 等),现在想合并到一个模型,不跑 rollout、不算梯度、不做 on-policy distillation。
传统方法(Task Arithmetic、TIES、TSV、RAM、OrthoMerge-G-TIES 等)都在欧几里得空间里做"task vector"组合。ISO-Merger 思路完全不同:
- 把每个专家的奇异方向对齐到基的 sign canonical
- 计算 frame 位移 \(\Delta U_i = U_i - U_0\),投影到 Stiefel 切空间 \(\xi_{U,i}\)(保留 top \(\rho_{\mathrm{keep}} = 0.9\) 的奇异模式,屏蔽尾部不稳定模式)
- 用 ridge-stabilized 系数 \(\bar{c}\) 组合:\(\xi_{U,\star} = \Pi_{U_0}\left(\sum_i c_i^\star \widetilde{\xi}_{U,i}\right)\)
- Polar retraction:\(U_\star = \mathrm{polar}(U_0 + \xi_{U,\star})\),恢复 Stiefel 可行性
- 重构 \(W_\star = U_\star \Sigma_0 V_\star^\top\)
第 4 步的 polar retraction 是关键工程细节——polar(X) = P_X Q_X^\top 取 SVD 后两端的正交因子。整个流程不需要任何梯度、rollout、post-merge data。
在线版:ISO-Optimizer
更直接:把 AdamW(或 Muon)"搬"到 frame 空间。
- 原始 AdamW 在 weight \(W\) 上做更新:\((W^+, s_W^+) = \mathrm{Opt}(W, G_W, s_W)\)
- ISO-AdamW 在 \((U, V)\) 上做更新:
- 链式法则得到 frame 梯度:\(G_U = G_W V \Sigma_0\),\(G_V = G_W^\top U \Sigma_0\)
- AdamW 独立更新两侧:\((\bar{U}, s_U^+) = \mathrm{Opt}(U, G_U, s_U)\)
- Polar retraction 恢复可行性:\(U^+ = \mathrm{polar}(\bar{U})\),\(W^+ = U^+ \Sigma_0 (V^+)^\top\)
整个流程等价于把"基优化器状态"(AdamW 的 m/v 或 Muon 的正交化)实例化在 frame 坐标上。它不是在 weight 空间做更新再投影——这一点很重要,否则就退化成普通的 projection 方法了。
与 Muon/Pion 的关系
论文 Related Work 里点了一个关键问题:Muon、POET、POET-X、Spectral Adapter、StelLA 都是"谱保持/正交化"类优化器,并发的 Pion 也是两侧正交等价重参数化。和 ISO 的区别?
ISO 从 RLVR 特定的经验观察出发,先看 SVD 诊断结果,再设计约束参数化;Muon/POET 是从矩阵几何理论出发,反向适配到 LLM 训练。Pion 是通用 LLM 训练设计,ISO 是 RLVR-specific 的、包含 online + offline 两个实例的优化栈。
直白地说,ISO 不是第一个"重参数化保谱"的优化器,但它是第一个"为 RLVR 量身做诊断 → 设计"的工作。
实验结果
ISO-Merger:离线合并多个专家
Table 1(Qwen2.5-7B-Instruct + 3 experts: Coder, Tool, Memory)
| Method | LB ACC | LB UT | LCB v2 ACC | LCB v2 UT | Live ACC | Non-Live ACC | HotpotQA 32K | HotpotQA 64K | SQuAD 32K | SQuAD 64K | Avg |
|---|---|---|---|---|---|---|---|---|---|---|---|
| Base | 36.25 | 48.27 | 28.31 | 43.08 | 62.96 | 69.26 | 49.87 | 45.54 | 58.90 | 56.77 | 49.92 |
| RLVR-Coder | 37.42 | 49.42 | 30.17 | 44.24 | 63.37 | 68.07 | 50.21 | 45.61 | 60.51 | 56.84 | 50.59 |
| RLVR-Tool | 36.87 | 48.08 | 28.20 | 42.43 | 71.83 | 81.82 | 50.39 | 45.33 | 59.73 | 57.86 | 52.25 |
| RLVR-Memory | 37.32 | 50.05 | 27.41 | 41.70 | 63.82 | 72.61 | 78.60 | 77.95 | 79.98 | 78.52 | 60.80 |
| Task Arithmetic | 38.85 | 52.18 | 31.55 | 47.06 | 73.73 | 82.86 | 72.22 | 70.49 | 75.03 | 74.95 | 61.89 |
| TIES | 40.30 | 52.04 | 31.46 | 47.33 | 68.24 | 76.54 | 76.42 | 75.24 | 78.27 | 77.86 | 62.37 |
| TSV | 36.96 | 49.23 | 28.92 | 43.37 | 73.64 | 82.69 | 75.37 | 74.10 | 78.30 | 77.26 | 61.98 |
| RAM | 38.59 | 50.38 | 31.31 | 46.33 | 72.56 | 81.89 | 76.17 | 75.29 | 78.42 | 77.83 | 62.88 |
| OrthoMerge-G-TIES | 40.74 | 53.22 | 31.98 | 47.48 | 66.98 | 78.17 | 74.79 | 74.20 | 77.75 | 76.32 | 62.16 |
| ISO-Merger | 41.81 | 52.73 | 31.06 | 45.69 | 72.32 | 81.07 | 79.46 | 76.77 | 79.10 | 78.01 | 63.80 |
ISO-Merger 平均分 63.80,比最强 baseline RAM(62.88)高 0.92 个点,最关键的是在 Memory 任务上几乎恢复到专家水平(79.46 vs 专家 78.60),同时保住 Coding 和 Tool 能力。Best@4 / Worst@4 见附录:ISO-Merger 基本匹配 best@4 聚合分(说明上限没掉),同时 worst@4 提升 1.36–1.62 个点(说明更稳定)。
Table 2(DeepSeek-R1-Distill-Qwen-1.5B + 2 experts: Archer2.0, JustRL)
| Method | LB ACC | LB UT | LCB v5 ACC | LCB v5 UT | AIME24 | AIME25 | AMC23 | Minerva | OlympiadBench | Avg |
|---|---|---|---|---|---|---|---|---|---|---|
| Base | 17.99 | 26.24 | 16.82 | 20.85 | 30.90 | 23.40 | 63.15 | 27.33 | 43.11 | 29.98 |
| Archer2.0 | 26.66 | 37.26 | 26.90 | 38.99 | 42.05 | 28.02 | 73.44 | 30.09 | 49.99 | 39.27 |
| JustRL | 22.23 | 31.85 | 23.05 | 30.18 | 53.16 | 36.84 | 82.78 | 34.71 | 55.67 | 41.16 |
| TIES | 26.37 | 36.75 | 27.62 | 39.45 | 54.51 | 35.76 | 82.13 | 33.76 | 55.36 | 43.52 |
| ISO-Merger | 25.52 | 36.42 | 27.84 | 41.84 | 55.00 | 37.81 | 83.53 | 34.77 | 56.64 | 44.38 |
1.5B 模型上 ISO-Merger 比最强 baseline TIES(43.52)高 0.86 个点。在数学任务上几乎全面超越所有 baseline——AIME24 55.00、AIME25 37.81、AMC23 83.53。值得一提的是 ISO-Merger 的 coding 指标(LCB v5 ACC)也最强,说明跨任务能力恢复没冲突。
ISO-Optimizer:在线 RLVR 训练
Table 3:数学 RLVR(avg@16)
| Model | Method | AIME24 | AIME25 | AMC23 | Minerva | Olympiad | Avg |
|---|---|---|---|---|---|---|---|
| Qwen3-1.7B-Base | Base | 3.75 | 1.25 | 23.04 | 18.49 | 18.43 | 12.99 |
| AdamW | 13.96 | 12.92 | 43.45 | 32.17 | 39.25 | 28.35 | |
| Muon | 16.25 | 8.33 | 43.60 | 32.24 | 38.06 | 27.70 | |
| ISO-AdamW | 16.04 | 11.04 | 44.50 | 33.11 | 39.01 | 28.74 | |
| Qwen3-4B-Base | Base | 6.88 | 5.00 | 25.45 | 20.97 | 22.43 | 16.15 |
| AdamW | 25.21 | 20.42 | 63.55 | 45.40 | 53.87 | 41.69 | |
| Muon | 25.42 | 19.58 | 63.63 | 46.51 | 56.02 | 42.23 | |
| ISO-AdamW | 27.29 | 23.13 | 65.74 | 45.15 | 55.99 | 43.46 |
1.7B 上 ISO-AdamW 拿到 28.74(vs AdamW 28.35、Muon 27.70),提升不大但稳定。4B 上 ISO-AdamW 比 AdamW 高 1.77 个点、比 Muon 高 1.23 个点,AIME24 涨 2 个点、AIME25 涨近 3 个点。
Table 4:DS-1.5B Coding(LCB avg@8, 220 步)
| Method | LCB v5 | LCB v6 | Avg |
|---|---|---|---|
| DS-1.5B Base | 17.43 | 18.41 | 17.92 |
| AdamW | 24.01 | 26.24 | 25.13 |
| ISO-AdamW | 25.49 | 26.91 | 26.20 |
220 步时 ISO-AdamW 比 AdamW 高 1.07 个点。关键是步数:延伸 AdamW 实验显示,5e-6 学习率 AdamW 在 330 步峰值为 0.265 后下降,3e-6 在 330 步结束为 0.256,ISO-AdamW 在 130 步就达到 0.256 水平——少 2.5× 步数。
主秀数据:Qwen3-8B-Base

图 3:Qwen3-8B-Base 数学训练,ISO-AdamW(绿)vs AdamW(橙红)。阴影部分标记 8K 和 16K 最大响应长度阶段。绿色曲线始终在橙色上方,AdamW 270 步才到 0.495,ISO-AdamW 100 步就到这里,210 步进一步涨到 0.509,右下方红色虚线标出 ≈2.7× 更少训练步数。论文额外跑了 60 步延伸 AdamW 排除"没训够"的可能。
这个 2.7× 步数减少是论文最硬的数字。不是同一终点比较的边际改进,是用更少训练步数达到(且超出)对照组的最终精度。再加上 ISO-AdamW 在训练全程都领先,没有任何一段 AdamW 跑出来能反超——这是个很干净的对比。
ISO-Muon 变体

图 4:把同一思路套到 Muon 优化器上。ISO-Muon(深绿)在 Qwen3-4B-Base 上 220 步达到 Muon 300 步的最终精度 0.42,并继续涨到 0.428。底部虚线标出 ≈1.4× 更少训练步数。说明 ISO 不是 AdamW-specific 的优化技巧,是套在任意基优化器上的"重参数化"层。
Coding 1.5B 完整曲线

图 5:DS-1.5B 上 LiveCodeBench 训练曲线。ISO-AdamW(绿)从 100 步开始就稳定在 AdamW 几种学习率配置之上,220 步峰值 0.268,延伸实验显示 AdamW 即使跑到 330 步也未能匹配这个数字。
工程开销:SVD 不便宜,但只占 7%

图 6:Qwen3-4B-Base 上 ISO 和 AdamW 的 optimizer-update 和端到端 step 时间。绿色(ISO step)比橙色(AdamW step)多出约 86 秒的 SVD retraction 开销,但只占端到端 RL 步时间的 ≈7%。Rollout generation 是大头,retraction 可以与之异步 overlap。
86 秒看着吓人,但 RLVR 一步本来就 1000+ 秒(rollout + policy update + reference compute)。7% 的额外开销换 2.7× 训练步数减少,工程账完全算得过来。论文还提到 factor tensor 可以全分片 + optimizer state offload,进一步压显存。
我的判断
最值钱的地方:诊断方法论本身。
这篇论文最让我欣赏的不是"提速 2.7×"这个数字(说实话这个数字在 RLVR 训练里很容易刷——换个 learning rate、warmup 步数都能差 20%),而是它把 RLVR 优化器从"默认继承 AdamW"的工程惯性里拉出来,用 SVD 这个线性代数基本工具做了一个扎实的"现象 → 设计"反推。
具体来说三个证据链很漂亮:
- 近等谱性的精确测量(Proposition 2.1 给 Frobenius 距离的解析式)
- 维度归一化校准(\(\kappa_{\mathrm{spec}}\) 对比 isotropic reference,排除"只是高维空间自然倾向"的可能)
- 两端 frame 必要性的残差分解(\(u_{\mathrm{mix}}\) 87% vs \(u_{\mathrm{iso}}\) 1.8%,数量级差异)
这种"先看 SVD、再决定怎么约束"的 reverse engineering 思路,在 RL 后训练研究里值得借鉴。很多优化器 trick 之所以被发明,是因为它们的"发明者"猜对了约束结构;ISO 提供了"先看清楚约束结构再设计"的样本。
可能的问题 / 我没完全看明白的地方:
- 理论解释缺位:为什么 RLVR 不需要重写谱?这个观察很扎实,但"为什么"层面只给了一组经验证据(\(\kappa_{\mathrm{spec}}\) 接近 1,说明不算"超常偏好")。那到底是什么机制让 RLVR 的有效学习天然落在 frame 子空间上? 是 reward signal 的 sparse 性质、policy 的 KL 约束、还是别的?论文没给答案。
- 与 Muon 的对比不够直接:Muon 已经是正交化优化器,理论上也应该保持谱附近。论文在 Qwen3-4B-Base 上同时跑了 Muon 和 ISO-Muon,但没看到 ISO-AdamW vs Muon 的直接 head-to-head 在所有模型规模上的对比。1.7B 上 Muon 27.70 vs ISO-AdamW 28.74 是 ISO 赢,但 4B 上 ISO-AdamW 43.46 vs Muon 42.23 也赢——这个优势是否一致? 需要更多模型和任务验证。
- SVD 在更大模型上的可扩展性:8B 模型 100 步 SVD retraction 已经 86 秒/步,70B 模型这一步可能就 1000 秒。论文说"和 rollout 可以 overlap",但实际系统里这会增加显存峰值和通信复杂度。ISO 在超大规模 RLVR 训练上能不能落地,是个工程开放问题。
- 不是底层突破:说到底,ISO 是"在 Muon/POET 这类正交化/谱保持优化器上做了一次 RLVR 特定的重参数化"。如果你已经在用 Muon 或 POET,ISO 给你的是一个对 RLVR 友好的、现象学上更清晰的版本,而不是数量级跃迁。
如果我在做 RLVR,我会怎么用这篇论文:
- 第一件事:跑一下自己 RLVR 训练前后的 SVD,看 \(\rho_\Sigma\) 是不是真的这么小。如果不是,spectral inheritance 可能在你的设置下不成立,ISO 也不一定 work。
- 如果谱确实不动:试试 ISO-AdamW,至少 4B 以下规模应该稳定。
- 如果是多专家合并场景:ISO-Merger 几乎是无脑收益——不需要数据、不需要 rollout、不需要算梯度,只用 checkpoint。
- 不建议:在 70B+ 规模上直接上 ISO,SVD overhead 的边际成本要先 profile。
结语
ISO 这类工作最有意思的地方是它提醒了我们一件事——RL 后训练现在进入了"优化器也要重新设计"的阶段。预训练时代优化器是个被默认接受的基础设施(AdamW + lr schedule 配好就行),但 RL 训练范式(dense → sparse、token-level → outcome-level)的转变意味着这个基础设施也得跟着变。
spectral inheritance 这条经验规律能不能推广到更多 RL 后训练范式(DPO、PRM、process reward、agentic RL),目前还不知道。但 ISO 提供了一个非常清晰的"先诊断、再设计"的方法论样板——比起拍脑袋想优化器 trick,这套思路靠谱得多。
如果非要用一句话总结:RLVR 训练不需要新的优化器,只需要正确的参数化。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。