SPIRAL:让 RL 学会搜索和聚合,三种推理原语端到端联合训练

核心摘要:斯坦福团队提出 Spiral(Sequential-Parallel-Aggregative Reinforcement Learning),首次将推理时的三种计算原语——顺序推理、并行采样、轨迹聚合统一进强化学习训练流程。核心思路是:模型先独立并行采样多条推理链,再基于这些链生成一条聚合回答,奖励信号只来自最终聚合结果。关键创新在于用 Set RL(集合强化学习)优化搜索轨迹的集合质量、Standard RL 优化聚合能力。实验在数学推理任务上,Spiral 的 Pass@k 扩展效率最高达到 GRPO 的 11 倍,递归自聚合下性能高出 13.5 个点。这篇论文解决的是一个真实存在但长期被忽视的问题:训练时只用单链奖励,部署时却依赖多链聚合——这个鸿沟到底有多大代价?


论文基本信息

项目 内容
标题 SPIRAL: Learning to Search and Aggregate
作者 Jubayer Ibn Hamid, Ifdita Hasan Orney, Michael Y. Li, Omar Shaikh, Yoonho Lee, Dorsa Sadigh, Chelsea Finn, Noah Goodman (*equal contribution)
机构 Stanford University
链接 arXiv:2606.23595
提交日期 2026-06-22
领域 cs.AI / LLM 推理 + 强化学习后训练

你有没有发现一个很奇怪的现象

你让一个大模型做一道数学题,给它足够的思考 token,它不一定能做对。但你让它同时做 8 道独立的尝试,然后从里面挑最好的答案——准确率反而蹭蹭往上涨。

这不是什么新发现。测试时扩展推理算力(inference compute scaling)已经是业界标配操作了:多采样几条 chain-of-thought 轨迹、 majority voting 投票、递归自聚合(RSA)……各种花式玩法层出不穷。

但问题来了——模型在训练的时候学过这些东西吗?

没有。

当前的 RL 后训练范式(GRPO、DeepSeek-R1 这一套),训练目标永远是单条推理链的最终答案是否正确。模型从来没被告知"你的这条链可能是 8 条中的一条"、"你应该和其他链互补而不是重复"。等到部署时突然被塞进一个 multi-trace 的脚手架里,它只能靠 SFT 阶段残存的泛化能力硬撑。

这就像训练了四个独立解题的学生,考试时却要求他们组成小组协作——没人教过他们怎么配合。

Figure 1: Spiral vs GRPO 在不同推理策略下的综合性能对比

图1:Spiral 与 GRPO 在三种推理策略下的性能对比(BeyondAIME / AIME 2026 / AIME 2025)。横轴是最大 token 预算,纵轴是准确率。实线是 Spiral recursive self-aggregation(RSA),在 BeyondAIME 上比 GRPO 高出 13.5 个点,AIME 2026 上高 9.8 个点。注意 GRPO 和 Spiral 在 sequential 模式下差距不大,但在 RSA 模式下拉开了显著距离。

这就是 Spiral 要填的坑。


三种推理原语:训练和部署之间的断层

论文把推理时可以用的计算资源归纳为三类:

原语 做什么 现有方法的毛病
Sequential 单条链内多想一会儿(更多 thinking token) 模型经常把预算花在废话上,关键逻辑跳跃反而一笔带过
Parallel 同时独立采样多条推理链 各条链高度同质化,像是一个模子刻出来的"不同版本",探索效率极低
Aggregative 把多条候选答案合成一条最终输出 模型不会真正验证和比较不同思路,只会机械地拼凑或投票

这三类原语在测试时被广泛使用(想想 o1/o3 的 extended thinking、DeepSeek-R1 的多路径采样、MoA 的多 agent 协作),但训练阶段只有 Sequential 被显式优化

Parallel 和 Aggregative 全靠手工设计的启发式规则来编排。这些规则能 work,但它们不是最优的——因为底层模型压根没被训练过要在这个场景下好好表现。

Spiral 做的事情很简单也很直接:把这三个原语全部纳入 RL 训练的目标函数里,让模型自己学会怎么搜索、怎么聚合


方法核心:Set RL + Standard RL 共演化

整体框架

Spiral 的推理流程长这样:

  1. 给定一个问题 x
  2. 模型独立并行采样 n 条 search traces(每条都是完整的 chain-of-thought 推理)
  3. 模型以「原始问题 + n 条 search traces」为输入条件,生成一条 aggregation trace 作为最终答案
  4. 只对最终的 aggregation trace 计算奖励 r(x, y*)

形式化目标函数:

\[\max_{\theta,\phi} \mathbb{E}_{y_{1:n} \sim \pi_\theta(\cdot|x)} \left[\mathbb{E}_{y_* \sim \pi_\phi(\cdot|x, y_{1:n})}[r(x, y_*)]\right]\]

\(\pi_\theta\) 是搜索策略,\(\pi_\phi\) 是聚合策略。实际实现中可以用同一个模型(\(\theta = \phi\)),也可以分开。

梯度分解:两个自然出现的项

对这个目标函数求梯度,会自然分解成两项:

\[\nabla_\theta \mathbb{E}_{y_{1:n}} \left[\mathbb{E}_{y_*}[r(x, y_*)]\right] = \underbrace{\textbf{Set RL gradient}}_{\text{优化搜索集合}} + \underbrace{\textbf{Standard RL gradient}}_{\text{优化聚合能力}}\]

这个分解不是人为设计的——它是数学上自然产生的结果。而这两项恰好对应了两个需要优化的不同能力:

第一项(Set RL):告诉模型"你这组搜索轨迹合在一起对聚合有多有用"。所有轨迹共享同一个学习信号——集合级别的得分。这意味着即使某条单独看是错的 trace,只要它对聚合有帮助,也会被鼓励保留。

第二项(Standard RL):告诉模型"给定一组搜索轨迹,你聚合得怎么样"。用的是传统的 per-sample advantage。

这是一个共演化过程:搜索侧学着生成对聚合有用的集合,聚合侧学着更好地利用给定的集合。两者互相促进。

Set RL 为什么重要?——多样性问题的根源

说到 Set RL,这里值得展开聊聊。标准 RL(包括 GRPO)的核心问题是:每个样本获得各自的优势值。如果你的 8 条推理链里有 7 条错了 1 条对了,那 7 条全被惩罚、1 条被奖励。

后果是什么?模型很快学会"安全策略"——生成高度相似的同质化输出,因为这样至少保证多数链的方向一致,不会出现大量惩罚信号。这就是为什么 GRPO 训练出的模型在并行采样时各条链越来越像,token-level entropy 快速坍缩。

Figure 5: Token-level entropy 训练曲线

图5:训练过程中 token-level entropy 变化。GRPO(浅色线)的熵从约 0.28 持续下降到约 0.22——说明生成的多样性在坍缩,各条链越来越像。Spiral(深色线)的熵始终维持在 0.26–0.30 之间波动,保持了良好的探索多样性。

Set RL 完全换了一套逻辑。它的优势值定义在集合层面

\[A^\sharp_{\text{marg}}(x, y; f_{\text{spiral}}) = \frac{1}{|\mathcal{G}(y)|} \sum_{G \in \mathcal{G}(y)} A^\sharp(x, G; f_{\text{spiral}})\]

其中 \(f_{\text{spiral}}(x, y_{1:n})\) 是该搜索集合对应的聚合结果的期望奖励。

关键区别在于:不正确但互补的轨迹会被显式鼓励。比如 A 链用了代数方法走不通,B 链用了几何方法也走不通——但聚合器看到两种方法的中间结论后找到了正确的组合方式。在标准 RL 下 A 和 B 都会被惩罚;在 Set RL 下,包含 A 和 B 的集合可能仍然得到高分。

这就解释了为什么 Spiral 能保持多样性:模型不需要每条链都对,它只需要每条链都有独特的价值。

具体训练流程

论文给出了清晰的 on-policy 数据收集流程:

  1. 从数据集 D 中采样一批 prompt
  2. 对每个 prompt 采样 N₁ 条 search traces(并行推理)
  3. 从所有 traces 中随机组合成 K 个大小为 n 的子集(有放回地均匀采样)
  4. 对每个子集采样 N₂ 条 aggregation traces
  5. 只在 aggregation trace 上评估奖励——search traces 不直接打分

Search traces 通过边际集合优势(marginal set advantage)更新参数;aggregation traces 通过 per-set baseline 的 standard advantage 更新。后者使用 per-set baseline 而非全局 baseline,进一步降低了方差。

说实话,这个 per-set baseline 的设计挺巧妙的——同一个集合内的聚合结果互相比,比跨所有集合的全局比较更公平,方差也更小。


实验结果:数字说话

实验设置

项目 配置
基座模型 Qwen3-4b-Instruct-2507(4B 参数)
训练数据 POLARIS-53k 的过滤子集(数学推理题)
训练规模 256 problems/batch, 24 rollouts/problem, 2 epochs
Baseline GRPO(相同训练配置下的公平对比)
评估任务 BeyondAIME, AIME 2026, AIME 2025
RSA 参数 每步 8 条并行 trace,集合大小 4

几个需要留意的点: - 模型只有 4B,不算大——这是 ongoing work,后续计划训 8B+ - 公平对比:所有方法使用相同的总 token 预算 - 动态采样确保有效 batch size 为 256(过滤掉零优势的样本)

Pass@k 扩展效率:11 倍的提升

Pass@k 是衡量并行推理能力的经典指标——独立采样 k 次,至少答对一次的概率。

Figure 3: Pass@k 扩展曲线

图3:三个数据集上的 Pass@k 曲线。Base 是未训练基座模型(浅紫色),GRPO(浅橙色),Spiral(深青色)。横轴 k 是独立尝试次数,纵轴是通过率。标注了 Spiral 相对于 Base 达到同等性能所需的 k 倍数缩减:BeyondAIME 上 7.3×,AIME 2026 上 9.4×,AIME 2025 上 10.6×。Spiral 的曲线明显更陡峭,说明同样多的尝试次数下覆盖面更大。

这个结果相当直观地说明了 Set RL 的效果。GRPO 的 pass@k 扩展确实比 base model 好(毕竟 RL 还是有效果的),但 Spiral 好得多。在 AIME 2025 上,Base 需要 ~64 次尝试才能达到 Spiral 用 ~16 次就达到的水平——4 倍的计算节省

论文报告的最高扩展效率是 11×(综合三个数据集的结果),意思是 Spiral 达到某个性能水平所需的总推理计算量仅为 GRPO 的约 1/11。

递归自聚合:Spiral 真正发光的地方

如果说 Pass@k 还只是衡量"并行搜索够不够广",那么递归自聚合(Recursive Self-Aggregation, RSA)考验的就是"模型会不会真正用好这些搜索结果"。

RSA 的做法是分层的:第 1 层把 8 条原始 trace 分组聚合成若干条新 trace,第 2 层再把上一层的产物继续聚合……层层迭代,每一步都在精炼。

Figure 4: RSA 步数与 Pass@1 性能关系

图4:随着递归自聚合步数增加,Pass@1 的变化趋势。Spiral(深青色)在三个数据集上都呈现持续上升的趋势且斜率远超 GRPO(浅橙色)和 Base(浅紫色)。到 Step 10 时,Spiral 在 BeyondAIME 上接近 67%,AIME 2026 接近 80%,AIME 2025 接近 87%。GRPO 的增长则明显放缓甚至趋于平稳。

这张图是我觉得整篇论文最有说服力的地方。

你看 GRPO 的曲线:前 2-3 步还有点增长,之后就基本平了。为什么?因为 GRPO 没受过聚合训练,RSA 对它来说就是反复执行一个它不擅长的操作——越叠越糊。

Spiral 不一样,每一步都在涨。Step 10 还没见顶。这说明模型确实学会了"如何利用前一轮的输出来改进下一轮"——这不就是推理能力的本质吗?

Sequential compute:大家都一样

Figure 6: 单链 sequential compute 扩展

图6:仅扩展单链的最大 token 数(sequential compute)。三条线几乎完全重叠——Base、GRPO、Spiral 在纯 sequential 扩展下表现基本一致。这说明单纯"让模型想得更久"的效果有限,且不受 RL 训练策略的影响。

这张图其实挺重要的,因为它告诉了我们一件事:瓶颈不在 sequential compute 上

三条线黏在一起,说明不管是哪种训练方法,单链思考能力的提升都差不多。真正的差异来自 parallel + aggregative 的协同。这也解释了为什么 o1/o3 这种纯 sequential 扩展的方法会遇到天花板——你不可能无限延长 context length。

Majority Voting vs Learned Aggregation

Figure 7: 并行轨迹+聚合方法对比

图7:横轴是并行采样的轨迹数量 k,纵轴是准确率。对比了多种组合:GRPO/Spiral × majority voting / RSA / pure pass@k。关键发现:(1) GRPO 的 pass@1(菱形虚线)基本是一条水平线——增加并行数对它没帮助;(2) Spiral 的 RSA(实心深青色)持续上升;(3) Spiral majority voting 也优于 GRPO majority voting。

这张图揭示了几件事:

第一,GRPO 确实无法从并行扩展中受益。那条近乎水平的 pass@1 虚线说明不管你采样多少条链,GRPO 最终选出来的答案质量差不多——因为它没有被训练过要做这件事。

第二,规则聚合(majority voting)不如学会的聚合(RSA)。即使在 Spiral 内部,RSA 也明显好于 majority voting。但 Spiral 的 majority voting 已经超过 GRPO 的 majority voting 了——说明搜索侧的训练本身就在产生更高质量的候选。

第三,Spiral 在 RSA 下的曲线持续上升且斜率不减,说明在当前实验范围内还没碰到天花板。

Token 效率的完整图景

Figure 8: Token 预算 vs 性能综合对比

图8:最完整的对比视图。横轴是每种方法允许使用的最大 token 预算,纵轴是准确率。包含了 6 种方法变体:GRPO/Spiral × sequential/majority voting/RSA。BeyondAIME 上 Spiral RSA 最高 13.5% 提升(相对 GRPO sequential),AIME 2026 上 9.8%,AIME 2025 上 8.1%。Sequential compute 受限于 ~32k token context length 后无法继续扩展,而 parallel+aggregative 方案可以在更大预算下持续提升。

如果只看一张图,我推荐这张。它把所有维度压缩到一个坐标系里:

  • Sequential(虚线):撞墙快,~32k token 到顶
  • Majority Voting(浅色实线):可扩展但效率一般
  • RSA(深色实线):扩展性最好,Spiral 明显领先于 GRPO

Token 预算从 16k 拉到 1024k,Spiral RSA 的曲线一直在涨。这在工程上意味着什么?意味着如果你有更多的推理预算可以花,Spiral 是那个能真正把它转化成准确率提升的方法。


我的判断:这篇论文处于什么位置

亮点

1. 问题定义得很精准,而且确实是真问题。

训练-部署的 compute gap 这个事,大家隐约都知道,但很少有人系统地去量化它的代价,更少有人试图从根本上修复它。Spiral 不是在做增量式的 trick 改进,而是在问一个正确的问题:"如果我们想让模型在部署时用 multi-trace 策略,为什么不直接这么训练它?"

2. Set RL 的选择很漂亮。

用集合级信号替代逐样本信号来保持多样性,这个直觉上说得通,实验数据也支撑了它(entropy 图非常直观)。而且梯度自然分解成两项这个数学性质很优雅——不是强行拼接两个 loss,而是从一个统一目标中自然涌现。

3. 实验设计干净。

跟 GRPO 做公平对比(相同的 token 预算、相同的基座模型、相同的训练配置),消融实验覆盖了三种原语的独立和组合效果。没有用高难度数据刷低难度榜单这种降维打击的操作。

需要注意的地方

1. 模型规模还偏小。

4B 参数的 Qwen3,虽然验证了方法论的有效性,但在大模型上是否还能保持同样的增益幅度是个 open question。论文自己也标注了 "Ongoing Work",后续会有 8B+ 的结果。

2. 只在数学推理上做了实验。

数学的好处是有客观的 verifiable reward(答案对不对一目了然)。但在代码生成、开放域问答等 reward 更模糊的任务上,Set RL 的集合级信号还能不能有效工作?这个我没把握。

3. 训练开销不小。

每个 step 要采 N₁ 条 search traces + K×N₂ 条 aggregation traces,比 GRPO 的 rollout 开销大了不少。论文提到用了 dynamic sampling 来保证有效 batch size,但整体训练成本的增加是实实在在的。

4. 与其他 test-time compute 方法的定位关系还需要厘清。

比如 AlphaEvolve、Mixture-of-Agents 这些方法也是在做多 trace 编排。Spiral 是 end-to-end 训练的方案,但它们之间到底是替代关系还是互补关系?目前还没有直接对比。

工程启发

如果你也在做推理模型的 post-training,我觉得这篇论文有几个可以直接借鉴的点:

  • 如果你的部署场景涉及多 trace 采样或聚合,考虑把这部分纳入 RL 训练目标。哪怕先用简化的 Set RL 做个 pilot,大概率会比"训练单链 + 部署时手动编排"效果好。
  • 关注 diversity metrics(如 token entropy)。如果训练过程中 diversity 快速坍缩,说明你的 reward signal 可能在惩罚有用的探索。
  • per-set baseline 是个低成本的方差降低技巧,不需要额外的模型或复杂的估计器。

收尾

Spiral 提出的不是一个全新的算法组件,而是一种新的训练范式:让模型在训练时就学会它在部署时真正要做的事。

这个想法朴素得让人觉得"之前为什么没人这么做?"——但仔细想想,原因也不复杂:之前的 RL 训练体系(PPO → GRPO 这条路线)一直围绕"单链优化"构建,工具和方法论都是为此设计的。要从"优化一条链"切换到"优化一组链 + 聚合过程",需要重新设计数据流、梯度计算、甚至整个训练 pipeline。

Spiral 迈出了这一步。11 倍的扩展效率、13.5 个点的 RSA 性能提升——在一个 4B 小模型上拿到这样的数字,说明方向是对的。后续如果在大模型上也能复现类似的 gain,这套方法可能会成为推理模型 post-training 的标准配置之一。

当然,也有可能在大模型上收益缩水,或者在其他任务领域水土不服。那是后续实验才能回答的问题。但至少现在,这个问题终于有人在认真解了。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我