两个不共享参数的模型互投,3.0–8.6 个点的无监督推理就出来了

你有没有碰到过这种情况:模型跑 RL,reward 一直在涨,但你心里清楚,那只是模型越来"越听话"地迎合自己的多数票,而不是真的把题做对?这篇 Co-RL(arXiv:2608.17253)戳的就是这个痛点——它把"自奖励 RL"那个自我强化的反馈环,用一群异构模型互投给打破了。

核心摘要

痛点:自奖励 RL(self-rewarding RL,比如 TTRL 的多数票、Intuitor 的 self-certainty、RENT 的熵)所有信号都来自"同一个模型"。当模型本身错得离谱时,它的多数票本身就是错的,RL 只会把它推向更深的错误——reward 标准差塌到 0、completion 长度发散、性能雪崩。

方案:Co-RL 同时训练多个不共享参数、不共享梯度的独立模型,每个模型的 reward 由同伴的多数票决定(论文里叫 cross-agent supervision)。多样性做到三层:异家族(Qwen × Llama)、异尺寸、改写 prompt(DeepSeek-V3 rewrite)。三者切断自奖励的反馈环。

效果:纯文本 7 个 benchmark、3B 模型涨 4.0–8.0%,7B/8B 模型 best variant 比 base 高 3.0–8.6%;多模态 4 个 benchmark,2B–12B 模型涨 2.3–7.2%;在 CoMAS 评测协议下用一半的 agent 数比 CoMAS 还高 4.0%。Gemma-3-12B 上 Co-RL 甚至超过了 GT-Reward(47.56% vs 45.17%),全程没用一条真值标签。

判断:这篇论文把"co-training"这个 1998 年的老 idea 在 LLM 后训练上重新激活了,做法不花哨,但理论加实验都挺干净。多样性是核心 driver,没有异家族只是同模型两个 seed,论文里直接给你看 complementarity 从 30% 掉到 25%。训练成本翻倍是真问题,作者用 matched-budget 实验证伪了"多一倍算力就多一倍分"的怀疑。值得细读。


论文信息

  • 标题:Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
  • arXiv: 2608.17253v2(2026-08-18 v1,2026-08-19 v2)
  • 作者:Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li(共 9 位)
  • 通讯:Yijiang Li (UC San Diego, yijiangli@ucsd.edu)、Nuno Vasconcelos (UC San Diego, nuno@ucsd.edu)
  • 代码:https://github.com/DrStranded/Co-RL
  • 30 页正文 + 附录,5 张图,11 张表

自奖励 RL 的天花板:为什么"自己给自己打分"会崩?

把 RLHF/RLVR 用在推理上,最干净的一路就是 TTRL(Test-Time Reinforcement Learning,Zuo et al., 2025)做的事:模型对同一个 prompt 采样 N 次,做 majority vote 作为 pseudo-label,跟 pseudo-label 一致就给奖励 1、不一致给 0,跑 GRPO。

这套东西在 Qwen2.5-Math-7B 上把 AIME 2024 的 pass@1 从 12.9% 拉到 40.2%,一度是"无标签也能涨"的代表性证据。Intuitor(Zhao et al., 2025)和 RENT(Prabhudesai et al., 2025)走向另一条路:不用投票,改用模型自己下一个 token 的预测分布——self-certainty 或 token entropy 作为 reward。Co-rewarding-II 把同模型的不同视图(paraphrase 问题、EMA 模型)作为第二个 view。

坦率的讲,这三股流派都碰到同一个隐患:信号源和优化目标是同一个模型。TTRL 的"自洽门限",Intuitor 的"自信度",RENT 的"低熵"——都来自正在被优化的那个 πθ。

直觉上会出现什么?Proposition 2(论文 Theorem 前的 Proposition 2)已经把这个写明白了:当 K 个 rollouts 中正确数 C > K/2(多数票正确)时,self-rewarding 的 GRPO 更新 \(\dot p = \eta p(1-p)\mathbb{E}[\operatorname{sign}(C-K/2)\sqrt{C(K-C)}/K]\) 是正的;当 C < K/2(多数票错),更新也是负的——继续把错的推得更错。所以 \(p(0) < 1/2\) 时,\(p(t) \to 0\)\(p(0) > 1/2\) 时,\(p(t) \to 1\)。这是个自确认(self-confirming)动力学,没有外部信号纠错。

Figure 4 的训练曲线把这个直觉变成了可视化:四个模型(Qwen-3B、Llama-3B、Qwen-7B、Llama-8B)跑下来,RENT(红线)几乎全部 divergence——completion 长度直接顶到 3072 token 上限,reward 标准差砸到 0;TTRL(橙)比 RENT 强但在 Llama-3B、Llama-8B 上也撑不住;Intuitor(绿)也好坏参半。Co-RL(蓝)和 GT-Reward(灰虚线)一直稳在 1.0 reward std 附近。

Figure 4: 四个规模训练动态(Qwen-3B/Llama-3B/Qwen-7B/Llama-8B)

图说:Co-RL 在四种模型上都维持稳定的 reward 方差与 response 长度,RENT、TTRL、Intuitor 普遍出现 reward 塌缩、长度爆炸或直接 divergence。

这也是为什么 Co-rewarding-II(Zhang et al., 2026b)虽然用了 paraphrase 和 EMA,依然不够——它的第二个 view 还是从自己派生出来的,errors remain strongly correlated。论文在 Related Work 里直接引了 Li et al. 2023 那句话:"the more alike the two views are, the more they simply agree on the same mistakes"。self-rewarding 走到天花板不是没道理的。


Co-RL 的核心机制:同伴投票

Co-RL 的核心一句话:让一个模型的 reward 来自另一个独立模型的多数票。没有外部 judge、没有 learned reward model、不需要 debate。

形式化地,对于 \(N\) 个独立的 policy \(\{\pi_{\theta_n}\}_{n=1}^N\),给定一个无标签 prompt \(x\),每个 agent \(n\) 自己采样 \(K\) 个 response \(\{y_n^k\}_{k=1}^K\) 并提取最终答案 \(\{a_n^k\}\)。然后关键一步:构造 peer 的 pseudo-label:

\[\hat{a}_{-n}(x) \in \arg\max_b \sum_{j=1}^{K} \mathbf{1}[a_{n-1}^j = b]\]

下标 cyclically:agent 1 被 agent N 监督,agent 2 被 agent 1 监督,etc。每个 agent \(n\) 的 reward 就是 \(r_n^k = \mathbf{1}[a_n^k = \hat{a}_{-n}(x)]\)

\(N=2\) 时两个 agent 互投;\(N=3\) 时形成一个 directed ring(Figure 1 右上);\(N>2\) 还可以扩。每一步,所有 agent 同时采样、同时构造 pseudo-label、同时做 GRPO 更新——这跟单 agent TTRL 的算力差不多翻倍(rollout×N),但 paper 给的 matched-budget 实验(Appendix D.4)显示增益不只是来自算力。

总目标长这样:

\[\max_{\boldsymbol\theta} \mathcal{J}_{\mathrm{Co-RL}}(\boldsymbol\theta) = \frac{1}{N}\sum_{n=1}^{N} \mathcal{J}_{\mathrm{GRPO}}(\theta_n; \{y_n^k, r_n^k\}_{k=1}^{K})\]

每个 agent 用自己 group 内的 reward 做 advantage 归一化,跑标准 GRPO。\(\theta_n\) 之间没有任何梯度交换,连 optimizer state 都是各自独立维护的——这就是论文里反复强调的 "decoupled policy optimization"。

Figure 3: Co-RL 总览,两个 agent 各采样 K 个 response、majority vote 构造 pseudo-label、cross-supervision 给 reward、各自 GRPO 更新

图说:左 agent 的 rollout 给右 agent 算 reward,反之亦然。N=3 时构成有向环。

Figure 1: Co-RL 与 TTRL/Co-rewarding/CoMAS 的对比——reward 来源从"自己的视角"到"独立同伴"

图说:TTRL 和 Co-rewarding 用自己的多数票/EMA 拷贝做奖励;CoMAS 用外部 LLM 当裁判;Co-RL 直接用独立同伴的投票。从 N=3 开始,投票走有向环。


多样性做到三层,是论文的核心 driver

光有"独立训练"还不够。如果两个 agent 是同模型不同 seed(Q7B × Q7B),它们的错误高度相关,cohort 教不出东西。论文 Figure 2(d) 把这事儿讲透了——预训练阶段三种 pair 的 complementarity(错误互补率):

  • 跨家族(Q3B × L3B、Q7B × L8B):错误互补率接近 30 个百分点
  • 同家族不同 seed(L8B × L8B、Q7B × Q7B):约 20 到 25 个百分点
  • 跨尺寸同家族(Q7B × Q3B):25% 左右

这种 decorrelation 不是数字游戏,它直接影响 pseudo-label 的可靠性。Figure 2(a):跨家族 pair 的 agreement 在 0.6–0.75 之间(同家族能冲到 0.85+),说明同伴给的 pseudo-label 不会全盘照抄 agent 自己的答案;图 2(b):跨家族带来的 pseudo-label 准确率更稳;图 2(c):跨家族在 MATH-500 上拉到了 75% 附近,比同家族高出 2–3 个点。

Figure 2: agreement、pseudo-label 准确率、MATH-500 准确率、预训练错误互补率

图说:跨家族(蓝实线)agreement 始终低于同家族(紫虚线),pseudo-label 准确率与评估准确率均更稳定更高;右侧柱状图直观显示不同 pair 的错误互补率。

论文把多样性做到三层:

  1. Decoupled policy optimization:两套独立参数、独立优化器状态,从根上阻断耦合;
  2. 异家族 + 异尺寸:Qwen2.5 × Llama-3.2、Qwen2.5-VL × InternVL3.5 × Gemma-3,tokenizer、ViT、训练数据全都不同;
  3. 改写 prompt:用 DeepSeek-V3 把 MATH 题改写成不同场景的等价问题,一个 agent 看原题、一个 agent 看改写版——避免"对题目措辞敏感"导致的相关错误(Appendix C 给例子)。

Diversity 越往下叠,pseudo-label 越不 echo 自己的偏见,feedback loop 就越脆弱。这是这篇论文最核心的工程直觉,也是为什么 Appendix A(Error Decoupling)会单独拎出来量化。


理论:交叉监督扩大正确收敛域

论文给了三个命题,我把它剥到能用的程度:

Proposition 1(训练动力学)—— 给出了 self-rewarding 和 cross-agent supervision 下 \(p_n = \Pr_{\pi_{\theta_n}}(a = a^\star \mid x)\) 的微分方程。Self-rewarding 下:

\[\dot p = \eta p(1-p)\mathbb{E}_{C\sim\mathrm{Bin}(K,p)}\!\left[\mathrm{sign}\!\left(C - \tfrac{K}{2}\right)\tfrac{\sqrt{C(K-C)}}{K}\right]\]

Cross-agent supervision 下(两 agent)变成:

\[\dot p_A = q_k(p_A)\phi_K(p_B),\quad \dot p_B = q_k(p_B)\phi_K(p_A)\]

其中 \(q_k > 0\)\(\phi_K(p) = 2V_K(p) - 1\) 是 signed majority-vote direction。关键的解耦:A 的更新方向完全由 B 的多数票决定,反之亦然。

Proposition 2(self-confirming 动力学)—— 奇数 \(K\)\(\mathrm{sign}(G_K^{\mathrm{self}}(p)) = \mathrm{sign}(p - 1/2)\)。所以 \(p(0) < 1/2\)\(p(t) \to 0\)\(p(0) > 1/2\)\(p(t) \to 1\)起点选错就回不来了

Theorem 1(Co-RL 扩大正确收敛域)—— 两 agent 对称动力学下,\((1,1)\)\((0,0)\) 都是 asymptotically stable,\((1/2,1/2)\) 是 saddle point,分界线是 \(p_A + p_B = 1\)。所以:

\[p_A(0) + p_B(0) > 1 \Rightarrow (p_A(t), p_B(t)) \to (1,1)$$ $$p_A(0) + p_B(0) < 1 \Rightarrow (p_A(t), p_B(t)) \to (0,0)\]

论文给了一个直观的 toy example:假设一半的 prompt 上 \((p_A, p_B) = (0.9, 0.2)\),另一半上 \((0.2, 0.9)\)。每个 agent 平均准确率 0.55,但优势互补。Self-rewarding 下每个 agent 在 \(p > 1/2\) 的那半 prompt 上成功,最终整体 0.5;Co-RL 下每条 prompt 上 \(p_A + p_B = 1.1 > 1\),Theorem 1 预测两边都收敛到 1,整体 1.0。

坦白讲,理论做了三个简化:忽略 clipping、忽略 KL 项、\(K\) 设为奇数避免平票。论文实际跑的时候 \(K=12\),有平票用 deterministic tie-breaking 处理。这个简化让结论干净,但工程上别忘了 GRPO 真实的更新动力学比这两行公式复杂得多。把它当作直觉比当作证明更稳。


实验一:3B 模型上 Co-RL 比所有自奖励方法都强

主实验 Table 1 跑在 Qwen2.5-3B 和 Llama-3.2-3B-Instruct 上,七个 benchmark:GSM8K、MATH-500、AMC、HumanEval、GPQA、MBPP、LiveCodeBench。三个 Co-RL 变体:Same family(同 base 模型两个独立 seed)、Different family(Qwen × Llama)、Different family+(再加 prompt 改写)。

模型 / 方法 GSM8K MATH-500 AMC HumanEval GPQA MBPP LiveCodeBench Avg
Qwen2.5-3B Base 73.4 56.6 28.9 39.0 21.2 52.2 13.7 40.7
Qwen2.5-3B GT-Reward 76.2 64.6 36.1 65.2 20.7 54.4 14.5 47.4
Qwen2.5-3B TTRL 80.4 66.4 31.3 63.4 22.2 51.8 15.9 47.3
Qwen2.5-3B RENT 75.6 62.8 31.3 59.2 18.2 52.4 14.5 44.9
Qwen2.5-3B Intuitor 74.9 64.2 26.5 59.8 27.3 50.4 16.4 45.6
Qwen2.5-3B Co-rewarding-II 75.5 63.4 30.1 61.0 24.8 53.2 11.0 45.6
Qwen2.5-3B Co-RL Same family 78.5 66.0 37.4 65.8 22.2 56.0 15.2 48.7
Qwen2.5-3B Co-RL Different family 80.1 66.8 33.7 64.0 22.7 56.8 15.2 48.5
Qwen2.5-3B Co-RL Different family plus 81.0 66.6 36.1 62.8 25.8 55.6 17.2 49.3
Llama-3.2-3B-Instruct Base 73.6 43.8 18.1 51.2 21.2 50.8 12.0 38.7
Llama-3.2-3B-Instruct GT-Reward 78.8 53.8 25.3 60.4 20.7 50.2 12.1 43.0
Llama-3.2-3B-Instruct TTRL 77.9 50.2 26.5 59.2 24.8 51.2 12.0 43.1
Llama-3.2-3B-Instruct Co-RL Different family+ 78.4 55.2 30.1 59.2 22.2 50.4 12.0 43.9

数据说话,几个有意思的点:

  1. Same family 已经够强——Qwen2.5-3B Co-RL(Same family)平均 48.7,比最强的 TTRL(47.3)高 1.4 个点。两个独立 seed 就够了,不需要异家族。Llama-3.2-3B-Instruct 上 Same family 平均 42.7,跟 TTRL 持平。
  2. Different family 是 main story——Qwen2.5-3B Different family+ 拉到 49.3,比 TTRL(47.3)高 2.0 个点;Llama 上拉到 43.9,比 TTRL 高 0.8 个点。
  3. Llama 上的提升比 Qwen 上小——Base 上 Qwen 比 Llama 高 2 个点(40.7 vs 38.7),Co-RL 之后差距拉大到 5.4 个点(49.3 vs 43.9)。这是个值得警觉的信号:基座越弱,pseudo-label 噪声越大,Co-RL 涨幅越受限。

实验二:多智能体 RL 协议下用一半的 agent 数赢 4.0 个点

论文按 CoMAS(Xue et al., 2026)的实验设置、数据、评测协议跑了一遍,直接对标 CoMAS、MAPoRL、TTRL、Base。Co-RL 用 2 个 agent,CoMAS 用 4 个 agent + LLM judge。

方法 GSM8K MATH-500 HumanEval MBPP MMLU GPQA SciBench Avg
Base (Qwen2.5-3B-Instruct) 85.40 55.00 73.78 55.80 63.20 28.79 36.47 56.92
MAPoRL 85.80 55.40 75.61 57.00 63.20 31.47 39.08 58.22
TTRL 88.20 56.80 73.78 59.00 63.80 27.23 38.48 58.18
CoMAS(4 agents + judge) 87.20 55.80 77.44 59.20 65.60 29.69 37.68 58.94
Co-RL(Different family, 2 agents) 89.5 68.6 82.32 68.00 65.80 29.69 36.87 62.97

两个数特别扎眼——MATH-500 上 Co-RL 68.6 比 CoMAS 55.8 高出 12.8 个点,HumanEval 上 82.32 比 77.44 高出 4.9 个点。平均 62.97 vs 58.94,赢 4.0 个点,而且只用一半的 agent,没有外部 judge。这跟 CoMAS 的对比方式很公允——同一 base、同一协议、同一评测,Co-RL 的优势是结构性的。


实验三:扩展到三个 agent(异家族 + 异尺寸)

模型 / 方法 GSM8K MATH-500 HumanEval MBPP GPQA LiveCodeBench Avg
Qwen2.5-3B Base 73.4 56.6 28.9 39.0 21.2 13.7 40.7
Qwen2.5-3B GT-Reward 76.2 64.6 36.1 65.2 20.7 14.5 47.4
Qwen2.5-3B TTRL 80.4 66.4 31.3 63.4 22.2 15.9 47.3
Qwen2.5-3B Co-RL 79.8 66.3 33.6 64.6 23.2 15.8 48.5
Llama-3.2-3B Base 73.6 43.8 18.1 51.2 21.2 12.0 38.7
Llama-3.2-3B GT-Reward 78.8 53.8 25.3 60.4 20.7 12.1 43.0
Llama-3.2-3B TTRL 77.9 50.2 26.5 59.2 24.8 12.0 43.1
Llama-3.2-3B Co-RL 77.8 54.2 28.8 64.4 25.1 11.7 44.7
Qwen3-1.7B Base 67.0 60.9 27.5 40.0 15.3 12.4 39.1
Qwen3-1.7B GT-Reward 67.1 67.0 34.3 70.1 25.2 15.2 47.2
Qwen3-1.7B TTRL 70.3 67.6 32.1 69.5 24.8 15.1 47.3
Qwen3-1.7B Co-RL 69.3 67.6 32.7 64.2 27.1 15.3 47.3

三个模型一起跑 Co-RL(Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen3-1.7B 在一个 run 内同时训练)。三模型平均提升 7.8%、6.0%、8.2%,并且在没有 ground-truth 的情况下匹配或超过 GT-Reward。

Qwen3-1.7B 这组数字有点意思——Co-RL 平均 47.3 跟 TTRL 一样,但 GPQA 上 27.1 比 TTRL 的 24.8 高 2.3 个点。当模型的某个能力维度本身就很强时(Qwen3-1.7B 在 MATH-500 上从 60.9 涨到 67.6),Co-RL 的收益会迁移到薄弱维度上。这是 cross-agent supervision "互补" 的实证。


实验四:扩展到 7B/8B,Co-RL 在 Llama 上超越 GT-Reward

Table 8 把规模拉到 Qwen2.5-7B × Llama-3.1-8B-Instruct。结果摘要:

  • Qwen2.5-7B:Base 49.0 → Co-RL Different family+ 53.6(涨 4.6 个点),比 TTRL(51.7)高 1.9 个点。
  • Llama-3.1-8B-Instruct:Base 44.7 → Co-RL Different family+ 47.7(涨 3.0 个点),超过了 GT-Reward 的 47.1,全程没用一条 ground-truth label。

后面这个数值得停下来看看——Co-RL 用 0 label 在 Llama-8B 上跑出了超过 supervised RL 的成绩。我自己第一次看到这个数时愣了一下,因为它跟我之前接触过的"无标签训练永远追不上有标签"的经验直觉相悖。但回过头看 Theorem 1 的 toy example,当两个 agent 互补性足够强时,Co-RL 的纠错能力理论上可以超过一个固定的 GT-Reward——后者会被 GT 噪声困住,前者可以靠同伴投出更准的 pseudo-label。


实验五:多模态 VLM,跨视觉编码器也能跑

VLM 的多模态部分是这篇论文的第二个"重头戏"。Table 4 在 Qwen2.5-VL-3B × InternVL3.5-2B、Table 9 在 Qwen2.5-VL-7B × InternVL3.5-8B × Gemma-3-12B 上跑,数据集是 multimodal-open-r1 和 MMR1,benchmark 是 MathVision / MathVerse / MathVista / We-Math。

Backbone Method MathVision MathVerse MathVista We-Math Avg
InternVL-3.5-2B Base 24.77 34.21 55.60 57.87 43.11
InternVL-3.5-2B TTRL (open-r1) 25.86 34.24 57.60 62.47 45.04
InternVL-3.5-2B Co-RL(open-r1) 26.25 34.92 58.90 61.55 45.40
Qwen2.5-VL-3B Base 18.55 26.04 52.70 51.67 37.24
Qwen2.5-VL-3B TTRL (open-r1) 21.15 30.05 57.40 61.55 42.54
Qwen2.5-VL-3B Co-RL(open-r1) 21.94 30.48 60.20 62.93 43.89
Qwen2.5-VL-7B Base 23.36 33.32 56.60 62.47 43.94
Qwen2.5-VL-7B TTRL (open-r1) 23.62 37.26 69.40 65.23 48.88
Qwen2.5-VL-7B Co-RL(open-r1) 26.87 38.43 71.00 68.22 51.13
InternVL-3.5-8B Base 29.21 36.65 65.70 60.69 48.06
InternVL-3.5-8B Co-RL(open-r1) 35.30 40.74 70.60 70.98 54.40
Gemma-3-12B Base 27.20 32.70 46.70 60.50 41.78
Gemma-3-12B TTRL 27.93 36.37 54.70 58.79 44.45
Gemma-3-12B Co-RL 32.01 35.91 55.60 66.72 47.56

最震撼的是 Gemma-3-12B:Co-RL 47.56% vs GT-Reward 45.17%,比 supervised 还高 2.4 个点。VLM 上视觉编码器天然就是异构的(Qwen2.5-VL 的 native dynamic-resolution ViT、InternVL 的 InternViT、Gemma-3 的 SigLIP),cross-agent supervision 在这里有更自然的"多样性来源"。

但 VLM 的 Figure 5 也暴露了一个真实问题:TTRL 跑到 ~500 步就崩(accuracy 掉到 50% 以下、completion 长度从 250 缩到 80),Co-RL 持续涨到 1000 步都没掉。VLM 的训练曲线比 LLM 更脆弱。

Figure 5: VLM(Qwen2.5-VL-7B × InternVL3.5-8B)训练动态——TTRL 后期崩,Co-RL 持续涨

图说:(a) Eval accuracy:Co-RL(蓝实线)一路涨到 ~70%,TTRL(橙虚线)500 步后掉到 50%。(c) pseudo-label accuracy(蓝实线 ~0.4)和 inter-agent agreement(紫虚线 ~0.6)一直有 gap,验证 agents 没坍缩到一致。


算力对照实验:matched-budget 下 Co-RL 仍赢

2 个 agent 一起训练,rollout 算力天然是单 agent 的 2 倍。论文做了一个非常重要的对照(Table 10、Table 11):用同样的两个 base 模型,分别做 Co-RL 和"两个模型各自独立跑 TTRL",推理时都做 maj@8 ensembling。

Setting GSM8K MATH-500 AMC Avg
TTRL (Qwen2.5-3B 单独) 88.2 68.8 39.8 65.6
TTRL (Llama-3.2-3B 单独) 65.7 56.0 27.7 49.8
TTRL (两模型 ensemble) 88.2 68.0 38.6 64.9
Co-RL (Qwen2.5-3B) 87.4 72.8 37.4 65.9
Co-RL (Llama-3.2-3B) 87.3 58.8 33.7 59.9
Co-RL(ensemble) 90.1 70.8 39.8 66.9

纯单 agent 上 Co-RL 训练出来的 Qwen 比 TTRL 训练的 Qwen 还好(65.9 vs 65.6)。ensemble 之后 Co-RL 拉到 66.9,TTRL ensemble 是 64.9。差距 2.0 个点——比 TTRL 单模型的微弱领先(+0.3)大得多。这说明:两个 TTRL 模型 ensemble 的提升来自推理端 pooling,而 Co-RL 的提升来自训练端 cross-agent supervision

多模态那边(Table 11)的对照更直白:Qwen2.5-VL × InternVL3.5 在 open-r1 数据集上,Co-RL ensemble 平均 50.88,TTRL ensemble 48.80,单独最强的 TTRL(InternVL3.5)49.53。Co-RL ensemble 比"两个 TTRL 强模型"还高 1.4 个点。

这个对照实验是 paper 里最让我放心的部分——它把"我赢是因为算力翻倍"这种廉价解释直接堵死了。


几种方法的核心对比

把方法归到一张表里:

方法 Reward 来源 需要 judge? 需要 ground truth? 反馈环风险 多样性来源
TTRL 自己的多数票 高(自确认)
Intuitor 自己的 token 分布与均匀分布的 KL
RENT 自己的 token 熵
Co-rewarding-II 自己 paraphrase / EMA 模型 中(同模型派生)
CoMAS LLM 判官评分
MAPoRL learned reward model
GT-Reward ground-truth label 无(oracle)
Co-RL 同伴多数票 强(异家族 + 异尺寸 + prompt 改写)

这张表把 Co-RL 的相对位置说清楚了——它是"零标签 + 零 judge" 赛道里把反馈环风险压到最低的那一个。


我的判断:硬核的工程论文,但有几个值得警觉的地方

亮点:

  • 想法干净。把 1998 年 Blum & Mitchell 的 co-training 思想拉进 LLM 后训练,关键变量(独立性)控制得很清晰。
  • 理论干净。Theorem 1 把"为什么两个弱分类器能互相教会"这件事写成了一句 \(p_A + p_B > 1\)
  • 实验充分。matched-budget 对照消除了"算力"的廉价解释;多模态扩展证明方法不挑架构;3B / 7B / 12B 三档规模都跑。
  • 公开代码和 checkpoints。Co-RL 这类方法最怕"我做了一组特别好的配对",公开复现能让社区验证 diversity 选择的影响。

需要打问号的地方:

  1. 多样性靠手工选。Qwen × Llama 这个组合刚好互补,是论文 Appendix A 量化的,但具体哪个家族跟哪个家族配最优,没有系统研究。Gemma × Qwen、Gemma × InternVL 的组合怎么样?论文没覆盖。
  2. 理论简化太狠。忽略 KL、忽略 clip、\(K\) 取奇数。实操 GRPO 里 KL 项是稳定器,clip 是 advantage 的边界。Theorem 1 给的是"在简化动力学下成立",工程上的边界条件不严格。
  3. 训练成本是真的翻倍。Co-RL 的 matched-budget 比 TTRL 多 2.0 个点,但 rollout×2 的算力在小模型上还能承受,10B+ 模型上就要谨慎了。论文没给 scaling law。
  4. pseudo-label 仍然依赖初始模型的群体智能。如果两个 base 模型都很弱(比如 1B 以下),majority vote 本身就乱,Co-RL 的纠错也纠不动。论文在 Qwen3-1.7B 上验证了,但仍是个边界条件。
  5. 改进幅度受制于 pseudo-label 噪声。Co-RL 在 Llama-3.2-3B 上比 TTRL 只高 0.8 个点(43.9 vs 43.1),在 Qwen2.5-3B 上高 2.0 个点(49.3 vs 47.3)。Llama base 比 Qwen 弱 2 个点,Co-RL 涨幅也小。base 越弱,互补性越难体现

工程启发:什么时候该把 Co-RL 装进自己的 pipeline?

说几个具体场景:

  • 你已经在用 TTRL/Intuitor 跑 reasoning RL:试试把两个 family 的 checkpoint 互相投,多数情况下 1–2 个点的提升白拿。Same family(两个不同 seed)就已经有正收益。
  • 你的 RL 训练后期 reward std 塌到 0、completion 长度爆炸:大概率是 self-reinforcement 把模型压到一个偏向上去了。Co-RL 是直接对症的方案——加一个不同 family 的同伴,让 reward 信号不要那么"自我中心"。
  • 你的任务是 VLM/多模态:天然就有异构视觉编码器可用,Co-RL 的 diversity 比 LLM 还好做。
  • 你想零成本试一下:作者开源了 Co-RL 代码(https://github.com/DrStranded/Co-RL),改动最小的工作量是把现有 GRPO 训练脚本里 reward 计算那一行替换成"同伴多数票",跑两套独立参数。

一个不一定要马上照搬的事:N=3 的有向环。Table 3 的三 agent 设置理论更漂亮,但实际训练成本再翻 1.5 倍,性价比未必比两 agent 好。先从两 agent 起步更稳。


结语

Co-RL 是个让你读完之后想"对,就该这么做"的论文——它没发明新东西,它把一个 28 年前的 idea 在 LLM 时代重新讲了一遍,而这一遍恰好打在了 TTRL 们最薄弱的位置上:self-reinforcing feedback loop。

理论上的 \(p_A + p_B > 1\) 是好记的口诀,工程上的 "挑一个异家族的同伴" 是好上手的操作。两者结合,把无标签 RL 从"碰运气"的探索推进到了"可设计"的工程层面。

下一个值得追问的问题是:能不能让 cohort 自适应? 不是手动挑 family,而是让模型自己学"该让谁投我"。Co-RL 的作者在 Conclusion 里也提到,未来工作会探索"adaptive supervision mechanisms"。这是 LLM 多智能体训练真正有趣的方向。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。

参考链接

  • 论文:https://arxiv.org/abs/2608.17253
  • HTML:https://arxiv.org/html/2608.17253v2
  • 代码:https://github.com/DrStranded/Co-RL
  • 相关前置:TTRL(arXiv:2504.16084)、Intuitor(arXiv:2505.10990)、Co-rewarding(arXiv:2505.23802)、CoMAS(Xue et al., 2026)、Blum & Mitchell co-training(COLT 1998)