两个不共享参数的模型互投,3.0–8.6 个点的无监督推理就出来了
你有没有碰到过这种情况:模型跑 RL,reward 一直在涨,但你心里清楚,那只是模型越来"越听话"地迎合自己的多数票,而不是真的把题做对?这篇 Co-RL(arXiv:2608.17253)戳的就是这个痛点——它把"自奖励 RL"那个自我强化的反馈环,用一群异构模型互投给打破了。
核心摘要
痛点:自奖励 RL(self-rewarding RL,比如 TTRL 的多数票、Intuitor 的 self-certainty、RENT 的熵)所有信号都来自"同一个模型"。当模型本身错得离谱时,它的多数票本身就是错的,RL 只会把它推向更深的错误——reward 标准差塌到 0、completion 长度发散、性能雪崩。
方案:Co-RL 同时训练多个不共享参数、不共享梯度的独立模型,每个模型的 reward 由同伴的多数票决定(论文里叫 cross-agent supervision)。多样性做到三层:异家族(Qwen × Llama)、异尺寸、改写 prompt(DeepSeek-V3 rewrite)。三者切断自奖励的反馈环。
效果:纯文本 7 个 benchmark、3B 模型涨 4.0–8.0%,7B/8B 模型 best variant 比 base 高 3.0–8.6%;多模态 4 个 benchmark,2B–12B 模型涨 2.3–7.2%;在 CoMAS 评测协议下用一半的 agent 数比 CoMAS 还高 4.0%。Gemma-3-12B 上 Co-RL 甚至超过了 GT-Reward(47.56% vs 45.17%),全程没用一条真值标签。
判断:这篇论文把"co-training"这个 1998 年的老 idea 在 LLM 后训练上重新激活了,做法不花哨,但理论加实验都挺干净。多样性是核心 driver,没有异家族只是同模型两个 seed,论文里直接给你看 complementarity 从 30% 掉到 25%。训练成本翻倍是真问题,作者用 matched-budget 实验证伪了"多一倍算力就多一倍分"的怀疑。值得细读。
论文信息
- 标题:Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
- arXiv: 2608.17253v2(2026-08-18 v1,2026-08-19 v2)
- 作者:Yunhao Yang, Yuexin Bian, Yunjie Tian, Di Fu, Tianjin Huang, Yuanyuan Shi, Ziang Xiao, Nuno Vasconcelos, Yijiang Li(共 9 位)
- 通讯:Yijiang Li (UC San Diego, yijiangli@ucsd.edu)、Nuno Vasconcelos (UC San Diego, nuno@ucsd.edu)
- 代码:https://github.com/DrStranded/Co-RL
- 30 页正文 + 附录,5 张图,11 张表
自奖励 RL 的天花板:为什么"自己给自己打分"会崩?
把 RLHF/RLVR 用在推理上,最干净的一路就是 TTRL(Test-Time Reinforcement Learning,Zuo et al., 2025)做的事:模型对同一个 prompt 采样 N 次,做 majority vote 作为 pseudo-label,跟 pseudo-label 一致就给奖励 1、不一致给 0,跑 GRPO。
这套东西在 Qwen2.5-Math-7B 上把 AIME 2024 的 pass@1 从 12.9% 拉到 40.2%,一度是"无标签也能涨"的代表性证据。Intuitor(Zhao et al., 2025)和 RENT(Prabhudesai et al., 2025)走向另一条路:不用投票,改用模型自己下一个 token 的预测分布——self-certainty 或 token entropy 作为 reward。Co-rewarding-II 把同模型的不同视图(paraphrase 问题、EMA 模型)作为第二个 view。
坦率的讲,这三股流派都碰到同一个隐患:信号源和优化目标是同一个模型。TTRL 的"自洽门限",Intuitor 的"自信度",RENT 的"低熵"——都来自正在被优化的那个 πθ。
直觉上会出现什么?Proposition 2(论文 Theorem 前的 Proposition 2)已经把这个写明白了:当 K 个 rollouts 中正确数 C > K/2(多数票正确)时,self-rewarding 的 GRPO 更新 \(\dot p = \eta p(1-p)\mathbb{E}[\operatorname{sign}(C-K/2)\sqrt{C(K-C)}/K]\) 是正的;当 C < K/2(多数票错),更新也是负的——继续把错的推得更错。所以 \(p(0) < 1/2\) 时,\(p(t) \to 0\);\(p(0) > 1/2\) 时,\(p(t) \to 1\)。这是个自确认(self-confirming)动力学,没有外部信号纠错。
Figure 4 的训练曲线把这个直觉变成了可视化:四个模型(Qwen-3B、Llama-3B、Qwen-7B、Llama-8B)跑下来,RENT(红线)几乎全部 divergence——completion 长度直接顶到 3072 token 上限,reward 标准差砸到 0;TTRL(橙)比 RENT 强但在 Llama-3B、Llama-8B 上也撑不住;Intuitor(绿)也好坏参半。Co-RL(蓝)和 GT-Reward(灰虚线)一直稳在 1.0 reward std 附近。

图说:Co-RL 在四种模型上都维持稳定的 reward 方差与 response 长度,RENT、TTRL、Intuitor 普遍出现 reward 塌缩、长度爆炸或直接 divergence。
这也是为什么 Co-rewarding-II(Zhang et al., 2026b)虽然用了 paraphrase 和 EMA,依然不够——它的第二个 view 还是从自己派生出来的,errors remain strongly correlated。论文在 Related Work 里直接引了 Li et al. 2023 那句话:"the more alike the two views are, the more they simply agree on the same mistakes"。self-rewarding 走到天花板不是没道理的。
Co-RL 的核心机制:同伴投票
Co-RL 的核心一句话:让一个模型的 reward 来自另一个独立模型的多数票。没有外部 judge、没有 learned reward model、不需要 debate。
形式化地,对于 \(N\) 个独立的 policy \(\{\pi_{\theta_n}\}_{n=1}^N\),给定一个无标签 prompt \(x\),每个 agent \(n\) 自己采样 \(K\) 个 response \(\{y_n^k\}_{k=1}^K\) 并提取最终答案 \(\{a_n^k\}\)。然后关键一步:构造 peer 的 pseudo-label:
下标 cyclically:agent 1 被 agent N 监督,agent 2 被 agent 1 监督,etc。每个 agent \(n\) 的 reward 就是 \(r_n^k = \mathbf{1}[a_n^k = \hat{a}_{-n}(x)]\)。
\(N=2\) 时两个 agent 互投;\(N=3\) 时形成一个 directed ring(Figure 1 右上);\(N>2\) 还可以扩。每一步,所有 agent 同时采样、同时构造 pseudo-label、同时做 GRPO 更新——这跟单 agent TTRL 的算力差不多翻倍(rollout×N),但 paper 给的 matched-budget 实验(Appendix D.4)显示增益不只是来自算力。
总目标长这样:
每个 agent 用自己 group 内的 reward 做 advantage 归一化,跑标准 GRPO。\(\theta_n\) 之间没有任何梯度交换,连 optimizer state 都是各自独立维护的——这就是论文里反复强调的 "decoupled policy optimization"。

图说:左 agent 的 rollout 给右 agent 算 reward,反之亦然。N=3 时构成有向环。

图说:TTRL 和 Co-rewarding 用自己的多数票/EMA 拷贝做奖励;CoMAS 用外部 LLM 当裁判;Co-RL 直接用独立同伴的投票。从 N=3 开始,投票走有向环。
多样性做到三层,是论文的核心 driver
光有"独立训练"还不够。如果两个 agent 是同模型不同 seed(Q7B × Q7B),它们的错误高度相关,cohort 教不出东西。论文 Figure 2(d) 把这事儿讲透了——预训练阶段三种 pair 的 complementarity(错误互补率):
- 跨家族(Q3B × L3B、Q7B × L8B):错误互补率接近 30 个百分点
- 同家族不同 seed(L8B × L8B、Q7B × Q7B):约 20 到 25 个百分点
- 跨尺寸同家族(Q7B × Q3B):25% 左右
这种 decorrelation 不是数字游戏,它直接影响 pseudo-label 的可靠性。Figure 2(a):跨家族 pair 的 agreement 在 0.6–0.75 之间(同家族能冲到 0.85+),说明同伴给的 pseudo-label 不会全盘照抄 agent 自己的答案;图 2(b):跨家族带来的 pseudo-label 准确率更稳;图 2(c):跨家族在 MATH-500 上拉到了 75% 附近,比同家族高出 2–3 个点。

图说:跨家族(蓝实线)agreement 始终低于同家族(紫虚线),pseudo-label 准确率与评估准确率均更稳定更高;右侧柱状图直观显示不同 pair 的错误互补率。
论文把多样性做到三层:
- Decoupled policy optimization:两套独立参数、独立优化器状态,从根上阻断耦合;
- 异家族 + 异尺寸:Qwen2.5 × Llama-3.2、Qwen2.5-VL × InternVL3.5 × Gemma-3,tokenizer、ViT、训练数据全都不同;
- 改写 prompt:用 DeepSeek-V3 把 MATH 题改写成不同场景的等价问题,一个 agent 看原题、一个 agent 看改写版——避免"对题目措辞敏感"导致的相关错误(Appendix C 给例子)。
Diversity 越往下叠,pseudo-label 越不 echo 自己的偏见,feedback loop 就越脆弱。这是这篇论文最核心的工程直觉,也是为什么 Appendix A(Error Decoupling)会单独拎出来量化。
理论:交叉监督扩大正确收敛域
论文给了三个命题,我把它剥到能用的程度:
Proposition 1(训练动力学)—— 给出了 self-rewarding 和 cross-agent supervision 下 \(p_n = \Pr_{\pi_{\theta_n}}(a = a^\star \mid x)\) 的微分方程。Self-rewarding 下:
Cross-agent supervision 下(两 agent)变成:
其中 \(q_k > 0\),\(\phi_K(p) = 2V_K(p) - 1\) 是 signed majority-vote direction。关键的解耦:A 的更新方向完全由 B 的多数票决定,反之亦然。
Proposition 2(self-confirming 动力学)—— 奇数 \(K\) 时 \(\mathrm{sign}(G_K^{\mathrm{self}}(p)) = \mathrm{sign}(p - 1/2)\)。所以 \(p(0) < 1/2\) 时 \(p(t) \to 0\),\(p(0) > 1/2\) 时 \(p(t) \to 1\)。起点选错就回不来了。
Theorem 1(Co-RL 扩大正确收敛域)—— 两 agent 对称动力学下,\((1,1)\) 和 \((0,0)\) 都是 asymptotically stable,\((1/2,1/2)\) 是 saddle point,分界线是 \(p_A + p_B = 1\)。所以:
论文给了一个直观的 toy example:假设一半的 prompt 上 \((p_A, p_B) = (0.9, 0.2)\),另一半上 \((0.2, 0.9)\)。每个 agent 平均准确率 0.55,但优势互补。Self-rewarding 下每个 agent 在 \(p > 1/2\) 的那半 prompt 上成功,最终整体 0.5;Co-RL 下每条 prompt 上 \(p_A + p_B = 1.1 > 1\),Theorem 1 预测两边都收敛到 1,整体 1.0。
坦白讲,理论做了三个简化:忽略 clipping、忽略 KL 项、\(K\) 设为奇数避免平票。论文实际跑的时候 \(K=12\),有平票用 deterministic tie-breaking 处理。这个简化让结论干净,但工程上别忘了 GRPO 真实的更新动力学比这两行公式复杂得多。把它当作直觉比当作证明更稳。
实验一:3B 模型上 Co-RL 比所有自奖励方法都强
主实验 Table 1 跑在 Qwen2.5-3B 和 Llama-3.2-3B-Instruct 上,七个 benchmark:GSM8K、MATH-500、AMC、HumanEval、GPQA、MBPP、LiveCodeBench。三个 Co-RL 变体:Same family(同 base 模型两个独立 seed)、Different family(Qwen × Llama)、Different family+(再加 prompt 改写)。
| 模型 / 方法 | GSM8K | MATH-500 | AMC | HumanEval | GPQA | MBPP | LiveCodeBench | Avg |
|---|---|---|---|---|---|---|---|---|
| Qwen2.5-3B Base | 73.4 | 56.6 | 28.9 | 39.0 | 21.2 | 52.2 | 13.7 | 40.7 |
| Qwen2.5-3B GT-Reward | 76.2 | 64.6 | 36.1 | 65.2 | 20.7 | 54.4 | 14.5 | 47.4 |
| Qwen2.5-3B TTRL | 80.4 | 66.4 | 31.3 | 63.4 | 22.2 | 51.8 | 15.9 | 47.3 |
| Qwen2.5-3B RENT | 75.6 | 62.8 | 31.3 | 59.2 | 18.2 | 52.4 | 14.5 | 44.9 |
| Qwen2.5-3B Intuitor | 74.9 | 64.2 | 26.5 | 59.8 | 27.3 | 50.4 | 16.4 | 45.6 |
| Qwen2.5-3B Co-rewarding-II | 75.5 | 63.4 | 30.1 | 61.0 | 24.8 | 53.2 | 11.0 | 45.6 |
| Qwen2.5-3B Co-RL Same family | 78.5 | 66.0 | 37.4 | 65.8 | 22.2 | 56.0 | 15.2 | 48.7 |
| Qwen2.5-3B Co-RL Different family | 80.1 | 66.8 | 33.7 | 64.0 | 22.7 | 56.8 | 15.2 | 48.5 |
| Qwen2.5-3B Co-RL Different family plus | 81.0 | 66.6 | 36.1 | 62.8 | 25.8 | 55.6 | 17.2 | 49.3 |
| Llama-3.2-3B-Instruct Base | 73.6 | 43.8 | 18.1 | 51.2 | 21.2 | 50.8 | 12.0 | 38.7 |
| Llama-3.2-3B-Instruct GT-Reward | 78.8 | 53.8 | 25.3 | 60.4 | 20.7 | 50.2 | 12.1 | 43.0 |
| Llama-3.2-3B-Instruct TTRL | 77.9 | 50.2 | 26.5 | 59.2 | 24.8 | 51.2 | 12.0 | 43.1 |
| Llama-3.2-3B-Instruct Co-RL Different family+ | 78.4 | 55.2 | 30.1 | 59.2 | 22.2 | 50.4 | 12.0 | 43.9 |
数据说话,几个有意思的点:
- Same family 已经够强——Qwen2.5-3B Co-RL(Same family)平均 48.7,比最强的 TTRL(47.3)高 1.4 个点。两个独立 seed 就够了,不需要异家族。Llama-3.2-3B-Instruct 上 Same family 平均 42.7,跟 TTRL 持平。
- Different family 是 main story——Qwen2.5-3B Different family+ 拉到 49.3,比 TTRL(47.3)高 2.0 个点;Llama 上拉到 43.9,比 TTRL 高 0.8 个点。
- Llama 上的提升比 Qwen 上小——Base 上 Qwen 比 Llama 高 2 个点(40.7 vs 38.7),Co-RL 之后差距拉大到 5.4 个点(49.3 vs 43.9)。这是个值得警觉的信号:基座越弱,pseudo-label 噪声越大,Co-RL 涨幅越受限。
实验二:多智能体 RL 协议下用一半的 agent 数赢 4.0 个点
论文按 CoMAS(Xue et al., 2026)的实验设置、数据、评测协议跑了一遍,直接对标 CoMAS、MAPoRL、TTRL、Base。Co-RL 用 2 个 agent,CoMAS 用 4 个 agent + LLM judge。
| 方法 | GSM8K | MATH-500 | HumanEval | MBPP | MMLU | GPQA | SciBench | Avg |
|---|---|---|---|---|---|---|---|---|
| Base (Qwen2.5-3B-Instruct) | 85.40 | 55.00 | 73.78 | 55.80 | 63.20 | 28.79 | 36.47 | 56.92 |
| MAPoRL | 85.80 | 55.40 | 75.61 | 57.00 | 63.20 | 31.47 | 39.08 | 58.22 |
| TTRL | 88.20 | 56.80 | 73.78 | 59.00 | 63.80 | 27.23 | 38.48 | 58.18 |
| CoMAS(4 agents + judge) | 87.20 | 55.80 | 77.44 | 59.20 | 65.60 | 29.69 | 37.68 | 58.94 |
| Co-RL(Different family, 2 agents) | 89.5 | 68.6 | 82.32 | 68.00 | 65.80 | 29.69 | 36.87 | 62.97 |
两个数特别扎眼——MATH-500 上 Co-RL 68.6 比 CoMAS 55.8 高出 12.8 个点,HumanEval 上 82.32 比 77.44 高出 4.9 个点。平均 62.97 vs 58.94,赢 4.0 个点,而且只用一半的 agent,没有外部 judge。这跟 CoMAS 的对比方式很公允——同一 base、同一协议、同一评测,Co-RL 的优势是结构性的。
实验三:扩展到三个 agent(异家族 + 异尺寸)
| 模型 / 方法 | GSM8K | MATH-500 | HumanEval | MBPP | GPQA | LiveCodeBench | Avg |
|---|---|---|---|---|---|---|---|
| Qwen2.5-3B Base | 73.4 | 56.6 | 28.9 | 39.0 | 21.2 | 13.7 | 40.7 |
| Qwen2.5-3B GT-Reward | 76.2 | 64.6 | 36.1 | 65.2 | 20.7 | 14.5 | 47.4 |
| Qwen2.5-3B TTRL | 80.4 | 66.4 | 31.3 | 63.4 | 22.2 | 15.9 | 47.3 |
| Qwen2.5-3B Co-RL | 79.8 | 66.3 | 33.6 | 64.6 | 23.2 | 15.8 | 48.5 |
| Llama-3.2-3B Base | 73.6 | 43.8 | 18.1 | 51.2 | 21.2 | 12.0 | 38.7 |
| Llama-3.2-3B GT-Reward | 78.8 | 53.8 | 25.3 | 60.4 | 20.7 | 12.1 | 43.0 |
| Llama-3.2-3B TTRL | 77.9 | 50.2 | 26.5 | 59.2 | 24.8 | 12.0 | 43.1 |
| Llama-3.2-3B Co-RL | 77.8 | 54.2 | 28.8 | 64.4 | 25.1 | 11.7 | 44.7 |
| Qwen3-1.7B Base | 67.0 | 60.9 | 27.5 | 40.0 | 15.3 | 12.4 | 39.1 |
| Qwen3-1.7B GT-Reward | 67.1 | 67.0 | 34.3 | 70.1 | 25.2 | 15.2 | 47.2 |
| Qwen3-1.7B TTRL | 70.3 | 67.6 | 32.1 | 69.5 | 24.8 | 15.1 | 47.3 |
| Qwen3-1.7B Co-RL | 69.3 | 67.6 | 32.7 | 64.2 | 27.1 | 15.3 | 47.3 |
三个模型一起跑 Co-RL(Qwen2.5-3B、Llama-3.2-3B-Instruct、Qwen3-1.7B 在一个 run 内同时训练)。三模型平均提升 7.8%、6.0%、8.2%,并且在没有 ground-truth 的情况下匹配或超过 GT-Reward。
Qwen3-1.7B 这组数字有点意思——Co-RL 平均 47.3 跟 TTRL 一样,但 GPQA 上 27.1 比 TTRL 的 24.8 高 2.3 个点。当模型的某个能力维度本身就很强时(Qwen3-1.7B 在 MATH-500 上从 60.9 涨到 67.6),Co-RL 的收益会迁移到薄弱维度上。这是 cross-agent supervision "互补" 的实证。
实验四:扩展到 7B/8B,Co-RL 在 Llama 上超越 GT-Reward
Table 8 把规模拉到 Qwen2.5-7B × Llama-3.1-8B-Instruct。结果摘要:
- Qwen2.5-7B:Base 49.0 → Co-RL Different family+ 53.6(涨 4.6 个点),比 TTRL(51.7)高 1.9 个点。
- Llama-3.1-8B-Instruct:Base 44.7 → Co-RL Different family+ 47.7(涨 3.0 个点),超过了 GT-Reward 的 47.1,全程没用一条 ground-truth label。
后面这个数值得停下来看看——Co-RL 用 0 label 在 Llama-8B 上跑出了超过 supervised RL 的成绩。我自己第一次看到这个数时愣了一下,因为它跟我之前接触过的"无标签训练永远追不上有标签"的经验直觉相悖。但回过头看 Theorem 1 的 toy example,当两个 agent 互补性足够强时,Co-RL 的纠错能力理论上可以超过一个固定的 GT-Reward——后者会被 GT 噪声困住,前者可以靠同伴投出更准的 pseudo-label。
实验五:多模态 VLM,跨视觉编码器也能跑
VLM 的多模态部分是这篇论文的第二个"重头戏"。Table 4 在 Qwen2.5-VL-3B × InternVL3.5-2B、Table 9 在 Qwen2.5-VL-7B × InternVL3.5-8B × Gemma-3-12B 上跑,数据集是 multimodal-open-r1 和 MMR1,benchmark 是 MathVision / MathVerse / MathVista / We-Math。
| Backbone | Method | MathVision | MathVerse | MathVista | We-Math | Avg |
|---|---|---|---|---|---|---|
| InternVL-3.5-2B | Base | 24.77 | 34.21 | 55.60 | 57.87 | 43.11 |
| InternVL-3.5-2B | TTRL (open-r1) | 25.86 | 34.24 | 57.60 | 62.47 | 45.04 |
| InternVL-3.5-2B | Co-RL(open-r1) | 26.25 | 34.92 | 58.90 | 61.55 | 45.40 |
| Qwen2.5-VL-3B | Base | 18.55 | 26.04 | 52.70 | 51.67 | 37.24 |
| Qwen2.5-VL-3B | TTRL (open-r1) | 21.15 | 30.05 | 57.40 | 61.55 | 42.54 |
| Qwen2.5-VL-3B | Co-RL(open-r1) | 21.94 | 30.48 | 60.20 | 62.93 | 43.89 |
| Qwen2.5-VL-7B | Base | 23.36 | 33.32 | 56.60 | 62.47 | 43.94 |
| Qwen2.5-VL-7B | TTRL (open-r1) | 23.62 | 37.26 | 69.40 | 65.23 | 48.88 |
| Qwen2.5-VL-7B | Co-RL(open-r1) | 26.87 | 38.43 | 71.00 | 68.22 | 51.13 |
| InternVL-3.5-8B | Base | 29.21 | 36.65 | 65.70 | 60.69 | 48.06 |
| InternVL-3.5-8B | Co-RL(open-r1) | 35.30 | 40.74 | 70.60 | 70.98 | 54.40 |
| Gemma-3-12B | Base | 27.20 | 32.70 | 46.70 | 60.50 | 41.78 |
| Gemma-3-12B | TTRL | 27.93 | 36.37 | 54.70 | 58.79 | 44.45 |
| Gemma-3-12B | Co-RL | 32.01 | 35.91 | 55.60 | 66.72 | 47.56 |
最震撼的是 Gemma-3-12B:Co-RL 47.56% vs GT-Reward 45.17%,比 supervised 还高 2.4 个点。VLM 上视觉编码器天然就是异构的(Qwen2.5-VL 的 native dynamic-resolution ViT、InternVL 的 InternViT、Gemma-3 的 SigLIP),cross-agent supervision 在这里有更自然的"多样性来源"。
但 VLM 的 Figure 5 也暴露了一个真实问题:TTRL 跑到 ~500 步就崩(accuracy 掉到 50% 以下、completion 长度从 250 缩到 80),Co-RL 持续涨到 1000 步都没掉。VLM 的训练曲线比 LLM 更脆弱。

图说:(a) Eval accuracy:Co-RL(蓝实线)一路涨到 ~70%,TTRL(橙虚线)500 步后掉到 50%。(c) pseudo-label accuracy(蓝实线 ~0.4)和 inter-agent agreement(紫虚线 ~0.6)一直有 gap,验证 agents 没坍缩到一致。
算力对照实验:matched-budget 下 Co-RL 仍赢
2 个 agent 一起训练,rollout 算力天然是单 agent 的 2 倍。论文做了一个非常重要的对照(Table 10、Table 11):用同样的两个 base 模型,分别做 Co-RL 和"两个模型各自独立跑 TTRL",推理时都做 maj@8 ensembling。
| Setting | GSM8K | MATH-500 | AMC | Avg |
|---|---|---|---|---|
| TTRL (Qwen2.5-3B 单独) | 88.2 | 68.8 | 39.8 | 65.6 |
| TTRL (Llama-3.2-3B 单独) | 65.7 | 56.0 | 27.7 | 49.8 |
| TTRL (两模型 ensemble) | 88.2 | 68.0 | 38.6 | 64.9 |
| Co-RL (Qwen2.5-3B) | 87.4 | 72.8 | 37.4 | 65.9 |
| Co-RL (Llama-3.2-3B) | 87.3 | 58.8 | 33.7 | 59.9 |
| Co-RL(ensemble) | 90.1 | 70.8 | 39.8 | 66.9 |
纯单 agent 上 Co-RL 训练出来的 Qwen 比 TTRL 训练的 Qwen 还好(65.9 vs 65.6)。ensemble 之后 Co-RL 拉到 66.9,TTRL ensemble 是 64.9。差距 2.0 个点——比 TTRL 单模型的微弱领先(+0.3)大得多。这说明:两个 TTRL 模型 ensemble 的提升来自推理端 pooling,而 Co-RL 的提升来自训练端 cross-agent supervision。
多模态那边(Table 11)的对照更直白:Qwen2.5-VL × InternVL3.5 在 open-r1 数据集上,Co-RL ensemble 平均 50.88,TTRL ensemble 48.80,单独最强的 TTRL(InternVL3.5)49.53。Co-RL ensemble 比"两个 TTRL 强模型"还高 1.4 个点。
这个对照实验是 paper 里最让我放心的部分——它把"我赢是因为算力翻倍"这种廉价解释直接堵死了。
几种方法的核心对比
把方法归到一张表里:
| 方法 | Reward 来源 | 需要 judge? | 需要 ground truth? | 反馈环风险 | 多样性来源 |
|---|---|---|---|---|---|
| TTRL | 自己的多数票 | 否 | 否 | 高(自确认) | 无 |
| Intuitor | 自己的 token 分布与均匀分布的 KL | 否 | 否 | 高 | 无 |
| RENT | 自己的 token 熵 | 否 | 否 | 高 | 无 |
| Co-rewarding-II | 自己 paraphrase / EMA 模型 | 否 | 否 | 中(同模型派生) | 弱 |
| CoMAS | LLM 判官评分 | 是 | 否 | 低 | 中 |
| MAPoRL | learned reward model | 否 | 是 | 低 | 中 |
| GT-Reward | ground-truth label | 否 | 是 | 无(oracle) | 无 |
| Co-RL | 同伴多数票 | 否 | 否 | 低 | 强(异家族 + 异尺寸 + prompt 改写) |
这张表把 Co-RL 的相对位置说清楚了——它是"零标签 + 零 judge" 赛道里把反馈环风险压到最低的那一个。
我的判断:硬核的工程论文,但有几个值得警觉的地方
亮点:
- 想法干净。把 1998 年 Blum & Mitchell 的 co-training 思想拉进 LLM 后训练,关键变量(独立性)控制得很清晰。
- 理论干净。Theorem 1 把"为什么两个弱分类器能互相教会"这件事写成了一句 \(p_A + p_B > 1\)。
- 实验充分。matched-budget 对照消除了"算力"的廉价解释;多模态扩展证明方法不挑架构;3B / 7B / 12B 三档规模都跑。
- 公开代码和 checkpoints。Co-RL 这类方法最怕"我做了一组特别好的配对",公开复现能让社区验证 diversity 选择的影响。
需要打问号的地方:
- 多样性靠手工选。Qwen × Llama 这个组合刚好互补,是论文 Appendix A 量化的,但具体哪个家族跟哪个家族配最优,没有系统研究。Gemma × Qwen、Gemma × InternVL 的组合怎么样?论文没覆盖。
- 理论简化太狠。忽略 KL、忽略 clip、\(K\) 取奇数。实操 GRPO 里 KL 项是稳定器,clip 是 advantage 的边界。Theorem 1 给的是"在简化动力学下成立",工程上的边界条件不严格。
- 训练成本是真的翻倍。Co-RL 的 matched-budget 比 TTRL 多 2.0 个点,但 rollout×2 的算力在小模型上还能承受,10B+ 模型上就要谨慎了。论文没给 scaling law。
- pseudo-label 仍然依赖初始模型的群体智能。如果两个 base 模型都很弱(比如 1B 以下),majority vote 本身就乱,Co-RL 的纠错也纠不动。论文在 Qwen3-1.7B 上验证了,但仍是个边界条件。
- 改进幅度受制于 pseudo-label 噪声。Co-RL 在 Llama-3.2-3B 上比 TTRL 只高 0.8 个点(43.9 vs 43.1),在 Qwen2.5-3B 上高 2.0 个点(49.3 vs 47.3)。Llama base 比 Qwen 弱 2 个点,Co-RL 涨幅也小。base 越弱,互补性越难体现。
工程启发:什么时候该把 Co-RL 装进自己的 pipeline?
说几个具体场景:
- 你已经在用 TTRL/Intuitor 跑 reasoning RL:试试把两个 family 的 checkpoint 互相投,多数情况下 1–2 个点的提升白拿。Same family(两个不同 seed)就已经有正收益。
- 你的 RL 训练后期 reward std 塌到 0、completion 长度爆炸:大概率是 self-reinforcement 把模型压到一个偏向上去了。Co-RL 是直接对症的方案——加一个不同 family 的同伴,让 reward 信号不要那么"自我中心"。
- 你的任务是 VLM/多模态:天然就有异构视觉编码器可用,Co-RL 的 diversity 比 LLM 还好做。
- 你想零成本试一下:作者开源了 Co-RL 代码(https://github.com/DrStranded/Co-RL),改动最小的工作量是把现有 GRPO 训练脚本里 reward 计算那一行替换成"同伴多数票",跑两套独立参数。
一个不一定要马上照搬的事:N=3 的有向环。Table 3 的三 agent 设置理论更漂亮,但实际训练成本再翻 1.5 倍,性价比未必比两 agent 好。先从两 agent 起步更稳。
结语
Co-RL 是个让你读完之后想"对,就该这么做"的论文——它没发明新东西,它把一个 28 年前的 idea 在 LLM 时代重新讲了一遍,而这一遍恰好打在了 TTRL 们最薄弱的位置上:self-reinforcing feedback loop。
理论上的 \(p_A + p_B > 1\) 是好记的口诀,工程上的 "挑一个异家族的同伴" 是好上手的操作。两者结合,把无标签 RL 从"碰运气"的探索推进到了"可设计"的工程层面。
下一个值得追问的问题是:能不能让 cohort 自适应? 不是手动挑 family,而是让模型自己学"该让谁投我"。Co-RL 的作者在 Conclusion 里也提到,未来工作会探索"adaptive supervision mechanisms"。这是 LLM 多智能体训练真正有趣的方向。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。
参考链接
- 论文:https://arxiv.org/abs/2608.17253
- HTML:https://arxiv.org/html/2608.17253v2
- 代码:https://github.com/DrStranded/Co-RL
- 相关前置:TTRL(arXiv:2504.16084)、Intuitor(arXiv:2505.10990)、Co-rewarding(arXiv:2505.23802)、CoMAS(Xue et al., 2026)、Blum & Mitchell co-training(COLT 1998)