模型越多越翻车:NVIDIA 实测 23 个模型组队做科学推理,结果多数还不如单模型

核心摘要

多智能体系统(MAS)现在很火——把几个模型拉在一起投票、互辩、路由,似乎总能让答案更靠谱。但有个问题几乎没人认真回答过:池子里的模型到底该怎么选? 这篇来自 NVIDIA 和哥本哈根大学的论文做了一件很朴素但很缺的事:拿 23 个开源模型、8 种选型策略(按参数量、按准确率、按答案多样性、甚至让 GPT-5 帮忙挑),在 HLE、GPQA-Diamond、FrontierScience-Olympiad 三个硬科学推理榜单上系统跑了一遍。结论相当扎心:理论上池子越大上限越高(oracle 性能确实涨),但实际落地时,加模型几乎总是在拖后腿——大多数异构组合连池子里最强的那个单模型都打不过。唯一稳定有收益的姿势,是从同一个模型家族里挑人。我的判断:这不是一篇提出新方法论的论文,而是一篇"泼冷水"的实证研究,但它泼得很有价值——如果你正在搭多模型系统,这篇能帮你省掉很多冤枉钱。


📖 论文信息

  • 标题:Mo' Models, Mo' Problems: How to best select model pools when designing Multi-Agent Systems
  • 作者:Sara Vera Marjanović、Jiacheng Xu、Aleksandr Laptev、Grigor Nalbandyan、Erik Arakelyan、Evelina Bakhaturina
  • 机构:NVIDIA、University of Copenhagen(工作完成于 NVIDIA 实习期间)
  • 日期:2026 年 9 月 15 日
  • 链接:https://arxiv.org/abs/2609.17306
  • 代码:GitHub 仓库 spaidataiga/mo-models

🎯 问题动机:一个被所有人跳过的设计决策

先交代背景。多智能体系统大体分两派(论文 Figure 1 画得很清楚):

图1:Before-generation 与 After-generation 两类 MAS 架构

图1:两类基础 MAS 形态。左边是 before-generation(路由):一个 Router 先判断该把 query 发给哪个模型,只跑一次推理,省钱但需要训练路由器;右边是 after-generation:多个模型各自生成,再用多数投票(Majority vote)或 LLM 裁判(LLM-Judge)把多个答案收敛成一个,免训练但要付出多份推理开销。

这两派的工作这两年出了不少——路由方向有 RouteLLM、AvengersPro 这些,集成方向有 LLM-Blender、Mixture-of-Agents,还有更复杂的 Agent Swarm、Virtual AI Lab 这类级联结构。但所有人的注意力都放在了"架构怎么设计"上,候选模型名单基本是随手拍的:要么按大小凑一档,要么直接把榜单前几名拉进来。

这篇论文的作者问了一个很基础的问题:HuggingFace 上已经有将近 300 万个模型(2026 年 7 月的统计是 2,914,945 个,论文审稿期间又多了 15 万),面对这个近乎无限的模型空间 \(\mathcal{M}=\{m_1, m_2, ..., m_\infty\}\),选候选池 \(C \subset \mathcal{M}\) 时,是不是算力允许就越多越好?按什么信号选才靠谱?

说实话我第一反应是:这问题听着有点"显而易见"——选强的、选多样的,不就完了?但往下看你会发现,这两个直觉在实验里都被打了脸。


🧪 实验设置:23 个模型 × 8 种选法 × 3 种架构

作者搭了一个相当规整的实验台:

候选模型池:23 个模型,2024 到 2026 年间发布,横跨 6 个架构家族(Llama、Qwen3、Qwen3.5、gemma、OLMo3、gpt-oss,外加 Deepseek-v4-Pro、MiniMax-M2、Intern-S1 等),参数量从 2B 到 1.6T,稠密和 MoE 都有,还专门纳入了 4 个科学领域微调模型(cosmosage-v3.1、Chem-R-8B、ChemDFM-R-14B、Intern-S1)。每道题每个模型采 5 次生成。

评测基准:HLE(Humanity's Last Exam)、GPQA-Diamond、FrontierScience-Olympiad——都是当前最难的科学推理榜单。开放题用 gpt-oss-120b 当裁判判分,和人类标注的一致率 93%(Cohen's kappa 0.63)。

8 种选型策略,分两类:

类型 策略 排序依据
免评估信号 Size 总参数量(每家族取一个)
免评估信号 Family 同架构家族打包
免评估信号 LLM Chosen 让 GPT-5(Deep Research 模式)读模型描述后挑 top-k
评估后信号 Accuracy 校准集上的 pass@1
评估后信号 IoU 正确答案多样性(Jaccard 距离)
评估后信号 Error 错误多样性(选择题上的错误模式距离)
评估后信号 Acc × IoU / Acc × Err 准确率和多样性各占 50% 权重联合优化

池子大小 \(k \in \{3, 5, 10, 15, 20\}\),另有 5 组随机采样做基线。校准/训练集是 1.55 万道题(AOPS 加几个闭源 STEM 数据集),作者验证了校准集和测试集上模型相对排序的相关性超过 0.9,所以选型信号是可信的。

三种 MAS 架构:路由(仿 AvengersPro 的聚类路由器)、多数投票(E5-Large-V2 嵌入 + 层次聚类,余弦距离阈值 0.15)、LLM 裁判(GenSelect 方案,gpt-oss-120b 锦标赛式逐轮筛选)。

这套矩阵跑下来,产出的不是一个"新方法",而是一份相当扎实的"选型避坑指南"。


🔬 发现一:模型行为根本没法"看卡片猜"

在看 MAS 结果之前,论文先回答了一个前置问题:能不能不跑评测,光看模型卡信息(参数量、发布日期、家族、领域专长)就预测模型在池子里的表现?

答案是:不太行。

图2:23 个模型的正确答案相似度(左)与错误相似度(右)

图2:模型按训练集准确率降序排列(名字颜色区分架构家族),左图是"正确答案相似度",右图是"错误相似度"。左图大片暖色说明强模型答对的题高度重合(Mantel 检验 \(r_M=0.931\)),右图则蓝红交错——错误模式的相关性弱得多(\(r_M=0.384\)),且呈现明显的家族块状结构。

几个关键数字:

  • 强模型之间"答对的题"高度重合(\(r_M=0.931, p \lt .01\))。你想想看,这其实是坏消息——正确答案多样性很低,大家会的基本是同一批题。
  • 但"答错的题"只有弱相关(\(r_M=0.384\))。按错误模式聚类能看出家族结构:Deepseek-v4 和 Qwen3.5 犯的错误很像,而 gemma、gpt-oss、OLMo3、Qwen3、MiniMax 各有各的错法。
  • 参数量和准确率只有中等相关(\(r_s=0.583\))——大模型总体更强,但远没有强到"按大小选人"就稳了的程度。

更打脸的是"领域专家模型"这块。作者比较了 Llama-3.1-8B 和它的两个领域微调版(物理方向的 cosmosage-v3.1、化学方向的 Chem-R-8B):

图3:通用模型 vs 领域专家模型的分领域表现

图3:粉色是普通 Llama-3.1-8B,青色是物理专家 cosmosage-v3.1,黄色是化学专家 Chem-R-8B。在化学、物理这两个"专家主场"上,通用 Llama 答对的题数反而全面压过专家模型;专家模型独有的贡献(条纹部分)也平均散布在所有领域,而不是集中在自己的专长上。

看到这个图我愣了一下。一个专门在物理语料上微调过的模型,在物理题上打不过自己的通用版本?说明"训练数据构成 ⇒ 领域专长 ⇒ 正确答案多样性"这条链路根本断裂。你不能指望模型卡里写着"science-specialized"就真能给 MAS 带来互补性——想知道自己池子里的模型到底什么脾性,只能老老实实跑一遍校准集


📊 发现二:Oracle 很美,现实很骨感

先看成"潜力"。Oracle MAS 的意思是:假设系统每次都能幸运地选中池子里答对了的那个模型,这是 MAS 性能的理论天花板。

图4:HLE 上各选型策略的 Oracle 性能

图4:左图是绝对准确率,右图是相对池内最强单模型的增益。随着 \(k\) 增大,oracle 天花板一路走高(\(k{=}20\) 时增益逼近 28-30 个点);按 Accuracy 或 GPT-5 挑选的组合潜力最大,按 Error/IoU 多样性选的最小。虚线是全局最强单模型。

单看这张图,你会得出"人多力量大"的结论:池子越大,天花板越高,最多能比最强单模型高出近 30 个点。

然后看实际落地,画风突变。

图5:HLE 上三种架构的实际 MAS 增益

图5:三种架构下各组合的 实际 增益(相对池内最强单模型)。路由(左)小幅下滑,多数投票(中)全线暴跌、最差跌到 -25 个点附近,LLM 裁判(右)也普遍 -5 到 -14。只有家族组合(黄色星标,尤其 Gemma)在零线以上。

几组值得记住的数字:

  • 多数投票崩得最狠\(k{=}5\) 的 IoU 多样性组合直接掉 24 个点 左右,\(k\) 越大坑越深。直觉上也好理解:候选答案越发散,投票越投不出共识,正确答案反而被噪音淹没。
  • LLM 裁判也救不了场。虽然同质系统里裁判确实能把单模型从 29.4%(pass@1)抬到 36.5%(judge@5),但异构组合下几乎所有"精心挑选"的子集都跑不过随机基线。
  • 路由是相对最稳的形态,但只有 IoU 多样性和 Family 两种选法在路由上拿到了正向收益——这和经典 MoE 的理论倒是吻合(专家之间需要正确答案互补),只是收益幅度小得可怜。
  • 唯一在 HLE 上稳定跑赢最强单模型的,是同家族组合(Gemma 家族表现最好,OLMo3 和 Qwen3 则忽好忽坏)。在 FS 和 GPQA 上,Accuracy 类组合偶尔有小额正收益(FS 涨约 2 个点,GPQA 不到 1 个点)。

一句话总结:oracle 告诉你"池子里藏着 30 个点的宝藏",实际架构告诉你"你一伸手就把宝藏弄丢了"。这个落差就是整篇论文最核心的信息。


🤔 我的判断

这篇论文最值钱的地方,是它把"模型选型"从 MAS 设计里的隐性假设变成了显性的研究变量,并且给出了一个反直觉但可信的实证结论:经典集成学习里"多样性至上"的信条,在现成 LLM 拼盘里不成立。经典 ensemble 的多样性是训出来的(bagging、负相关学习),成员模型为互补而生;而 MAS 的模型是捡来的,多样性没被训练目标约束过,高答案多样性在投票和裁判架构下就是纯粹的噪音放大器。

几个值得追问的点

  1. 作者自己也承认,架构选得偏简单——路由只用了一种聚类方案,裁判架构在长上下文下有明显瓶颈(\(k\) 大时要锦标赛式分批裁决)。所以"异构 MAS 不行"这个结论,更准确的表述是"异构 MAS 在现有简单聚合架构下不行"。更强的编排器能不能消化多样性,论文没回答。
  2. 实验全部禁用了工具调用。但很多现代 MAS 的差异化恰恰来自工具能力差异,这个变量被抹平后,异构组合的潜在收益可能被低估了。
  3. 家族组合表现好这个发现,可能有个不太浪漫的解释:同家族模型错误模式相似、输出分布接近,投票时不容易互相污染。这与其说是"互补性红利",不如说是"一致性红利"。这跟"More Agents Is All You Need"那类同质缩放研究其实是一个方向。

对工程的启示倒是很直接:如果你在搭多模型系统,别幻想把榜单前几名凑一桌就能 1+1>2。要么老老实实同家族多实例加 prompt 扰动(同质 MAS 的收益是被反复验证过的),要么就在自己的业务数据上把候选模型逐个评测、按"准确率相近 + 行为互补"精挑细选,并且把选型过程本身当成系统的一部分写进报告。随手扩池子,大概率是花钱买退步。

还有一个更本质的问题这篇没碰:during-generation 的协作式 MAS(模型之间能看到彼此的中间推理)会不会改变这个结论?异构模型在"各说各话"的场景下互相干扰,但在真正的交互中也许能互补。这是我觉得最值得跟进的方向。


📝 总结

回到标题那个玩笑——"Mo' Models, Mo' Problems"。这篇论文用 23 个模型、8 种策略、3 种架构的完整矩阵证明了一件事:在 MAS 里,加模型不是免费午餐,甚至不是午餐,是账单。理论上限随池子变大而涨,实际性能随池子变大而跌,两头一夹,留给工程的空间只剩"同家族组合"和"精打细算的小池子"。它不是那种让人兴奋的论文,但它是那种能阻止你犯错的论文——有时候后者更有用。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我