R³-Bench:六道题共享一份预算,LLM 的单题实力兑不了现

打过 ICPC 或者 IOI 的人都知道一个朴素的道理:单题会做,和比赛能赢,是两码事。比赛里五个小时、十几道题,真正的胜负手往往不是"哪道题会不会",而是"时间怎么分"——死磕一道 Hard 把整场拖垮的选手,每个赛区都有一大把。

现在把同样的处境扔给大模型:六道题摆在面前,只有一份共享的 token 预算(或者一份共享的工具调用次数),花在第一题上的每一分钱,都是从后面五道题嘴里抢的。模型会怎么花?HKUST(GZ) 团队这篇 R³-Bench(arXiv:2608.16033)给出的答案相当难看:模型在单题评测里明明做对的题,到了共享预算的"套题"场景里就是做不出来——而且这不是能力问题,是分配问题。

核心摘要:这篇论文把认知科学里的"资源理性"(resource rationality)概念搬进了 LLM 评测,构造了数学、竞赛编程、抽象推理三个领域的六题套题 benchmark,每套题共享一份预算,分 tool-free(限输出 token)和 agentic(限工具动作数)两种玩法。它最巧妙的设计是用同一模型的单题"响应曲线"构造一个离线 oracle——相当于问"把同样的总预算换个分法,模型已经证明过自己能做到多少"。结果:72 个主表单元格里,oracle 在所有单元格追平或超过实战成绩,其中 71 个严格更高;预算压力中等时,连"六题均分预算"这种最笨的策略都能在六个模型里的四个身上跑赢模型自己的分配。这不是一篇刷榜论文,是一篇"揭短"论文,揭的是当下所有 per-task 评测共同遮住的那个盲区,值得做 agent 和评测的人都看一眼。


论文信息

  • 标题:R³-Bench: LLMs Struggle with Resource-Rational Reasoning under Shared Budgets
  • 作者:Peisong Wang、Zhiwei Ma(共同一作)、Bowen Liu、Feixue Liu、Aochuan Chen、Chenyi Zi、Hongchuan Zeng、Yuhan Li、Jia Li
  • 机构:香港科技大学(广州)、香港大学、Tencent Hunyuan Team
  • 时间:2026 年 8 月 17 日(v1)
  • 链接:https://arxiv.org/abs/2608.16033 | 代码:https://github.com/NineAbyss/R-3-Bench | 数据:https://huggingface.co/datasets/R-3-Bench/R-3-Bench

🎯 为什么需要这篇论文

现在主流评测的逻辑都是"一题一预算":数学榜单一道一道刷,agent 榜单一个任务一个任务地跑,每个任务独享自己的 token 上限和步数上限。这种设定下,"跨任务的资源分配"这个问题根本不会浮现——模型在每一题上都可以把预算花到见底,不用考虑机会成本。

但真实使用场景早就不是这样了。论文里引了两个数字挺扎眼:超过 10% 的 Codex 用户一周内同时挂着至少三个并发 agent;对约 40 万个 Claude Code 会话的分析显示,编程 agent 的工作流天然是构建、调试、测试、运维混在一起的。多个任务共享有限的 API 配额和推理容量,算力花给谁、花多少、什么时候止损换题,本身就是推理问题的一部分。

之前也有沾边的工作,但都没打中要害。TALE、SelfBudgeter、BATS 这类 budget-aware 方法研究的是"单题内部"怎么省着花;ZEBRA 这类编排方法是在模型之间、流水线阶段之间分资源;最接近的 USACOArena 和 CLEAR 虽然引入了共享预算或跨查询分配,但都没有把套题成绩拿去和"同一个模型在单题上已经证明过的能力"做校准。缺了这把尺子,你就分不清模型在套题里丢的分,到底是"不会做"还是"没分好"。

R³-Bench 的整个设计就是围绕这把尺子展开的。

🏗️ R³-Bench 是怎么搭的

一句话讲清核心思路:把 ICPC 的时间分配结构,平移到推理算力分配上。六题一场、预算共享、难度混合,然后用同一模型的单题表现算出"这笔钱本来可以怎么花"。

图2:R³-Bench 框架总览

图2:R³-Bench 的四步流程。① 基准构建:三个领域各取 300 题冻结成池,按三个参考模型的平均输出长度划分难度(Easy 150 / Medium 100 / Hard 50),每场套题固定 3 Easy + 2 Medium + 1 Hard,每领域 50 场;② 评测协议:tool-free 设定预算单位是输出 token,agentic 设定是计数的工具动作,两种设定共用同一批题、同一套判分;③ 分析指标:单题响应曲线经多重选择背包求解出 oracle,对比实战 contest 成绩得到差距;④ 行为诊断:从轨迹里识别过度投入、覆盖不足、过早放弃、收尾失败、后期预算耗尽等分配失误模式——论文强调这些是"可回收的分配损失,不是能力上限"。

几个关键设计细节值得展开:

难度不用准确率标定,用输出长度标定。 这个选择我觉得挺聪明。在资源理性的语境下,"难"说到底就是"吃资源"——一道题更难,操作性定义就是不限预算时参考模型自然会在它身上写更长的推理。作者用 DeepSeek-V4-Pro、GLM-5.2、GPT-5.5 三个模型的独立输出长度取平均来分层,避免依赖单一模型。这些难度标签只用于组卷和分析,prompt 里不出现。

预算按模型自己校准,压力才是公平的。 不同模型的"原生饭量"差异巨大,有的思考链又长又啰嗦。给所有模型同一个绝对预算,测出来的就是"谁的表达习惯更省"而不是"谁会分配"。所以作者先跑一轮不限预算的基线,记录模型 \(m\) 在领域 \(d\) 的平均消耗 \(R_{m,d}^{\infty}\),再按比例压缩:

\[R_{m,d}^{\rho} = \rho \cdot R_{m,d}^{\infty}, \quad \rho \in \{0.2, 0.8\}\]

\(\rho=0.2\) 是强压力(只给两成口粮),\(\rho=0.8\) 是中等压力。tool-free 设定下预算直接作为 API 的 max_tokens 传入并在 prompt 里明示;agentic 设定跑在 Terminus-2/Harbor 环境里,预算按"计数的工具动作"扣,文件读写这类例行操作免费,还提供 focus_problem / shelve_problem 两个记账命令做逐题归因。

oracle 是一个离线背包,不是一个可执行策略。 每道题先在多个预算档位上独立各跑 5 次,得到一条经验响应曲线(每个档位的成功率)。oracle 做的事是:给每道题分配一个档位(可以是 0),在总预算约束下最大化期望答对数——一个多重选择背包问题。因为它能看到所有题的完整响应曲线,它是"经验上的最优分配参考",而不是一个能在线跑的策略。这个定位作者自己讲得很清楚,避免了把 oracle 分数当成"可达上界"来误读。核心指标就是差距本身:

\[\Delta_{\mathrm{RR}} = \mathrm{Oracle} - \mathrm{Contest}, \qquad \mathrm{GapRatio} = \frac{\Delta_{\mathrm{RR}}}{\mathrm{Oracle}}\]

Gap Ratio 越低,说明模型把单题能力兑现得越充分。

📊 主实验:72 个单元格,71 个有亏空

评测了八个前沿模型,主表放六个旗舰:DeepSeek-V4-Pro、Qwen3.7-Max、GLM-5.2、Hy-3、GPT-5.5、Claude-Opus-4.8。两个设定 × 三个领域 × 两档压力,共 72 个单元格。

最硬的结论一行就能说完:oracle 在全部 72 个单元格里追平或超过实战,其中 71 个严格更高。唯一打平的那格是 Claude-Opus-4.8 在 agentic 数学、强压力下的 4.46/4.46(Gap Ratio 0.00%)——说实话这个 0.00 出现在整张表里反而显得突兀。

完整主表如下(数字为每套六题的平均答对数,C=Contest 实战,O=Oracle,Gap=Gap Ratio):

Tool-free 设定

模型 \(\rho\) Math (C/O/Gap) Code (C/O/Gap) AR (C/O/Gap)
DeepSeek-V4-Pro 0.2 2.34 / 3.94 / 40.6% 1.38 / 3.12 / 55.8% 2.24 / 4.02 / 44.3%
DeepSeek-V4-Pro 0.8 3.94 / 5.08 / 22.4% 3.06 / 4.62 / 33.8% 2.90 / 4.64 / 37.5%
Qwen3.7-Max 0.2 3.54 / 3.70 / 4.3% 1.42 / 2.94 / 51.7% 2.76 / 4.06 / 32.0%
Qwen3.7-Max 0.8 4.32 / 5.06 / 14.6% 3.44 / 5.24 / 34.4% 3.82 / 4.70 / 18.7%
GLM-5.2 0.2 2.32 / 3.08 / 24.7% 0.68 / 1.88 / 63.8% 1.14 / 3.51 / 67.5%
GLM-5.2 0.8 2.72 / 3.72 / 26.9% 1.72 / 2.08 / 17.3% 1.70 / 4.19 / 59.4%
Hy-3 0.2 2.40 / 3.36 / 28.6% 1.20 / 2.28 / 47.4% 1.56 / 3.11 / 49.8%
Hy-3 0.8 3.72 / 4.68 / 20.5% 2.96 / 3.88 / 23.7% 3.16 / 4.16 / 24.0%
GPT-5.5 0.2 0.72 / 1.28 / 43.8% 0.68 / 1.28 / 46.9% 0.34 / 1.94 / 82.5%
GPT-5.5 0.8 2.52 / 2.80 / 10.0% 2.60 / 3.12 / 16.7% 1.58 / 2.75 / 42.6%
Claude-Opus-4.8 0.2 3.78 / 4.30 / 12.1% 0.60 / 1.88 / 68.1% 1.84 / 3.11 / 40.8%
Claude-Opus-4.8 0.8 4.18 / 4.96 / 15.7% 2.68 / 3.48 / 23.0% 2.52 / 4.15 / 39.2%

Agentic 设定

模型 \(\rho\) Math (C/O/Gap) Code (C/O/Gap) AR (C/O/Gap)
DeepSeek-V4-Pro 0.2 4.48 / 5.28 / 15.2% 2.60 / 4.90 / 46.9% 4.36 / 5.06 / 13.8%
DeepSeek-V4-Pro 0.8 4.48 / 5.40 / 17.0% 4.10 / 5.53 / 25.9% 4.12 / 5.14 / 19.8%
Qwen3.7-Max 0.2 4.64 / 5.14 / 9.7% 2.78 / 2.96 / 6.1% 4.62 / 4.96 / 6.9%
Qwen3.7-Max 0.8 4.96 / 5.34 / 7.1% 4.72 / 5.46 / 13.6% 4.80 / 5.14 / 6.6%
GLM-5.2 0.2 4.48 / 4.58 / 2.2% 2.02 / 3.90 / 48.2% 3.78 / 4.52 / 16.4%
GLM-5.2 0.8 4.16 / 5.12 / 18.8% 4.06 / 5.06 / 19.8% 4.06 / 5.04 / 19.4%
Hy-3 0.2 1.80 / 3.38 / 46.8% 1.00 / 3.00 / 66.7% 1.22 / 3.14 / 61.2%
Hy-3 0.8 1.56 / 4.16 / 62.5% 1.38 / 3.56 / 61.2% 0.80 / 4.32 / 81.5%
GPT-5.5 0.2 3.64 / 4.96 / 26.6% 1.92 / 2.00 / 4.0% 1.80 / 4.92 / 63.4%
GPT-5.5 0.8 4.40 / 5.32 / 17.3% 4.80 / 5.53 / 13.3% 4.72 / 5.24 / 9.9%
Claude-Opus-4.8 0.2 4.46 / 4.46 / 0.0% 2.24 / 3.56 / 37.1% 3.77 / 3.88 / 2.8%
Claude-Opus-4.8 0.8 4.85 / 5.02 / 3.4% 4.52 / 5.08 / 11.0% 5.12 / 5.34 / 4.1%

从这堆里能读出几个有意思的东西。

tool-free 设定下,oracle 平均比实战多对 1.16 题(12 个模型-压力组合的平均),相当于每场六题白丢一道多。更有羞辱性的是均分策略:\(\rho=0.8\) 时,"每题给六分之一预算"这种完全不动脑的分法,在 DeepSeek-V4-Pro、Qwen3.7-Max、GLM-5.2、Claude-Opus-4.8 四个模型身上都跑赢了模型自己的分配。你想想看——模型自己看着余额做题,做得还不如一个死板的固定切分。

当然均分策略在强压力下会崩。GPT-5.5 在 \(\rho=0.2\) 时,均分后每题对应的复现阈值只有 38、47、6 个输出 token——6 个 token 连一句完整的话都写不完,这个设定下 equal-allocation 分数自然接近零。作者自己也承认这是固定均分的局限。

两个结构性发现也值得记住:agentic 设定的 Gap Ratio 在 36 组配对比较里有 27 组低于 tool-free(有反馈、能中途调整确实有帮助);把 \(\rho\) 从 0.2 放宽到 0.8,23 组里差距缩小——但两者都没有均匀消除差距。加预算、给工具,都不是解药。

🔬 诊断:钱到底花错在哪了

图1:六个旗舰模型的"问题覆盖率 × 资源理性策略更新率"四象限图

图1:横轴是问题覆盖率(有多少题位得到了实质性的作答尝试),纵轴是资源理性的策略更新率(观察到新证据后、结合剩余预算做出的策略调整比例),虚线是 50% 参考线。DS-Pro 落在右上"Portfolio Planner"区域(覆盖约 75%、更新率约 58%);Qwen 覆盖最广但更新率不到一半;GLM、Opus 居中;Hy 偏下;GPT 几乎贴着横轴落在左下"Tunnel Solver"一侧——五个模型覆盖过半,却只有 DS-Pro 一个更新率过 50% 线。覆盖广不等于会分配。

位置梯度暴露了"按顺序花钱"的机制。 tool-free 设定下,从第 1 题到第 6 题,准确率在全部 12 个模型-压力序列上单调下降;轨迹层面同样,越靠后的题"被作答率"越低、"预算截断率"越高。由于题目顺序是随机打乱、与难度无关的,这个梯度只能指向一种解释:模型的花费跟着题目的出场顺序走,而不是跟着题目的价值走。强压力下,第一题独吞归因输出量的 20.5%–52.9%(中等压力只有 16.9%–23.5%)——先发优势被进一步放大。

agentic 设定里,策略更新少得可怜。 DS-Pro、Qwen、GLM、Opus 只在 38.5%–63.4% 的轨迹里做过实质性策略更新,Hy-3 和 GPT-5.5 一次都没有。大量轨迹是"看到了工具反馈,然后继续按原计划走"。

失败模式随压力换挡,这是全文最有意思的诊断。 作者只看"oracle 选中、实战却丢了"的题——这些题模型在单题里都做对过,丢了就是纯粹的分配损失。强压力下,最大的一类失败是"预算花到别的题上了"(GLM 42%、Hy 95%、GPT 66%、Opus 59%);中等压力下,最大的一类变成了"做出部分进展后停手"(DS-Pro 67%、GLM 38%、Hy 38%、GPT 55%)——题开了头、方向也对,但没写到底就放弃了。压力紧的时候错在"分给谁",压力松的时候错在"给多少"。这个从 which 到 how much 的切换,我觉得是整篇论文里认知科学味道最浓、也最有工程指导价值的一个发现。

还有两个排他性证据。其一,差距不是长上下文撑爆导致的:target-in-suite 压力测试(六题都展示但只要求解一题)里,12 个单元格有 9 个损失不超过 5 个百分点,平均才 1.1 个点。其二,差距不能用通用能力解释:和 Epoch 五十多个榜单合成的 ECI 指数对比,ECI 相差 3 分以内的模型对,平均 Gap Ratio 差异 9.6–21.0 个百分点;相差 4 分以上的模型对,差异 12.0–19.2 个点——距离远近完全不带信息量,Spearman 相关 -0.29(\(p=0.37\))。tool-free 数学强压力那格最讽刺:ECI 最高的模型 Gap Ratio 反而最大(43.75%),一个中游模型做到最小(4.32%)。

🔧 能救回来吗:外部调度器的三点实验

既然模型自己不会分,外挂一个轻量调度策略行不行?作者拿 DS-Pro、GLM-5.2、Hy-3 三个代表性模型在 agentic 强压力下试了两条规则:策略 A 强制初始覆盖(在对某题花第二个计费动作之前,必须先探测所有可见题目);策略 B 在 A 之上加一个验证门(候选答案稳定后,限制重复付费检查)。

结果(每套六题平均答对数,粗体为该行最优非 oracle 成绩):

模型 领域 Contest A B Oracle
DeepSeek-V4-Pro Math 4.48 4.56 4.90 5.28
DeepSeek-V4-Pro Code 2.60 4.10 3.86 4.90
DeepSeek-V4-Pro AR 4.36 4.32 4.72 5.06
GLM-5.2 Math 4.48 4.04 4.20 4.58
GLM-5.2 Code 2.02 2.92 2.66 3.90
GLM-5.2 AR 3.78 4.10 4.44 4.52
Hy-3 Math 1.80 1.64 1.58 3.38
Hy-3 Code 1.00 1.56 1.36 3.00
Hy-3 AR 1.22 0.48 0.70 3.14

九个单元格里,至少一种干预在六格里跑赢原始 contest——但没有任何策略通吃,Contest、A、B 各自拿下三行的最优。唯一的规律是按领域而不是按模型分:Code 在两种干预下对三个模型全部提升,Math 和 AR 则因模型而异、有时越调越差。作者的解释我认同:Code 的编译和测试信号在运行时是"硬反馈",先覆盖一遍能真实暴露哪题值得加码;而数学和抽象推理的浅探测给的是弱信号,探测本身就在白白烧预算。另外 B 在每一行 Code 上都输给 A、在每一行 AR 上都赢——规则更复杂不等于分配更好,调度有帮助的前提是"运行时反馈能追踪到追加计算的价值"。

Hy-3 则标出了外部调度的极限:三领域里它的最优非 oracle 成绩都离 oracle 老远。静态指令能重定向算力,但替代不了模型自己解读进展、修正计划的能力。

🤔 我的判断

先说值钱的地方。这篇论文最大的贡献不是又一个榜单,而是把"分配质量"从"解题能力"里干净地剥离了出来——同模型的单题响应曲线当尺子,oracle 是离线的、replay 是傻瓜式的,两套参照系都绕开了"是不是题太难"的争吵。72/71 的全覆盖证据、失败模式随压力换挡的诊断、ECI 判别效度检验,这三板斧下来,"共享预算下能力兑现有亏空"这个结论立得相当稳。对做 agent 产品的人来说,位置梯度那个发现尤其值得警惕:你的 agent 大概率正在按任务到达的顺序花钱,而不是按任务的价值花钱。

再说几个让我皱眉的地方。

第一,oracle 的口径要小心传播。它是"事后诸葛亮"式的多重选择背包,看得见每条响应曲线,不是可执行策略的上界。论文自己反复强调这一点,但我已经能想象后续工作把 Gap Ratio 当刷榜指标的场景了——那会是彻头彻尾的误用。

第二,难度用输出长度标定,操作性上自洽,但多少有点循环:一道"想得久但想得对"的题和一道"死活做不出所以一直写"的题,在这个标定下是不可区分的。资源需求和被卡住,都被计成了"难"。

第三,论文内部有个数字打架的小瑕疵:摘要页和 4.2 节写的是均分策略在"六个模型里的四个"跑赢实战(4.2 节明确列出了四个模型),而 HTML 版的摘要和引言写的却是"三个"。v1 的笔误,以 4.2 节的四个为准,但这种地方恰恰说明结论对"怎么数"是敏感的。

第四,调度器实验只有三个模型、一种压力,9 个单元格的样本量撑不起"策略 A/B 谁更好"的结论——好在作者也没这么声称,只用它论证"固定指令跨领域不可迁移",这个克制是对的。

工程上的启发我倒觉得比论文本身的方法更直接:如果你在跑多任务并发的 agent 系统,显式的任务级预算记账 + 强制初始覆盖 + 硬反馈领域的优先加码,是花小钱就能上的三件事;而要真正补上这个缺口,靠 prompt 里写规则不够,得像作者结尾指的那样,把"何时继续、何时切换、何时止损"训练成模型内生的策略。这块目前还是一片空白,谁先把 allocation policy 训进推理模型里,谁就能在并发 agent 的成本账上领先一个身位。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我