深度研究烧掉37万token写一份报告?Adobe这篇论文说:七成都是浪费
你有没有算过一笔账:让 Deep Research 类的智能体帮你写一份调研报告,背后到底烧了多少 token?
这篇论文给了一个挺扎心的数字——GPT-Researcher 跑一次完整流程,平均要探索 29 个检索节点、消耗 37.5 万 token、花掉 3422 秒,接近一个小时。更要命的是,作者发现 pipeline 内置的"写报告前裁一刀"机制,会把积累的 66 份证据砍掉三分之一。也就是说,大量检索来的内容,是在成本全部付完之后才被扔掉的。
钱花了,东西扔了。这生意做得有点亏。
核心摘要:这篇来自 Adobe Research、UMass Amherst 和 UT Austin 的论文,把"边际价值估计"引入深度研究智能体的上下文管理,系统对比了在三个不同位置(检索前、检索后、合成前)做剪枝的效果。结论反直觉但很实用:剪枝放在哪,比用什么打分规则重要得多。检索后用 1998 年的老算法 MMR 剪一刀,token 直降 69.5%,质量只掉 1.2 个点;三阶段全上 MMR 能省 73.3% 的 token。而花大价钱用 LLM 当裁判做剪枝,质量最好但效率优势被自己的推理开销吃掉大半。这不是一篇提出新方法的论文,而是一篇把工程问题研究透的实证论文——对真要上线 Deep Research 系统的人来说,可能比十个新架构都有用。
📖 论文信息
- 标题:Not Worth Another Token: Marginal Value Estimation for Efficient Deep Research Agents
- 作者:Harshitha Kolukuluru, Reshma Ashok, Kirat Arora, Evan William Ciccarelli, Nischal Ashok Kumar, Lunyiu Nie, Franck Dernoncourt, Samyadeep Basu, Ryan A. Rossi, Nedim Lipka
- 机构:UMass Amherst / UT Austin / Adobe Research
- 链接:https://arxiv.org/abs/2608.08389
- 提交日期:2026 年 8 月 9 日
🎯 问题动机:检索越多,浪费越多
Deep Research 系统的工作方式大家都熟:把一个大问题拆成子查询,迭代检索,边检索边扩展新分支,最后把攒下的一大堆上下文丢给 LLM 写报告。
问题在于,这个"攒"的过程是没有节制的。早期检索拿到核心事实,后面越检越重复——边际价值在衰减,但每一步的 token 成本是实打实付出的。已有工作(Lost in the Middle、LLMLingua、RECOMP 这一脉)大多盯着"最终喂给模型的 prompt 太长"这个点做压缩,位置太靠后了。作者的观察很直接:等你要写报告了才裁,前面检索、处理、分支扩展的钱早就花完了,省不回来了。
那早点裁行不行?在哪个位置裁最划算?用什么规则裁?说实话我原本以为这类问题早有人系统做过,但翻完论文发现,之前确实没人把"剪枝位置"当成一等公民来做受控对比——大家都是各剪各的,实验设置五花八门,结论没法横向比。
🏗️ 方法:三个剪枝点位,一个统一框架

图1:深度研究 pipeline 总览。系统分四步走——(1) 规划阶段把用户查询拆成子查询;(2) 检索与分支扩展的迭代循环;(3) 上下文聚合;(4) 最终报告合成。论文研究三个剪枝干预点:Pre-Retrieval(检索前过滤子查询)、Post-Retrieval(检索后、分支扩展前过滤证据)、Pre-Synthesis(写报告前压缩最终上下文)。
形式上,作者把问题写成:在成本预算 \(B\) 约束下最大化报告质量,\(\max_{C_T} \mathcal{R}(C_T, Q) - \eta\, \mathrm{Cost}(C_T)\)。全局最优不可解,于是拆成三个点位的局部决策:每个候选 \(x\)(子查询或证据条目)算一个边际价值分 \(\mathcal{V}(x \mid C_t, Q)\),超过阈值就留,不够就扔。
打分规则方面,论文把能想到的主流路子全摆上了桌:
- MMR(最大边际相关性):相关性减去与已留内容的最大相似度,\(\lambda\) 控制"相关 vs 新颖"的权衡——1998 年信息检索的老算法;
- GRN(几何残差新颖度):候选嵌入减去它在已留上下文张成子空间上的投影,残差越大越"新";
- CD(质心漂移):加入候选后语义中心移动多少;
- DPP(行列式点过程):用核矩阵行列式增益同时奖励相关性和多样性;
- SC(子模覆盖):候选对整个候选池语义空间的覆盖增益,再除以 token 成本;
- Combined / Hybrid:相关性、新颖度、覆盖度的组合打分;
- LLM 裁判:直接让语言模型判断"这条证据留不留";
- 学习型控制器:在执行轨迹上训练一个轻量模型做检索前的子查询过滤,定位是探索性的。
配置分三档:一阶段(只在 Post-Retrieval 或只在 Pre-Synthesis 剪)、两阶段(Post-Retrieval + Pre-Synthesis)、三阶段(三个点全剪)。
实验底座是 GPT-Researcher,评测用 DeepResearchGym(基于 Researchy Questions 数据集,采样 100 个查询)。指标四个维度:rubric LLM 裁判打的质量分、关键点召回 KPR+KPC、引用召回率(忠实度)、以及节点数/token/耗时三个效率指标。所有变体跑在同一个 pipeline 上,复用缓存的检索结果——差异只来自剪枝决策本身。这个实验控制做得挺干净。
🧪 实验:位置决定一切
一阶段对比:早剪省钱,晚剪提质,你只能选一个。
| 方法(一阶段) | 节点数 | Token(千) | 耗时(秒) | 质量 | KPR+KPC | 引用召回 |
|---|---|---|---|---|---|---|
| Baseline(不剪) | 29.0 | 375.4 | 3422.6 | 57.83 | 70.23 | 95.54 |
| Post-Retrieval MMR | 8.84 | 114.6 | 1379.8 | 56.62 | 63.49 | 91.70 |
| Post-Retrieval DPP | 9.88 | 129.6 | 1520.6 | 54.51 | 43.33 | 95.62 |
| Pre-Synthesis Hybrid | 29.0 | 332.3 | 3834.1 | 60.68 | 65.62 | 95.07 |
| Pre-Synthesis LLM | 29.0 | 386.7 | 4512.0 | 57.17 | 44.47 | 92.43 |
看这张表我愣了一下的是 Pre-Synthesis 那几行:耗时居然比 baseline 还长(4400 秒上下),token 也没怎么省——因为检索和分支扩展的成本一分没少花,剪枝只动了最后的合成 prompt。Pre-Synthesis Hybrid 质量冲到 60.68,比 baseline 高 2.85 个点,说明晚剪的价值在"精炼",不在"省钱"。
而 Post-Retrieval MMR 是另一个极端:token 从 37.5 万砍到 11.5 万,省了 69.5%;节点从 29 缩到 8.84;耗时降 59.7%;质量保住 baseline 的 97.9%。原理不难想——低价值的分支在扩展前就被掐死,后面连带的检索、处理、递归扩展成本全省了。冗余分支是有"子孙"的,早杀一刀,杀的是一整棵子树。
还有个细节值得注意:没有任何一阶段剪枝方法在 KPR+KPC 上超过 baseline。压缩可以保住甚至提高报告质量分,但证据的完整保留一定会受损——质量分和证据保留是两条会分岔的曲线。
两阶段:质量效率的最优平衡点。
| 方法(两阶段) | 节点数 | Token(千) | 耗时(秒) | 质量 | KPR+KPC | 引用召回 |
|---|---|---|---|---|---|---|
| MMR | 8.84 | 114.6 | 1381.3 | 56.40 | 65.16 | 92.61 |
| SC | 10.80 | 142.1 | 1776.5 | 57.00 | 62.23 | 94.74 |
| CD + SC | 10.45 | 137.5 | 1599.6 | 59.47 | 44.29 | 89.96 |
| CD + LLM | 10.24 | 136.0 | 1589.3 | 58.65 | 63.40 | 94.34 |
两阶段是全文最亮的结果。CD + SC 组合把质量做到 59.47(比 baseline 高 1.64 个点),同时 token 省 63.4%、耗时省 53.3%——质量反超 baseline 的同时还把成本砍掉六成,这个点是真的香。作者的解释也合理:早期用 CD 做新颖度敏感的粗剪控制搜索规模,后期用 SC 做覆盖度感知的精炼提升报告质量,两个目标互补。
但 CD + SC 的引用召回只有 89.96,比 baseline 和两阶段 SC(94.74)都低。质量分最高的配置,证据忠实度反而偏弱。又一次印证那个分岔。
三阶段:压缩拉满,质量让位。
| 方法(三阶段) | 节点数 | Token(千) | 耗时(秒) | 质量 | KPR+KPC | 引用召回 |
|---|---|---|---|---|---|---|
| MMR | 7.82 | 100.1 | 1157.7 | 55.90 | 63.43 | 91.84 |
| SC | 9.35 | 121.8 | 1438.9 | 55.52 | 65.79 | 92.03 |
| LLM | 10.12 | 143.6 | 1574.7 | 59.53 | 65.09 | 93.12 |
| Learned Query + GRN + GRN | 10.44 | 145.7 | 1744.4 | 58.13 | 51.78 | 95.48 |
三阶段 MMR 把 token 压到 10 万,比 baseline 省 73.3%,这是全文的压缩极限。但质量 55.90,比两阶段 MMR 还低一点——加第三个剪枝点,买到的主要是压缩率,不是质量。
LLM 裁判在三阶段质量最高(59.53),但它的推理开销让 token 和耗时都比 MMR 高出一截。用模型去剪模型的输入,剪刀本身也要烧 token,这笔账在效率敏感场景里算不过来。至于那个学习型控制器,作者自己的评价很克制:可行的探索性验证,但没有稳定超过最好的启发式。坦率讲这个负面结果挺有价值的——手工规则 + 正确的位置,已经拿走了大部分收益。

图2:所有方法的质量–token 散点图。五角星是 baseline(约 375k token);红色方块是只在 Pre-Synthesis 剪(一阶段 root),挤在高成本区;蓝色圆点是只在 Post-Retrieval 剪(一阶段 branch),整体左移到 100–175k;绿色三角是两阶段、橙色加号是三阶段,占据左侧低成本区。左上角那个红点(Hyb,约 330k token、质量 60.7)是唯一质量大幅反超 baseline 的点,但成本几乎没降——"提质"和"省钱"在图上肉眼可见地分成两簇。
🤔 我的判断
这篇论文没有新算法,MMR、DPP、SC 全是十几年前的经典工具。但我觉得它的价值恰恰在这:把一个所有做 Agent 系统的人都会撞上、却一直没人系统回答的工程问题——上下文到底该在哪剪——用受控实验给出了清晰答案。
三个能直接抄走的结论:剪枝位置比打分规则重要;Post-Retrieval 是效率收益最大的单点;两阶段组合(早期控规模 + 晚期做精炼)是质量效率的最优折中。如果你在做 Deep Research 类产品,先在检索后加一道 MMR,大概率是投入产出比最高的一步。
问题也得说。其一,质量评估依赖 LLM 裁判,作者在附录里自己承认换个裁判绝对分会明显漂移,所以质量结论要当"相对比较"看,别太当真。其二,只有 100 个查询、单一 pipeline、单一基准(DeepResearch Bench 的交叉验证只支持效率结论的方向性,质量排名在两个基准间并不稳定)。其三,那个"无单一方法统治所有目标"的结论,换个角度听就是——阈值和配置还是得自己调,论文给的是地图不是导航。
另外提一句批判性视角:摘要里"the first systematic stage-aware comparison"这个"首次"声明我持保留态度。上下文压缩这个领域(LLMLingua、RECOMP、Selective Context)已经卷了好几年,说"首次"更多是指"在 Deep Research 场景下按阶段系统对比"这个具体切口,而不是边际价值剪枝这个想法本身。好在论文正文的态度比摘要克制得多。
💡 收尾
这篇论文对工程实践的指导非常直白:先别折腾花哨的打分模型,把剪枝的位置摆对。检索后一道 MMR 就能省七成 token,这是几乎零成本的胜利;想要质量再上一步,再叠加一道合成前的覆盖度精炼。LLM 裁判和学习型剪枝目前看都还不值它们的推理开销——至少在这个实验设置下。
不过有个更本质的问题论文没碰:剪枝阈值是固定的,而理想情况下边际价值判断应该随任务难度、预算紧张程度动态变化。下一步把 \(\eta\) 做成运行时可调的策略,可能才是这条线真正有意思的方向。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我