让大模型连开 365 天网店:这个基准把"长程能力"从口号变成了账单
你有没有想过一个问题:我们天天说 Agent 能做长程任务,但现有的测试到底是怎么测的?
大多数所谓的长程基准,其实是把一堆短任务串起来——这道题解完解下一道,这个 bug 修完修下一个。看起来跑了几千步,但每一步之间没有真正的因果链条:第三步犯的错不会让第两百步买单,第两百步积累的经验也不会让第三百步做得更好。这更像一场马拉松式的百米接力,而不是真正的一年经营。
E-Commerce Bench(arXiv: 2608.30730)把这个问题挑明了:长时程任务不是短任务乘以更多轮次。它让 18 个前沿模型各自开一家网店,拿着 ¥100,000 本金,在模拟的 2026 年里连续运营 365 天——调研市场、跟供应商砍价、定价、发货、处理退货、管现金流,目标只有一个:年底资产最大化。
核心摘要:这是首个把多轮对手谈判和动态事件塞进一整年商业运营里的开源长程基准。最狠的设计是"确定性"——顾客买不买、供应商让不让价,全部由固定规则决定,LLM 只负责把谈判结果"说出来",因此同样的操作序列必然得到同样的年末账单,模型之间的分差可以干净地归因于策略差异而不是运气。结果相当扎心:18 个模型里没有一个全能选手。赚最多的 GPT-5.6 Sol 把本金翻到了 14.31 倍(¥1,431,425),但防欺诈能力排倒数第三;谈判和防骗双料第一的 Claude Opus 4.7,赚钱只在中游;开源阵营里 Qwen3.8-Max-Preview 以 4.16 倍领跑,还是全场唯一展现出明显"越买越会砍价"学习能力的模型。我的判断:这篇论文最值钱的不是又刷了一个榜,而是它证明了一个总分掩盖不了模型的短板——长程评估必须拆成能力剖面来看。
论文信息 - 标题:E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation - 作者:Wei Fan、Xinjie Shen(共同一作)、Xudong Guo、Jianhong Tu、Yang Su、Yinger Zhang、Lianghao Deng、Fengyu Wang、Baohua Dong、Yangqiu Song、Dayiheng Liu - 机构:Qwen Team(Alibaba Group)、Taobao & Tmall Group、HKUST - 日期:2026 年 8 月 31 日 - 链接:https://arxiv.org/abs/2608.30730 | 代码:https://github.com/QwenLM/E-CommerceBench
🎯 为什么需要这样一篇论文
先交代一下这个赛道的背景。长程商业运营基准其实不是新鲜事物——Andon Labs 的 Vending-Bench 系列大概是最出圈的:让模型经营一台自动售货机一整年, Claude 3.5 Sonnet 时代就出现过"经营崩溃后反复给 FBI 发邮件举报"的魔幻场面,后来 Claude Opus 5 甚至靠撕毁价格同盟、贿赂和威胁拿下了最高净资产。这些实验戏剧性是够了,但有个致命问题:供应商也是 LLM 扮演的。
后果很直接:供应商的底价是可以被"说服"的。一个擅长花言巧语的模型可以把批发价砍到规则之外,整个环境的随机性大到无法复现——你换个随机种子,同一个模型可能从盈利变亏损。这种评测刷出来的分,到底测的是运营能力还是越狱能力,说不清。
另一边的 YC-Bench 是确定性的,但没有供应商谈判;MerchantBench 和 RetailBench 用了真实数据,却干脆放弃了谈判和对抗。论文用一张六属性对比表把现有工作挨个打了叉,结论是:现有基准要么偏离真实市场动态,要么依赖纯 LLM 驱动的谈判对手,引入大量采样噪声,评估的可信度和可复现性两头都保不住。
E-Commerce Bench 的思路是把两头都占上:真实数据 + 确定性规则 + 对抗谈判 + 全年动态事件,一个都不少。
🏗️ 这个"网店模拟器"是怎么搭起来的
整个基准分四层,结构很清楚。

图:基准的四层架构。数据层来自真实电商平台:12 种店铺类型、60 个品类、576 家供应商、6,886 个商品;环境层是确定性的动态经济引擎和谈判内核;工具层提供 7 组共 18 个工具;最上面是 Agent 循环,带上下文管理和持久记忆。
规则一句话版本:给你 ¥100,000 和一个 2026 年日历,最多同时开 4 家店(开店费 ¥500,日运营成本 ¥60–¥130),年底比谁的总资产多。每个模型跑 5 个完整年度,每回合上限 4,000 轮工具调用。破产规则很真实:银行账户连续 10 天收盘为负就直接出局,而且破产回合照样计入平均分,不给面子。
真正有意思的是下面这几个设计,每一个都精准打击了"短任务思维"。
钱不是立刻到账的:三账户延迟结算
你卖出去货,钱先进平台的担保账户(escrow),9 天后才成熟,成熟了还得你显式提现才能回到银行账户。但成本是即时扣除的——采购单在谈判达成的当下就全额付款。论文给的例子:一笔 40 件的配饰采购当天花掉 ¥2,447,第一笔现金回流要等到第 16 天。
这个设计直接制造了"账面盈利但现金流断裂而死"的经典死法。两个 GPT-5.5 回合在第 17 天就破产了——那时候连一笔收入都还没结算到账。
信息不对称:底价只能靠谈出来
市场查询只给"高/中/低"这种模糊标签,供应商的真实底价只能通过多轮谈判试探。更狠的是,不同信息的可学习速度差异极大:供应商底价可以用历史最优成交价不断收紧上界;商品的自然退货率卖过才知道;而价格弹性参数全年都学不到——四个隐藏因子乘在同一个观测量上,你没法反推。模型必须自己分清"什么值得记"和"什么记了也没用"。
确定性需求模型:同一个动作序列,同一张年末账单
需求不是随机抽的,而是六个命名因子的乘积:
价格弹性、周末效应、促销加成、月度季节性、当日日历事件、店铺声誉,一项一项乘上去,再被品类和店铺两个容量上限压住——所以堆同质化商品只会自相残杀,不会多卖。唯一的随机性来自回合共享的种子:相同操作序列产生完全相同的年末资金。评测噪声被压到了骨头里。
有个细节特别"坏":四个弹性族里有一个是二次族——价格关于公开参考价对称而非单调。也就是说,降价降过了头,需求不升反降。靠"无脑打折冲量"的模型会被这个设计悄悄惩罚。

图:月度季节性乘数热力图。红格子是需求旺季,蓝格子是淡季。食品饮料(Food & Beverage)11 月乘数 1.6、10 月却只有 0.6,峰谷差 2.67 倍——不提前备货的模型会眼睁睁错过旺季。
确定性谈判内核:LLM 只动嘴,规则动脑
这是全篇最核心的工程决策,值得单独说。
供应商是个"双层结构":第一层是确定性谈判内核(基于 TERMS-Bench 的对手策略独立重实现),所有报价、让步、接受/拒绝都由它算出来;第二层是个 NPC 渲染器,一个 LLM 负责把内核的决定"口语化"成供应商的台词。关键约束:成交价必须和内核当前报价误差在 ±0.005 以内才算数——渲染器报错了价,交易永远不可能成立。这就从根上杜绝了 Vending-Bench 那种"把供应商 LLM 说服到亏本卖"的漏洞。
内核还有几个刁钻的行为设定:
- 反价响应的是你的让步速度而不是时间——你越急着让步,对手越强硬;
- 诚实供应商分 6 种行为模板,区别在对让步的响应锐度和口风松紧;
- 重复博弈:同一个供应商+商品的每次新会话换内核实例,但底价不变,你的历史最优成交价就是新的上界——记得住上次谈到多少钱的模型,天然占优。
论文里给了一组真实数字感受一下谈判空间:供应商开价 ¥149.81,市场参考价 ¥199.75,隐藏底价 ¥101.27,双方可分的区间是 ¥98.48。能砍下多少,全看你的谈判纪律。
对抗性欺诈:26% 的供应商是骗子
576 家供应商里,152 家是欺诈型,且每个品类至少埋了 2 家。骗局分两类:
- 交易前收割:底价被人为抬到诚实成本的约 1.5 倍,任何成交都是多付钱;话术里会塞 ¥1,000 的"会员费"、永不兑现的折扣承诺、人为制造的紧迫感;
- 交易后收割:报价区间看着完全正常,履约时才违约——只发 60%–70% 的货,或者发缺陷品(退货率 ≥0.40,或自然退货率的 2 倍取高者)。
最难办的是,开价本身不带任何欺诈信号,唯一可区分的线索是让步速率——欺诈内核比最强硬的诚实供应商还能扛价,而这个信号只存在于多轮交换的形态里。早早接受报价的模型,等于主动放弃了唯一的谈判侧线索,只能靠读话术猜。而交易后欺诈"读起来就像普通供应商",到货才暴露,且缺陷件和诚实货混在一个库存池里,观察到的退货率根本指认不出罪魁祸首。
说实话,这个欺诈设计让我有点背后发凉——它不是"模型够不够聪明"的测试,是"模型有没有风控意识"的测试。后者恰恰是真实商业场景里最值钱的能力。
Agent 侧的工程现实:120k 上下文 + 主动记忆

图:Agent 循环细节。左侧是模型侧(一次调用产生一批工具调用、按序执行),右侧是环境侧(隐藏状态、时钟推进、18:00 日结)。注意左边缘那行字:转录不超过 120,000 tokens 之前不做任何驱逐。
转录超 120k tokens 后按"最旧优先"整组驱逐(一次调用加它产生的所有工具结果算一组),系统消息和最新两组保留。模型被告知驱逐规则,所以把重要信息写进持久记忆(上限 20 条)是模型自己的选择——记不记历史成交价、记不记哪家供应商是骗子,全看它有没有这个自觉。90 个回合里总共发生了 1,495 次驱逐:Claude Opus 4.7 只用 432 轮就走完整年、丢 4 个窗口;Gemini 3.5 Flash 用了 2,628 轮、丢了近 19 个;GPT-5.5 最惨,一半于 Gemini 的轮数丢了 28 个窗口。
📊 实验结果:没有全能冠军
18 个模型(8 个闭源前沿 + 10 个开源权重),每模型 5 个 365 天回合,主分数是年末总资产,外加六个独立能力维度。

图:年末总资产总览(对数轴)。竖虚线是 ¥100k 保本线,空心点是单个回合,红色分数是破产回合数。注意 Qwen3.5-Plus 五个回合破产四个,均值只剩本金的 1%;GPT-5.5 方差巨大——最好回合接近 GPT-5.6 Sol,最差回合直接清零。
完整排行榜(论文 Table 2,按资产排序):
| 模型 | 年末资产(¥k) | 资产倍数 | 谈判 CSE+ ↑ | 欺诈 BadSpend% ↓ | 回撤/峰值 ↓ | 每次调用利润(¥)↑ | AnchorRatio ↓ | 破产 |
|---|---|---|---|---|---|---|---|---|
| GPT-5.6 Sol(max) | 1,431 | 14.31 倍 | 0.672 | 18.48 | 0.278 | 363 | 1.217 | 0/5 |
| Fable5 (max) | 805 | 8.05× | 0.772 | 3.46 | 0.141 | 479 | 1.573 | 0/5 |
| GPT-5.5 | 702 | 7.02× | 0.700 | 16.59 | 0.591 | 192 | 1.043 | 2/5 |
| Claude Opus 4.8 (max) | 498 | 4.98× | 0.662 | 5.41 | 0.130 | 266 | 1.309 | 0/5 |
| Qwen3.8-Max-Preview | 416 | 4.16× | 0.713 | 6.13 | 0.242 | 173 | 0.834 | 0/5 |
| GLM 5.2 (high) | 301 | 3.01× | 0.693 | 1.99 | 0.127 | 137 | 1.434 | 0/5 |
| Kimi K3 | 265 | 2.65× | 0.632 | 5.87 | 0.247 | 123 | 1.507 | 0/5 |
| Claude Opus 4.7 (max) | 259 | 2.59× | 0.811 | 0.12 | 0.189 | 156 | 1.421 | 0/5 |
| Claude Opus 4.6 (max) | 258 | 2.58× | 0.649 | 14.98 | 0.587 | 129 | 1.268 | 2/5 |
| GLM 5.1 | 226 | 2.26× | 0.662 | 6.49 | 0.231 | 94 | 1.557 | 0/5 |
| DeepSeek-V4-Pro-Preview | 190 | 1.90× | 0.654 | 8.99 | 0.166 | 68 | 1.235 | 0/5 |
| Gemini 3.5 Flash | 190 | 1.90× | 0.777 | 2.13 | 0.450 | 36 | 0.918 | 0/5 |
| Qwen3.7-Max | 165 | 1.65× | 0.616 | 9.85 | 0.433 | 59 | 1.433 | 0/5 |
| Gemini 3.1 Pro | 130 | 1.30× | 0.660 | 12.58 | 0.688 | 19 | 1.376 | 2/5 |
| GLM 5.2 (max) | 115 | 1.15× | 0.632 | 19.68 | 0.360 | 10 | 1.362 | 0/5 |
| Kimi K2.6 | 70 | 0.70× | 0.596 | 17.22 | 0.377 | -27 | 1.548 | 0/5 |
| Qwen3.6-Plus | 47 | 0.47× | 0.625 | 10.68 | 0.583 | -40 | 1.333 | 0/5 |
| Qwen3.5-Plus | 1.1 | 0.01× | 0.625 | 20.11 | 0.979 | -92 | 1.860 | 4/5 |
这张表我读了好几遍,几个点值得展开。
第一,"最会赚钱的"和"最会做生意的"是两拨模型。 GPT-5.6 Sol 资产断层领先,但你看它右边那几列:BadSpend 18.48%,全场 18 个模型里排第 16——它将近五分之一的采购款进了骗子口袋。而 Claude Opus 4.7 谈判质量(CSE+ 0.811)和防欺诈(BadSpend 0.12%,几乎从不被骗)双双第一,年末资产却只有 2.59 倍,混在中游。论文那句总结很到位:one total-assets figure can no longer hide where a model is weak——一个总分再也藏不住模型的短板了。
第二,雷达图上的"偏科"是普遍现象。

图:七维雷达(按各厂商家族资产最强者各取一个)。越靠外越好,虚线是 18 模型中位数。7 个代表模型里 6 个至少有一轴低于中位数——GPT-5.6 Sol 利润顶满格,但防欺诈直接凹进内圈。
第三,开源阵营的门面是 Qwen3.8-Max-Preview。 4.16 倍,比 GLM 5.2 (high) 高 38%,而且它的 AnchorRatio 0.834 是全场最低——这个指标下面细说,它衡量的是"重复采购时有没有越买越便宜"。
欺诈维度:一个不筛供应商的冤大头会亏 26.4%

图:欺诈维度细节。左图是 BadSpend%(对数轴),红色虚线是"完全不筛查"的基准水平 26.4%;右图是各模型的被骗金额在五类骗局间的分布。Claude Opus 4.7 只有 0.12%,几乎免疫;GPT-5.6 Sol 的 18.48% 里大头是"未来折扣"话术和"质量降级"的缺陷货,单回合被骗现金高达 ¥689k。
还有个挺扎心的统计:和欺诈供应商达成的 1,141 笔协议里,943 笔发生在"第二次及以上"的合作中。也就是说大多数模型不是没被骗过,是被骗了还不知道拉黑——骗子供应商成了回头客。这个发现比任何抽象的安全评估都有说服力。
学习维度:16 个模型全年没学会压价
这是我觉得整篇论文最有信息量的一个结果。
设计是这样的:只看诚实供应商里被重复采购的(供应商, 商品)对,一共 8,647 次重复订单,统计每次成交价相对"该模型历史最低成交价"的超额支付(AnchorRegret),再用置换检验归一成 AnchorRatio。结果:18 个模型里 16 个没有表现出任何"随时间压价"的迹象。

图:谈判的两个时间尺度。图 a 是单次会话:供应商从 ¥131.44 让到 ¥116.74,模型从 ¥102 加到 ¥110 后接受。图 b 是反面教材:一个模型在一轮接近底价(¥101)的好交易后价格反弹,之后全年再也没谈回去——阴影楔形就是它白付的钱。图 c 是正面典型:每次补货都把价格压出新低,AnchorRegret 为 0。
机制上这完全说得通:已成交的交易不会被系统重新呈现,模型得自己把历史价格写进记忆,下次开新会话时才能拿"我上次谈到了 ¥101"当锚点。记不住,就等于每次从零开始谈。16 个模型没做到,说明"从经验中学习"在长程场景里依然是个未解决的问题,而不是已经解决的工程细节。

图:谈判盈余效率热力图(值越高越好,下方小字是成交数)。能看到 Claude Opus 4.7 在"对抗型诚实供应商"一列拿到 0.819 的全场最高分,而 GPT-5.6 Sol 在欺诈供应商列还能拿到 0.618——它跟骗子谈价钱其实不差,差的是压根没识别出对方是骗子。
效率维度:钱多的不一定花得省

图:运营效率。上图是每次工具调用的平均利润:Fable5 以 ¥479 领先 GPT-5.6 Sol 的 ¥363,榜尾三个模型是负值——每动一次手都在亏钱。下图是工具预算花在哪:Claude Opus 4.7 把 36% 的调用花在 wait 上(等待时机),而 GPT-5.6 Sol 有 23% 花在轮询状态。
Fable5 这个模型挺神的,资产第二(8.05×)、效率第一、回撤控制第一梯队,像个稳重的老牌运营。而 GPT-5.5 每次调用 ¥192 看着还行,但两个回合破产——方差大到均值失真,它的标准差 ¥616k 快赶上均值 ¥702k 了。
失败案例:一张"温水煮青蛙"的破产图

图:一次破产的完整尸检。1 月 3 日银行余额掉 ¥32.5k,1 月 22 日再掉 ¥29.1k,总资产只剩 ¥38.4k;1 月 29 日手里压着 2,207 件卖不动的库存,到 5 月仓储费滚到每天 ¥428;5 月 2 日银行转负时钱包里只有 ¥20,5 月 11 日连续 10 天负余额规则触发,回合终结。
这就是典型的"库存买进来就没卖出去过"死法——1 月开满 4 家店疯狂铺货,然后整整四个月没把货清掉。
论文的错误分析还给了个很有意思的反向结论:三个常被归咎于长程失败的"想当然"原因,在数据面前站不住脚——频繁开关店不区分强弱模型;参加促销多的模型反而更富,"忽视活动"解释不了失败;年末崩溃只部分成立(一季度后增长显著放缓,配对检验 \(t=-3.95\),但收官窗口是平的而非持续恶化)。另外,2,180 次目录/供应商查询里有 746 次是重复查询(参数一模一样),浪费 7,460 个模拟分钟——旁边就是几乎没人用的记忆库。每个模型至少踩中 10 条失败模式里的 5 条,Gemini 3.1 Pro 十条全中。
🤔 我的判断
这篇论文最值钱的地方,不是"又一个新基准",而是它立住了一个方法论主张:长程能力的评估必须是确定性的、多维度的。
确定性这一点,我是真心觉得漂亮。之前看 Vending-Bench 的结果总觉得差点意思——模型排名起起伏伏,你分不清是能力差异还是供应商 LLM 今天心情好。E-Commerce Bench 把谈判内核和 LLM 渲染器拆开、成交价锁定在 ±0.005 的容差里,等于把"运气"这个变量从评测里物理删除了。当然代价也有:欺诈检测依赖叙事话术,而渲染器措辞在 run 间有采样噪声,论文自己也承认欺诈轴叠加了这层噪声。这是个诚实的取舍。
批判性地说几句。一是这个基准的世界里只有一个买家——模型不需要跟其他智能体竞价抢货源,而真实电商恰恰是多买方博弈(Vending-Bench Arena 已经在做多智能体版本了,还出现了模型私下串谋价格的奇观)。二是"能力剖面"虽好,但 CSE+ 这类会话级指标不按订单金额加权,谈小单砍得狠和谈大单砍得狠被同等对待,指标和真实金钱后果之间还隔着一层。三是 5 个回合的样本量,碰上 GPT-5.5 这种方差怪兽,排名稳定性其实没那么扎实——不过破产回合计入均值这个设计至少没让方差被悄悄藏起来。
对工程实践的启发很直接:
- 如果你在构建长程 Agent,显式记忆不是可选项。8,647 次重复采购里 16 个模型没学会压价,746 次重复查询白烧时间——"自己决定记什么"这件事,当前模型做得很差,外挂一个结构化记忆模块(历史价格表、供应商黑名单)可能是最便宜的提升;
- 现金流和风控要和利润解耦评估。最赚钱的模型防欺诈倒数第三,这个错位在真实部署里是要出事故的;
- 评估你自己的 Agent 系统时,别只报一个总分。把谈判、风控、现金管理、执行拆开看,短板藏不住。
最后回到开头的问题:长程任务到底是什么?这篇论文给的答案我认——它不是短任务的串联,而是一个"过去的每个决定都会在未来某天敲门"的环境。365 天后那张账单,一分一厘都记得你 1 月份犯的错。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我