不卷参数卷"干活":Apodex 1.1 用两条新扩展轴把智能体推向重型任务
你有没有碰到过这种情况:让 AI 帮你做一个稍微复杂点的活儿——比如"把这几个文件夹里的数据整理成一份能直接交付的分析报告"——模型聊得头头是道,真跑起来不是文件读错版本,就是中途忘了我半小时前补充的需求,最后交付的东西看起来漂亮,细查全是坑。
问题不在模型不会推理。问题在于,"把活干完"和"把天聊对"是两种完全不同的能力。后者一个 prompt 一个回答就完事了,前者要持续几个小时、几百步操作、跨文件跨工具跨分支,还要在中途接受人插话、从失败里恢复、最后交出一份经得起检查的交付物。
Apodex 团队 8 月 24 日挂出的这份技术报告(arXiv: 2608.23283),就是冲着这个 Gap 来的。标题里那个词值得琢磨——Scaling Agentic Intelligence for Complex Work,不是 scaling reasoning,不是 scaling context,是 scaling "干活"这件事本身。
核心摘要
Apodex 1.1 提出了一个叫 working capability(工作能力) 的概念:智能体的智能不该用"单次回答质量"来度量,而该用"持续、可验证地完成一件真实工作"来度量。围绕这个目标,论文给出两条互补的扩展轴——Environment Scaling(环境扩展) 把可执行、可验证的文件/搜索/代码环境当作新的 scaling 面,Agentic Coordination Scaling(协同扩展) 把任务拆解、并行委派、异步结果整合、动态重规划训练成模型行为而不是外挂脚手架。两者由一个统一的执行底座 AgentOS 串起来,再配一套 PIVOT-RL 局部化信用分配算法做训练。结果上,Agent Team 模式在 FrontierFinance(54.3)和 FrontierScience-Research(63.3)上拿到对比表里的最强值,MathArena 协议下 IMO 2025 拿到 36.5 分超过 35 的金牌线;35B 的 Mini 版本在多项任务上摸到前沿系统的性能带。我的判断:这不是一篇模型论文,是一篇系统+训练方法论论文,最值钱的不是某个数字,而是"环境也是一个可以 scale 的东西"这个视角,以及那套把交付物当一等公民的执行底座设计。自建基准刷分的水分要留意,但工程细节是真的扎实。
📖 论文信息
- 标题:Apodex 1.1: Scaling Agentic Intelligence for Complex Work
- 作者:Apodex Team(约 75 位作者,按字母序署名)
- arXiv:https://arxiv.org/abs/2608.23283 (v1 提交于 2026 年 8 月 24 日,v2 修订于 8 月 25 日)
- 资源:官网 apodex.ai,代码 github.com/ApodexAI/FrontierAgent,模型权重已挂 Hugging Face
🎯 问题动机:答对不等于干完
先讲清楚这篇论文到底在不满什么。
传统 LLM 评测是"prompt 进、答案出",即使是现在的智能体基准,很多也只是把这个循环拉长了一点。但真实工作长这样:你要在几十个文件里找到权威版本的那一份,要跑代码、看报错、改完再跑,要在一个分支假设被证据推翻后及时止损,要在用户中途插一句"方向改一下"的时候判断哪些已完成的工作还有效、哪些要作废。
论文把这种能力形式化成一个任务合约:
翻译成人话:一个任务 = 工作区状态空间、初始工作区、目标 \(q\)、可用动作、状态转移规则、观测接口、资源预算 \(\mathbf{B}\)、交付合约 \(D\)、以及合约对应的验证器 \(V_D\)。注意最后两项——这是整个报告的灵魂。成功不是"模型输出了一段合理的话",而是
验证器拿着初始状态、最终工作区和整条执行轨迹来判分。一个空文件、一个上一轮残留的同名旧文件、一段无法溯源到证据的结论,全都过不了关。
这个形式化本身没什么数学上的新意,说实话。但它把一件工程界早就模模糊糊感觉到的事说清楚了:智能体的计量单位应该是 完成的工作,不是 生成的文本。后面所有设计——环境、协同、训练、评测——都是从这句话推出来的。
🧠 核心思路:两条新的扩展轴
传统 scaling 卷三样东西:参数、数据、推理算力。Apodex 1.1 说,对于"干活"这种能力,还有两面墙可以推。
轴一:Environment Scaling——环境本身就是可以 scale 的
这个想法我觉得是全文最有价值的视角。它的意思是:策略学习所用到的可执行环境,其多样性、保真度、可验证性,是可以系统性扩张的,而且扩张它会带来模型能力的增长——就像当年扩张数据量一样。
论文建了三族环境:
| 环境族 | 构造方式 | 验证边界 | 教模型什么 |
|---|---|---|---|
| 文件世界 | 按职业条件生成多格式工作区 | 代码重算或溯源记录,"Exact"不接受纯模型裁判 | 找权威文件、跨文件推理、产出专业交付物 |
| 搜索世界 | 索引化/开放证据源 | 溯源 + 主张-证据对齐审查 | 查询重构、来源甄别、证据调和 |
| 代码世界 | 真实 PR 采集 + 合成扰动 | 沙盒测试 + 交付物检查 | 可执行的修改与修复 |
几个硬数字:文件世界的场景注册表现在覆盖 33 个领域、318 种职业、1208 个交付物簇。代码世界有个防作弊设计我很喜欢——合成任务没有外部标准答案,光跑通参考解不够,还要专门测试"solver 能不能不真干活就骗到奖励",只有在沙盒里真实成功的攻击才算验证器缺陷。这是把 reward hacking 当一等公民来防。
还有个细节值得拎出来:任务难度不是"文件越多越好"。论文给了一个获取压力坐标
分子是需要逐一排查的候选数和承重证据跳数,分母是工具调用预算。比值越大,模型越被迫做甄别、导航和"什么时候该停"的纪律性决策。这个公式粗糙,但方向对——难度应该度量"决策压力",不是度量"材料体积"。
整个环境构造遵循一个原则,论文叫 forward cheap, inverse expensive:生成器拿着隐状态和参考程序可以便宜地构造并求解一个世界,但智能体只能看到渲染出来的工作区,必须在约束下把路径反推出来。生成便宜、求解昂贵、验证独立——这三件事凑齐,规模化才成立。
轴二:Agentic Coordination Scaling——协同也是训练出来的
多智能体不新鲜。AutoGen 的对话编排、MetaGPT 的角色分工、多智能体辩论,这些论文都引了。Apodex 1.1 的主张不一样:拆解、委派、整合、重规划这些不是推理期脚手架的属性,而是要写进训练轨迹、成为策略本身的行为。
Agent Team 1.1 在 1.0 的基础上外化了四样东西,我觉得其中两个是真的有洞察:
显式任务板(Task Board)。1.0 里任务拆解是主智能体脑子里的一次性决策,1.1 把它落到模型上下文之外的一块持久任务板上:每个条目有边界清晰的目标、依赖关系、解决状态(open / in_progress / resolved / cancelled)、指派的智能体和返回的证据。这块板不是给人看的可视化装饰——子智能体从板上领范围,完成的工作挂回板上,计划修订就是对板的工具化编辑。一个分支失败只作废它的后代节点,不拖死整个任务。说到底,这是把"计划"从易失的上下文内存变成了可检查的外部状态。
非对称验证(Asymmetric Verification)。这个设计挺漂亮的。1.0 已经有独立的审查角色,但论文指出了一个真问题:如果你让一个能力相当的验证者把整道题重做一遍,它可能引入第二条同样不受约束的错误链,验证者本身变成新的污染源。1.1 的做法是让验证故意比生成窄:验证者拿到的不是整个问题,而是一条具体主张 + 支撑证据 + 适用的交付约束,它的活儿是找反例、用真正独立的来源类别做三角验证、核对名字日期数字公式这种原子细节。反驳一条主张需要的开放式综合远小于从头生成报告——不对称性在任务设计上,不在模型大小上。

图3:Agent Team 在共享 AgentOS 工作区上的协同扩展。上层是运行级协同平面:协调器 ReAct 循环负责拆解-委派-综合,外部任务板存放协调器拥有的语义解决状态,Agent Bus 暴露运行时执行状态。中层是执行-工作区平面,子智能体在隔离后端决定的候选工作区里产出中间件。下层是文件系统-发布平面:/inputs 只读、/outputs/scratch/ 共享、最终交付必须经过单一 Publisher Lease 和 Exact Manifest Gate 的校验。
另外两个能力简单带过:异步人工干预不是加了个打断按钮,而是训练了一个策略去判断"用户这句话改变了什么、哪些已完成工作在因果上仍然有效"——如果用户实质改变了目标或交付要求,运行时直接开一个新任务合约,把还有效的工作区状态带过去;自适应 Max Team Effort 则把 test-time scaling 用在团队层面,只对薄弱的、有争议的、承重的主张追加独立调查,而不是均匀撒算力。
AgentOS:把交付物当一等公民的执行底座
两条轴要靠一个共同底座撑着。AgentOS 1.1 里最打动我的是受控交付(Controlled Artifact Delivery)这组机制:
- 工作区分三个命名空间:/inputs 只读任务材料、/workspace 干活的地方、/outputs 最终交付根目录,外加一个可跨任务存活的只读文档库 /shares;
- 生产和发布分离:普通执行只能写 /workspace,想往 /outputs 写东西必须持有发布租约——同一时刻最多一个会话有提交权;
- 发布前要申报精确清单(exact manifest):只能写申报过的路径,没申报的写入直接拒绝;终止时每个清单条目还要跟租约发放时的基线快照对账——空文件、同名旧文件都糊弄不过去;
- 连最终回答文本都会被检查有没有"清单之外的交付声称"。
说实话,看到这块我笑了一下——这套东西完全就是给"AI 交付了一个看起来对实际是上一轮残留的文件"这种经典翻车场景打的补丁。做过 Agent 工程的人应该都懂这种痛。
另外还有几组机制对应长程执行的经典死法:上下文爆炸用分层压缩(先廉价地清掉旧工具观测的主体,不够再上 LLM 摘要,升级由实际腾出的空间驱动而不是固定计划表);墙上时钟耗尽用软截止+硬超时(软截止前提醒智能体先固化已有成果,硬取消只是最后手段)。论文自己也很坦诚:任务板和 Agent Bus 是会话级的,进程崩溃后没法原子恢复,协同状态、消息历史、文件系统的联合版本化是明确的后续工作。
🔧 训练:PIVOT-RL 把信用分配做在"岔路口"上
训练分两段。SFT 用统一混合数据做行为冷启动,跨推理、工具、搜索、文件、代码、数学、多智能体协同,不同能力域的 SFT 变体用 model soup 合并。这段比较常规。
RL 段的 PIVOT-RL 有点意思。长轨迹的信用分配是个老问题:一条几百步的轨迹最后失败了,但前面的中间工作可能都是有用的;反过来,一条成功的轨迹里也可能藏着低效甚至依据不足的决策。只看终局奖励,信号太粗。
PIVOT-RL 的做法是事后回溯分析,在轨迹里找关键决策点(pivots)——模型开始走无效策略、证据不足就下结论、误用工具、该修正假设没修正的那些岔路口。在每个 pivot 上保留有用的前缀,构造一个局部续写任务外加一句简短的纠正提示。这句提示只给方向,永远不作为预测目标,推理时也不存在;对有状态的任务还会恢复对应的环境状态。局部续写和不带提示的完整任务混在一起训。
等等,这个思路其实挺像"过程监督"和"拒绝采样"的混血——但它聪明的地方在于学习被集中在需要纠正的那个片段上,而不是让整条轨迹平均分摊奖励。论文也引了同期工作(Yi et al., 2026)说明挑信息量的中间轮次做后训练能省算力,说明这个方向大家正在收敛。

图4:随 RL rollout 步数增加,搜索、知识、科学三类留出评测上的得分曲线。三条线都在涨,但坦率讲涨幅不算陡(搜索从约 0.60 到 0.66),而且抖动不小——长程 agentic RL 的稳定性依然是个活问题。
📊 实验:先看成绩,再说水分

图1:Apodex 1.1 在专业工作(APEX-Agents、GDPVal)、金融(FrontierFinance)、科学研究(FrontierScience-Research、BioMysteryBench)和通用推理(HLE)六个基准上与前沿模型的对比。蓝色三条是 Apodex 1.0 / 1.1 ReAct / 1.1 Agent Team,灰色是外部模型。
主表数据我挑重点列一下(主模型 397B,Mini 为 35B):
| 基准 | Apodex 1.0 | 1.1 ReAct | 1.1 Agent Team | 最强外部参照 |
|---|---|---|---|---|
| APEX-Agents(专业工作) | 16.5 | 34.4 | 38.5 | Claude Opus 5:42.3 |
| GDPVal(专业交付物,win rate) | 59.3 | 69.5 | 78.8 | Claude Opus 5:89.4 |
| FrontierFinance(金融) | 40.3 | 48.7 | 54.3 | Claude Fable 5:49.2 |
| FrontierScience-Research(科研) | 28.3 | 55.0 | 63.3 | DeepSeek V4 Flash:55.0 |
| BioMysteryBench(生物信息,人类困难集) | 17.6 | 23.5 | 35.3 | Claude Opus 5:49.4 |
| HLE(通用推理) | 49.0 | 53.2 | 56.1 | Claude Opus 5:64.7 |
| DeepSearchQA(深度搜索,F1) | 84.6 | 88.2 | 92.4 | Kimi K3:95.0 |
几个观察。
代际提升是真的猛。APEX-Agents 从 16.5 到 34.4,ReAct 单智能体就翻倍还多——这说明 1.1 的底层工作策略确实强了一截,不是靠多智能体堆出来的。Agent Team 再加 4.1 个点。GDPVal 上协同带来的增益是 9.3 个点,说明协调计算对"交付物质量"这种软指标帮助更大。
但注意头部差距。GDPVal 差 Claude Opus 5 十个点还多,HLE 差 8.6 个点,BioMysteryBench 差 14 个点。Apodex 1.1 的真实定位是"在多数基准上进入第一梯队,在金融和科研两个方向上拿到表内最强 这个性能带"——论文自己的措辞也是 leading performance band,还算诚实。
数学这块值得单独说。MathArena 协议下,IMO 2025 从 1.0 的 12.5 涨到 36.5(金牌参考线 35),IMO 2026 拿 30.5(线 29),USAMO 2026 拿 26.5(线 25)——三组全部越过金牌线。IMO-ProofBench 上 Agent Team 拿 Basic 96.7%、Advanced 63.3%。一个以"干活"为主轴的系统顺手把竞赛数学证明做到这个水平,说明统一策略的路子确实走得通。
编程是短板,数据摆在这:Terminal-Bench 2.1 拿 70.8(Gemini 3.6 Flash 91.9),SWE-bench Verified 拿 77.7(Claude Opus 5 92.2)。差距不小,论文也没怎么展开解释,我猜代码环境的覆盖深度还跟不上专门卷代码的训练配方。
35B Mini 是另一个亮点。ReAct 模式下 FrontierFinance 40.0、FrontierScience 45.0、APEX 24.2,Agent Team 分别抬到 50.2、51.7、27.7——一个本地可部署的 35B 摸到前沿性能带,这比 397B 刷榜对大多数人更有实际意义。
自建基准和过程评测:诚实,但要打个折看
内部基准 FrontierSearchBench(41 个结构化深搜任务)上 Agent Team 拿 69.1,压过 GPT-5.6-Sol 的 67.4。但我要提醒一句:自家基准上拿第一,参考价值天然打折,哪怕论文声明了任务构造、标注、评分器都在评测前冻结。
更让我意外的是 FrontierResearchBench 的坦诚——97 个可执行的端到端科研工作流任务,Apodex 1.1 Agent Team 只过了 12.4%,被 GPT-5.6-Sol + Codex(20.6%)和 Grok-4.6 + Claude Code(20.6%)压着。论文原话承认"remains behind the frontier systems"。敢把自家系统落后的表放进报告里,这个动作本身加了不少可信度。顺带也说明:端到端交付一整套互相一致的科研产物,对当前所有系统都还是很难的事。

图5:HDS6 过程验证框架。A 部分:六大过程能力(长程状态连贯、证据保真、假设管理、边界与失败推理、工具使用与执行状态管理、验证下自我纠错),各含 4 条细则共 24 项。B 部分:评审流水线——Mapper(GPT-5.5)把轨迹按条目切窗索引,Judge(GPT-5.5)给 0/1/2 档位,Reviewer(Claude Sonnet 5)审查高分判定,Arbiter(Claude Opus 5)仲裁不收敛的分歧;评分对最终结果盲视、剥离私有推理,且有一条完整性闸门:伪造工具结果或叙述了日志里不存在的动作,整条轨迹直接零分。
HDS6 这个"过程对不对"的评测设计我觉得是全文第二有价值的东西。结果分数只告诉你活干没干完,不告诉你过程是不是连贯、有据、可恢复的。用竞品模型组成评审团(GPT-5.5 映射和初判、Claude 系复审和仲裁),再加上"发现伪造直接零分"的完整性闸门——这套东西拿去评别人家的 agent 也完全成立。

图6:HDS6 雷达图对比 v1.0 与 v1.1。三个面板分别是 Deep Discover(Agent Team · 397B)、Deep Solve(ReAct · 397B)、Deep Research(ReAct · 35B)。注意论文自己标了:Deep Discover 面板里 v1.0 是八次运行聚合、v1.1 是单次运行,不是严格对齐的消融,只能做面板内解读。
雷达图上最大的两个单项提升是 Initial Decomposition(提升 1.3 个点)和 Final Verification(提升 0.8 个点)——正好对应任务板和受控交付这两个 harness 机制。能力提升出现在哪里,和系统设计把钱花在哪里,对得上。这种自洽性比单纯的涨分更有说服力。
附录的三个端到端案例也值得扫一眼:蛋白质粗粒化模拟交付 18 个连锁文件(82.4 分钟,一个文件维度对不上引擎就全拒);荧光显微图细胞凋亡定量(24.7 分钟、324 步、任务板 7/7 解决,两个测量分支并行跑);猪 RNA-seq 队列的 WGCNA 分析交付 20 个规定产物。这些案例展示的不是"答得漂亮",而是"交付物清单逐条对账"——和全文的合约式世界观完全一致。
💡 我的判断
最值钱的东西:把"环境"确立为与参数、数据并列的扩展轴,并且给出了可操作的构造原则(forward cheap inverse expensive、独立验证、重放要求)。这个视角在去年底以来的 ScaleEnv、Agent-World 等工作里都在冒头,Apodex 1.1 是把它系统化、并和训练闭环焊得最死的一次。同样值得搬的是那套交付物治理机制——发布租约、精确清单、基线对账——做过 Agent 产品的人都知道这才是线上系统的真实痛点。
要打折看的东西:三个带 Frontier 前缀的基准里有两个是自建的,第一名的成色要自己掂量;主模型 397B 的架构、底座、训练算力完全没披露,"用比前沿系统小得多的模型"这个说法无从验证;Deep Discover 的 HDS6 对比聚合协议都不一致,论文自己承认了但你得自己记住。还有,报告通篇没提成本——一个跑 82 分钟、几百步、调动一整个 Agent Team 的任务花多少钱、值不值,这个账没人算。
和同期工作比的位置:这不是底层突破,是一次高质量的系统整合加方法论提炼。环境扩展、多智能体协同、过程验证、局部化信用分配,单拎出来每一件都有先行者;把它们按"完成的工作"这个统一合约拧成一个自洽的整体,并且敢放出落后项的完整数据——这才是这篇报告的真实贡献。
如果你在做 Agent 工程,有三个可以直接搬的东西:任务状态外化到上下文之外(别信 compaction 后的消息历史)、验证任务设计得比生成任务窄、交付物走申报-租约-对账三步。如果你在做 agentic RL,PIVOT-RL 的 pivot 定位思路值得复现一把——论文没给算法细节,只给了思想,这算个小遗憾。
重型求解器(Heavy-Duty Solver)这个词起得挺大。但看完这份报告我倾向于认为,至少"把活干完"这个计量单位,会成为接下来 Agent 系统竞赛的默认计分板。
参考链接
- 论文:https://arxiv.org/abs/2608.23283
- 官网:https://www.apodex.ai
- 代码:https://github.com/ApodexAI/FrontierAgent
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我