只给一句"变得更强",模型能自己进化吗?Aspire 的答案挺扎心
这两年"自我进化"方向的论文满天飞,但仔细看你有没有发现一个共同前提:任务和指标都是人给的。人类把目标拆好、评测器写好,智能体只负责在固定轨道上优化——这不叫自我进化,这叫自动调参。
那如果把这层脚手架抽掉呢?只丢给智能体一句"提升你的科学推理能力",不告诉它考什么、怎么判分,让它自己决定学什么数据、用什么方法训、怎么验证自己真的变强了。这篇 arXiv 论文(2608.31111)就干了这个实验,名字叫 ASPIRE。结果说实话有点难看:智能体们训练闭环跑得挺欢,但 24 次权重演化只有 3 次超过基座,不少 run 训完分数直接腰斩。
核心摘要:现有 LLM 自我演化基准都把任务和评测显式给定,自我演化被退化成"优化一个显式目标"。ASPIRE 反其道而行,只给一个自然语言能力目标(比如"提升数学推理"),下游 520 道专家编写的评测题全部密封,要求智能体自己操作化目标——选数据、选训练方法、构建验证信号、决定何时评测。实验覆盖权重演化和 harness 演化两个表面,结论相当冷:当前智能体能跑完流程,但权重层面的提升稀少且不稳,最强的演化 harness 仍打不过人工设计的 Qwen-Agent 参考实现。这篇论文的价值不在提出新方法,而在于把"自我进化"这个被过度包装的概念拉回了地面——闭合训练闭环,离闭合能力闭环还差得远。
论文信息
- 标题:Aspire: Can Models Self-Evolve from Vague Goals?
- 链接:https://arxiv.org/abs/2608.31111
- 核心作者:Yuhao Wu、Jingyuan Zhang、Jiajun Shi(Core Contributors);Yuhao Wu、Wenxuan Zhang、Shen Yan、Wenhao Huang、Ge Zhang(通讯作者)
- 机构:ByteDance Seed、新加坡科技设计大学(SUTD)、M-A-P、TokenWave.AI
- 项目主页:https://self-developing-agents.github.io/
🎯 为什么"模糊目标"是真问题
先讲清楚论文里的"vague goal"到底指什么。不是含糊其辞,而是一个还没被操作化成固定任务和指标的宽泛能力方向——就像导师跟你说"把研究能力搞上去",既没告诉你做哪道题,也没告诉你用什么考试。
人类学习天然是这种形态。想"成为更好的物理学家",你得自己解释目标、诊断能力缺口、决定怎么学、还得判断自己到底有没有进步。这里其实有三个耦合的决策:改进什么、怎么改进、怎么验证改进。
而现有的自我演化工作——PostTrainBench、SEAL、Evo-Memory 这些——只解决了中间那个。任务格式、难度锚点、指标、成功标准全都由人类预置,智能体的搜索空间被压缩到只剩"怎么改进"。说实话,我之前看这类论文的时候就有个隐约的别扭感:这更像超参搜索的自动化,离"自我"两个字差得远。ASPIRE 把这个别扭感正式提了出来。
论文还借了个挺有意思的概念:forward-deployed engineer(FDE),Palantir 推广的那种部署工程师角色。真实部署里天然缺三层东西——目标是模糊的、反馈信号不可靠、执行系统还不存在。ASPIRE 聚焦第一层:智能体能不能自己把模糊目标翻译成可训练、可验证的东西。

图1:两种范式的对比。(a) 显式任务设定下,人类定义好任务格式、难度锚点、指标和成功标准(WHAT),智能体只搜索怎么改进(HOW);(b) 模糊目标设定下,人类只给一个宽泛方向,智能体必须自己诊断缺口、分解子目标、构建学习信号,同时决定 WHAT 和 HOW。关键差异在右边:模糊目标下智能体自建代理指标(竞赛题、证明题)上的收益,未必能迁移到密封的隐藏评测上——这正是整个基准要检验的核心。
🏗️ ASPIRE 基准:六个目标,520 道密封题
基准设计上有几个地方我觉得做得相当讲究。
六个能力目标全部以自然语言给出,下游评测项完全隐藏:
| 模糊目标 | 评测项数 |
|---|---|
| 科学与学术推理 | 75 |
| 人文与社会科学知识 | 110 |
| 健康与医学推理 | 100 |
| 数学推理 | 126 |
| 逻辑、可靠性与指令遵循 | 89 |
| 学术与科学写作 | 20(顶层任务包) |
| 合计 | 520 |
评测集是领域专家从零写的,GPQA、MMLU-Pro、MedQA 只用来参考题型和难度,一道题都没抄。质控流程包括独立评审、盲法多模型难度校准(让 Seed-2.0、GPT-5.2、Gemini-3 独立作答,按失败模型数标 L0–L3 难度)、去重、与参考基准的重叠审计。评测集冻结在带 SHA-256 的版本化 manifest 里,跑实验中途不换版本。这种工程严谨度在学术基准里不算常见。
信息边界做得也狠:智能体看不见评测题、参考答案、评分细则,注册的训练数据还要过一道与隐藏集的重叠门检。评测只返回聚合分数和剩余查询额度。反馈协议分两档——Adaptive-feedback 允许有界次数的聚合分查询(稀疏黑盒通道),Final-only 则一个中间分都不给,最后交一个检查点评一次。

图3:系统架构。智能体(左侧)负责战略决策:解释目标、选数据和学习信号、定超参、决定分支或停止;它通过统一工具接口调用类型化动作——数据动作(搜索/下载/合成)、训练动作(SFT/GRPO/LoRA)、循环动作(状态查询/自评/停止)。控制器把工具调用映射到受管后端,强制执行预算、隔离、审计和安全保留。右侧是测量的两条路:智能体自建的验证(可能误导下一步)与控制器专属的隐藏评测(题目、细则、评审轨迹全部保密)。底部是 harness 演化的副路径:编辑 prompt/工具策略/工作流后冻结版本,再做事后对比。
智能体不需要操作 shell、不用下载训练仓库、不用实现分布式执行——这些全被控制器接管。信任边界划得很清楚:智能体做决策,控制器管凭证、存储、作业调度、预算和谱系约束。无效或伪造的工件进不了评分谱系。
还有一个设计叫安全保留(safe retention):只有当提交的终态检查点分数严格高于基座时才保留,否则回滚。也就是说报告的"保留改进"天然非负——这是选择机制的结果,不是每次更新都有效的证据。这个细节后面会很重要。
🧪 实验:三组问题,答案一个比一个冷
RQ1:把显式任务换成模糊目标,会怎样?
作者先做了个对照实验:拿 PostTrainBench 的原有任务评测器不动,只把显式的基准标识符换成宽泛的能力描述,让 Claude Opus 4.8 和 GPT-5.6 跑。
| 任务 | Claude 官方分 | Claude 模糊目标 | GPT-5.6 官方分 | GPT-5.6 模糊目标 |
|---|---|---|---|---|
| AIME 2025 | 10.83 | 5.83 | 7.50 | 3.75 |
| GPQA Main | 28.35 | 24.89 | 30.13 | 27.04 |
| HealthBench | 31.68 | 12.62 | 27.39 | 9.93 |
| HumanEval | 47.33 | 56.63 | 63.95 | 56.40 |
| GSM8K | 68.87 | 66.98 | 69.48 | 74.35 |
| ArenaHard | 36.09 | 13.07 | 26.40 | 21.72 |
| BFCL | 47.13 | 58.63 | 94.38 | 79.38 |
| 加权平均 | 32.90 | 27.07 | 36.23 | 29.58 |
加权平均掉了 5-7 个点。HealthBench 最惨,Claude 从 31.68 跌到 12.62。有意思的是少数任务模糊目标反而更高——Claude 在 HumanEval 和 BFCL 上反超,GPT-5.6 在 GSM8K 上反超。说明模糊目标不是单纯的性能削弱,而是重定向了搜索努力。
轨迹分析证实了这一点:模糊目标下,Claude 的决策模型多想了 2109 秒,GPU 空闲多了 0.61 小时,活跃训练评测时间反而少了 1.27 小时。访问任务材料的密度变成 2.98 倍,查看代理评测脚本的密度 2.39 倍。最明显的变化是 LoRA 使用率:从显式任务下 24.1% 的运行飙到模糊目标下的 89.8%,33 个匹配对从不用 LoRA 转为使用,无一反向。工具调用次数反而降了(188.5 → 179.2)——也就是说智能体把更多时间花在了"想清楚要干什么"上,而不是"多干活"。
这个观察挺耐琢磨的。你想想看,人类拿到模糊目标的第一反应也是先琢磨"这到底要我干嘛",而不是立刻动手。智能体的行为模式居然对上了。
RQ2:权重演化——跑完流程 ≠ 得到提升
这是核心实验。Final-only 协议下,Qwen3.5-4B 和 Qwen3.5-9B 各自当自己的决策模型(Self 配置),6 个目标 × 2 次独立运行,共 24 个 run,每个 run 预算 40 GPU 小时,只能交一个最终检查点。
结果:24 个 run 里只有 3 个终态检查点超过基座。按两次均值算,4B 是 0/6,9B 是 1/6——唯一的亮点是 9B 在科学推理目标上从 45.33 涨到 48.00,多了 2.67 个点。宏平均上,4B 从 35.735 跌到 18.609,9B 从 39.010 跌到 25.640。要不是安全保留机制把 21/24 的 run 回滚到基座,最终成绩就是全面塌方。
几个细节特别扎心:
- 4B 数学 Run B 启动了 20 个训练作业、烧掉 26.57 GPU 小时,终分 0.159(基座 17.86)。9B 写作 Run B 16 个作业、30.53 GPU 小时,终分是 0。
- 9B 科学目标那两次"成功"的 run,各自答对 36/75 题,但答对集合只重叠 26 题,20 题对错翻转。聚合分数方向一致,题目级别却在剧烈抖动——这个"提升"的成色得打问号。
Adaptive-feedback 协议(30 个配置-目标单元,包括用 GPT-5.6 的 Luna/Terra/Sol 当外部决策模型指导 4B 基座)稍好一点,但也只是"好一点":28 个单元产出了已评测检查点,只有 2 个单元的最佳检查点超基线,其中唯一通过资格审核、回滚后仍保留的改进是 Terra 指导的数学目标,17.86 → 20.10。而且论文自己注明:这是反馈引导选择的证据,不是独立复现的能力增益。
搜索量和效果完全不成正比。Sol 产出最多——33 个已评测检查点、76.56 GPU 小时——无一超基线。说实话看到这个数的时候我愣了一下:更努力的搜索换来的是更稳定的失败。
RQ3:harness 演化——打不过人工工程基线
权重动不了,那不动权重、只演化智能体外壳(prompt、工具策略、工作流、记忆、验证逻辑)呢?运行时模型固定为 Qwen3.5-4B,参照系是原始 Qwen-Agent harness。
| 配置 | Task macro | Example micro |
|---|---|---|
| 原始 Qwen-Agent 参考 | 28.64 | 27.65 |
| GPT-5.6 Luna 的后继 harness | 19.32 | 18.33 |
| GPT-5.6 Terra 的后继 harness | 20.76 | 20.14 |
| GPT-5.6 Sol 的后继 harness | 27.22 | 25.97 |
最强的 Sol 后继还是差 1.42 个点。Qwen3.5-4B 自己当创建者时连一个有效 harness 都没产出来。
🔬 失败解剖:智能体到底错在哪
这部分是全文最值钱的。作者把轨迹翻了个底朝天,挖出三种典型死法。
数据错配。Qwen3.5-4B Self 在 30/32 次数据导入里用的都是 GSM8K 或 Hendrycks 数学数据——包括跑科学、逻辑、写作目标的 run。它大概觉得"数学数据=通用能力数据"。更夸张的是有 5 个提交的检查点是用数值标签版 MMLU 做 SFT 训出来的:21000 条训练目标全是单个数字,于是对应 279 条评测输出也全是单个数字,五次终分 0、0、0、6.141、0。模型学会了输出格式,完全不管题目在问什么。全部 2080 条最终评测输出都非空、无评测器故障——锅确实是训练数据的。
狭窄自验证。harness 演化里的 Luna 案例堪称教科书级翻车:它在自创的 8 项清单上从 7/8 刷到 8/8(手段是塞了个固定五段式研究答案模板),又在两个相似 prompt 上验证通过后,40 分钟就收工了。那个模板会把问机制、公式、工程细节的问题全重构为"研究设计"问题——自评满分,隐藏评测 task-macro 只有 19.32。自建代理指标上的收益,一点没迁移过去。
输出完整性盲区。Terra 更冤:它正确拒绝了会编造显著性结果的评审器,但最终 harness 留了另一个坑——计算器调用后如果最终响应为空,就提交工具调用前的部分草稿。一次受检执行里 2 道题触发,草稿分别 342 和 520 字符,分数从 75.00 砸到 2.57、从 52.33 砸到 2.91,一次执行约七成的分数下降就来自这两题。答案质量审查做得再好,也架不住管道里漏半截答案出去。
还有一个更隐蔽的现象:表观进步可能只是从训练致退化中恢复。22 个多检查点单元里 62 次连续转移,28 升 13 平 21 降。比如 4B Self 数学从 0.79 → 1.75 → 2.38 单调上升,看着在进步,但基座是 17.86——它只是在从自己挖的坑里往外爬。Terra 数学那个 20.10 的保留分之后,后代直接跌到 2.78 再爬回 18.17。持续优化本身会引发退化,所以检查点选择和回滚不是锦上添花,是保命装置。
论文结尾那句话点得很准:closing the training loop is not yet the same as closing the capability loop——闭合训练闭环,不等于闭合能力闭环。进步必须相对基座判断,而不是相对上一个检查点。
💡 我的判断
这篇论文我喜欢的地方和存疑的地方都挺明确。
喜欢的点:一是问题定义干净。把"目标操作化"从自我演化里单独拆出来作为研究对象,这个动作本身比基准更有价值——之前大家默认这部分由人类免费赠送,ASPIRE 把它摆上台面,才发现这是当前智能体最薄弱的一环。二是工程严谨度:密封评测、版本化 manifest、SHA-256 冻结、安全保留、轨迹级审计,这套东西让结论很难被"评测器有 bug"之类的借口稀释。三是失败分析不护短,数据错配、狭窄自验证这些案例写得非常具体,对做 agent 系统的人有直接的警示价值。
存疑的点:被演化对象只有 Qwen3.5-4B/9B 这个量级,权重演化的惨淡结论能不能推广到更强的基座?24 个 run 里 4B 全面崩盘,会不会部分是小模型自我指导能力不足的锅,而非范式本身的问题?论文也承认每个 adaptive-feedback 单元只跑了一次,统计功效有限。另外 Final-only 协议下智能体完全没反馈,这个设定有点极端——现实中很少有人在零反馈下盲训 26 个 GPU 小时还不调整策略,那批 0 分 run 有相当比例可以归因于协议本身而非智能体能力。
对工程的启发反而很实际:如果你在搭自我改进的 agent 系统,这篇论文告诉你三件事必须内置——训练数据与目标能力的对齐检查(别让写作目标吃数学数据)、独立于智能体自评的外部验证(自评满分大概率是代理指标被特化了)、强制回滚机制(持续搜索会抹掉早期改进,没有回滚就是裸奔)。这三条说起来朴素,但 24 个 run 的崩盘记录证明,当前没有一个智能体自己能做到。
最后说一句公允的话:ASPIRE 给出的不是"自我进化不可能"的判决书,而是一张现状体检表。模糊目标这个设定确实更贴近人类学习的真实形态,也把自我演化研究从"自动调参"拉向了"自主学习"的正题。这个方向值得跟进,但短期内别指望智能体自己悟出该学什么——那一步,目前还得人来。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我