只给一句"变得更强",模型能自己进化吗?Aspire 的答案挺扎心

这两年"自我进化"方向的论文满天飞,但仔细看你有没有发现一个共同前提:任务和指标都是人给的。人类把目标拆好、评测器写好,智能体只负责在固定轨道上优化——这不叫自我进化,这叫自动调参。

那如果把这层脚手架抽掉呢?只丢给智能体一句"提升你的科学推理能力",不告诉它考什么、怎么判分,让它自己决定学什么数据、用什么方法训、怎么验证自己真的变强了。这篇 arXiv 论文(2608.31111)就干了这个实验,名字叫 ASPIRE。结果说实话有点难看:智能体们训练闭环跑得挺欢,但 24 次权重演化只有 3 次超过基座,不少 run 训完分数直接腰斩。

核心摘要:现有 LLM 自我演化基准都把任务和评测显式给定,自我演化被退化成"优化一个显式目标"。ASPIRE 反其道而行,只给一个自然语言能力目标(比如"提升数学推理"),下游 520 道专家编写的评测题全部密封,要求智能体自己操作化目标——选数据、选训练方法、构建验证信号、决定何时评测。实验覆盖权重演化和 harness 演化两个表面,结论相当冷:当前智能体能跑完流程,但权重层面的提升稀少且不稳,最强的演化 harness 仍打不过人工设计的 Qwen-Agent 参考实现。这篇论文的价值不在提出新方法,而在于把"自我进化"这个被过度包装的概念拉回了地面——闭合训练闭环,离闭合能力闭环还差得远。


论文信息

  • 标题:Aspire: Can Models Self-Evolve from Vague Goals?
  • 链接:https://arxiv.org/abs/2608.31111
  • 核心作者:Yuhao Wu、Jingyuan Zhang、Jiajun Shi(Core Contributors);Yuhao Wu、Wenxuan Zhang、Shen Yan、Wenhao Huang、Ge Zhang(通讯作者)
  • 机构:ByteDance Seed、新加坡科技设计大学(SUTD)、M-A-P、TokenWave.AI
  • 项目主页:https://self-developing-agents.github.io/

🎯 为什么"模糊目标"是真问题

先讲清楚论文里的"vague goal"到底指什么。不是含糊其辞,而是一个还没被操作化成固定任务和指标的宽泛能力方向——就像导师跟你说"把研究能力搞上去",既没告诉你做哪道题,也没告诉你用什么考试。

人类学习天然是这种形态。想"成为更好的物理学家",你得自己解释目标、诊断能力缺口、决定怎么学、还得判断自己到底有没有进步。这里其实有三个耦合的决策:改进什么、怎么改进、怎么验证改进

而现有的自我演化工作——PostTrainBench、SEAL、Evo-Memory 这些——只解决了中间那个。任务格式、难度锚点、指标、成功标准全都由人类预置,智能体的搜索空间被压缩到只剩"怎么改进"。说实话,我之前看这类论文的时候就有个隐约的别扭感:这更像超参搜索的自动化,离"自我"两个字差得远。ASPIRE 把这个别扭感正式提了出来。

论文还借了个挺有意思的概念:forward-deployed engineer(FDE),Palantir 推广的那种部署工程师角色。真实部署里天然缺三层东西——目标是模糊的、反馈信号不可靠、执行系统还不存在。ASPIRE 聚焦第一层:智能体能不能自己把模糊目标翻译成可训练、可验证的东西。

图1:从显式任务优化到模糊目标驱动的自我演化

图1:两种范式的对比。(a) 显式任务设定下,人类定义好任务格式、难度锚点、指标和成功标准(WHAT),智能体只搜索怎么改进(HOW);(b) 模糊目标设定下,人类只给一个宽泛方向,智能体必须自己诊断缺口、分解子目标、构建学习信号,同时决定 WHAT 和 HOW。关键差异在右边:模糊目标下智能体自建代理指标(竞赛题、证明题)上的收益,未必能迁移到密封的隐藏评测上——这正是整个基准要检验的核心。

🏗️ ASPIRE 基准:六个目标,520 道密封题

基准设计上有几个地方我觉得做得相当讲究。

六个能力目标全部以自然语言给出,下游评测项完全隐藏:

模糊目标 评测项数
科学与学术推理 75
人文与社会科学知识 110
健康与医学推理 100
数学推理 126
逻辑、可靠性与指令遵循 89
学术与科学写作 20(顶层任务包)
合计 520

评测集是领域专家从零写的,GPQA、MMLU-Pro、MedQA 只用来参考题型和难度,一道题都没抄。质控流程包括独立评审、盲法多模型难度校准(让 Seed-2.0、GPT-5.2、Gemini-3 独立作答,按失败模型数标 L0–L3 难度)、去重、与参考基准的重叠审计。评测集冻结在带 SHA-256 的版本化 manifest 里,跑实验中途不换版本。这种工程严谨度在学术基准里不算常见。

信息边界做得也狠:智能体看不见评测题、参考答案、评分细则,注册的训练数据还要过一道与隐藏集的重叠门检。评测只返回聚合分数和剩余查询额度。反馈协议分两档——Adaptive-feedback 允许有界次数的聚合分查询(稀疏黑盒通道),Final-only 则一个中间分都不给,最后交一个检查点评一次。

图3:极简交互环境与结果协议

图3:系统架构。智能体(左侧)负责战略决策:解释目标、选数据和学习信号、定超参、决定分支或停止;它通过统一工具接口调用类型化动作——数据动作(搜索/下载/合成)、训练动作(SFT/GRPO/LoRA)、循环动作(状态查询/自评/停止)。控制器把工具调用映射到受管后端,强制执行预算、隔离、审计和安全保留。右侧是测量的两条路:智能体自建的验证(可能误导下一步)与控制器专属的隐藏评测(题目、细则、评审轨迹全部保密)。底部是 harness 演化的副路径:编辑 prompt/工具策略/工作流后冻结版本,再做事后对比。

智能体不需要操作 shell、不用下载训练仓库、不用实现分布式执行——这些全被控制器接管。信任边界划得很清楚:智能体做决策,控制器管凭证、存储、作业调度、预算和谱系约束。无效或伪造的工件进不了评分谱系。

还有一个设计叫安全保留(safe retention):只有当提交的终态检查点分数严格高于基座时才保留,否则回滚。也就是说报告的"保留改进"天然非负——这是选择机制的结果,不是每次更新都有效的证据。这个细节后面会很重要。

🧪 实验:三组问题,答案一个比一个冷

RQ1:把显式任务换成模糊目标,会怎样?

作者先做了个对照实验:拿 PostTrainBench 的原有任务评测器不动,只把显式的基准标识符换成宽泛的能力描述,让 Claude Opus 4.8 和 GPT-5.6 跑。

任务 Claude 官方分 Claude 模糊目标 GPT-5.6 官方分 GPT-5.6 模糊目标
AIME 2025 10.83 5.83 7.50 3.75
GPQA Main 28.35 24.89 30.13 27.04
HealthBench 31.68 12.62 27.39 9.93
HumanEval 47.33 56.63 63.95 56.40
GSM8K 68.87 66.98 69.48 74.35
ArenaHard 36.09 13.07 26.40 21.72
BFCL 47.13 58.63 94.38 79.38
加权平均 32.90 27.07 36.23 29.58

加权平均掉了 5-7 个点。HealthBench 最惨,Claude 从 31.68 跌到 12.62。有意思的是少数任务模糊目标反而更高——Claude 在 HumanEval 和 BFCL 上反超,GPT-5.6 在 GSM8K 上反超。说明模糊目标不是单纯的性能削弱,而是重定向了搜索努力

轨迹分析证实了这一点:模糊目标下,Claude 的决策模型多想了 2109 秒,GPU 空闲多了 0.61 小时,活跃训练评测时间反而少了 1.27 小时。访问任务材料的密度变成 2.98 倍,查看代理评测脚本的密度 2.39 倍。最明显的变化是 LoRA 使用率:从显式任务下 24.1% 的运行飙到模糊目标下的 89.8%,33 个匹配对从不用 LoRA 转为使用,无一反向。工具调用次数反而降了(188.5 → 179.2)——也就是说智能体把更多时间花在了"想清楚要干什么"上,而不是"多干活"。

这个观察挺耐琢磨的。你想想看,人类拿到模糊目标的第一反应也是先琢磨"这到底要我干嘛",而不是立刻动手。智能体的行为模式居然对上了。

RQ2:权重演化——跑完流程 ≠ 得到提升

这是核心实验。Final-only 协议下,Qwen3.5-4B 和 Qwen3.5-9B 各自当自己的决策模型(Self 配置),6 个目标 × 2 次独立运行,共 24 个 run,每个 run 预算 40 GPU 小时,只能交一个最终检查点。

结果:24 个 run 里只有 3 个终态检查点超过基座。按两次均值算,4B 是 0/6,9B 是 1/6——唯一的亮点是 9B 在科学推理目标上从 45.33 涨到 48.00,多了 2.67 个点。宏平均上,4B 从 35.735 跌到 18.609,9B 从 39.010 跌到 25.640。要不是安全保留机制把 21/24 的 run 回滚到基座,最终成绩就是全面塌方。

几个细节特别扎心:

  • 4B 数学 Run B 启动了 20 个训练作业、烧掉 26.57 GPU 小时,终分 0.159(基座 17.86)。9B 写作 Run B 16 个作业、30.53 GPU 小时,终分是 0。
  • 9B 科学目标那两次"成功"的 run,各自答对 36/75 题,但答对集合只重叠 26 题,20 题对错翻转。聚合分数方向一致,题目级别却在剧烈抖动——这个"提升"的成色得打问号。

Adaptive-feedback 协议(30 个配置-目标单元,包括用 GPT-5.6 的 Luna/Terra/Sol 当外部决策模型指导 4B 基座)稍好一点,但也只是"好一点":28 个单元产出了已评测检查点,只有 2 个单元的最佳检查点超基线,其中唯一通过资格审核、回滚后仍保留的改进是 Terra 指导的数学目标,17.86 → 20.10。而且论文自己注明:这是反馈引导选择的证据,不是独立复现的能力增益。

搜索量和效果完全不成正比。Sol 产出最多——33 个已评测检查点、76.56 GPU 小时——无一超基线。说实话看到这个数的时候我愣了一下:更努力的搜索换来的是更稳定的失败。

RQ3:harness 演化——打不过人工工程基线

权重动不了,那不动权重、只演化智能体外壳(prompt、工具策略、工作流、记忆、验证逻辑)呢?运行时模型固定为 Qwen3.5-4B,参照系是原始 Qwen-Agent harness。

配置 Task macro Example micro
原始 Qwen-Agent 参考 28.64 27.65
GPT-5.6 Luna 的后继 harness 19.32 18.33
GPT-5.6 Terra 的后继 harness 20.76 20.14
GPT-5.6 Sol 的后继 harness 27.22 25.97

最强的 Sol 后继还是差 1.42 个点。Qwen3.5-4B 自己当创建者时连一个有效 harness 都没产出来。

🔬 失败解剖:智能体到底错在哪

这部分是全文最值钱的。作者把轨迹翻了个底朝天,挖出三种典型死法。

数据错配。Qwen3.5-4B Self 在 30/32 次数据导入里用的都是 GSM8K 或 Hendrycks 数学数据——包括跑科学、逻辑、写作目标的 run。它大概觉得"数学数据=通用能力数据"。更夸张的是有 5 个提交的检查点是用数值标签版 MMLU 做 SFT 训出来的:21000 条训练目标全是单个数字,于是对应 279 条评测输出也全是单个数字,五次终分 0、0、0、6.141、0。模型学会了输出格式,完全不管题目在问什么。全部 2080 条最终评测输出都非空、无评测器故障——锅确实是训练数据的。

狭窄自验证。harness 演化里的 Luna 案例堪称教科书级翻车:它在自创的 8 项清单上从 7/8 刷到 8/8(手段是塞了个固定五段式研究答案模板),又在两个相似 prompt 上验证通过后,40 分钟就收工了。那个模板会把问机制、公式、工程细节的问题全重构为"研究设计"问题——自评满分,隐藏评测 task-macro 只有 19.32。自建代理指标上的收益,一点没迁移过去。

输出完整性盲区。Terra 更冤:它正确拒绝了会编造显著性结果的评审器,但最终 harness 留了另一个坑——计算器调用后如果最终响应为空,就提交工具调用前的部分草稿。一次受检执行里 2 道题触发,草稿分别 342 和 520 字符,分数从 75.00 砸到 2.57、从 52.33 砸到 2.91,一次执行约七成的分数下降就来自这两题。答案质量审查做得再好,也架不住管道里漏半截答案出去。

还有一个更隐蔽的现象:表观进步可能只是从训练致退化中恢复。22 个多检查点单元里 62 次连续转移,28 升 13 平 21 降。比如 4B Self 数学从 0.79 → 1.75 → 2.38 单调上升,看着在进步,但基座是 17.86——它只是在从自己挖的坑里往外爬。Terra 数学那个 20.10 的保留分之后,后代直接跌到 2.78 再爬回 18.17。持续优化本身会引发退化,所以检查点选择和回滚不是锦上添花,是保命装置。

论文结尾那句话点得很准:closing the training loop is not yet the same as closing the capability loop——闭合训练闭环,不等于闭合能力闭环。进步必须相对基座判断,而不是相对上一个检查点。

💡 我的判断

这篇论文我喜欢的地方和存疑的地方都挺明确。

喜欢的点:一是问题定义干净。把"目标操作化"从自我演化里单独拆出来作为研究对象,这个动作本身比基准更有价值——之前大家默认这部分由人类免费赠送,ASPIRE 把它摆上台面,才发现这是当前智能体最薄弱的一环。二是工程严谨度:密封评测、版本化 manifest、SHA-256 冻结、安全保留、轨迹级审计,这套东西让结论很难被"评测器有 bug"之类的借口稀释。三是失败分析不护短,数据错配、狭窄自验证这些案例写得非常具体,对做 agent 系统的人有直接的警示价值。

存疑的点:被演化对象只有 Qwen3.5-4B/9B 这个量级,权重演化的惨淡结论能不能推广到更强的基座?24 个 run 里 4B 全面崩盘,会不会部分是小模型自我指导能力不足的锅,而非范式本身的问题?论文也承认每个 adaptive-feedback 单元只跑了一次,统计功效有限。另外 Final-only 协议下智能体完全没反馈,这个设定有点极端——现实中很少有人在零反馈下盲训 26 个 GPU 小时还不调整策略,那批 0 分 run 有相当比例可以归因于协议本身而非智能体能力。

对工程的启发反而很实际:如果你在搭自我改进的 agent 系统,这篇论文告诉你三件事必须内置——训练数据与目标能力的对齐检查(别让写作目标吃数学数据)、独立于智能体自评的外部验证(自评满分大概率是代理指标被特化了)、强制回滚机制(持续搜索会抹掉早期改进,没有回滚就是裸奔)。这三条说起来朴素,但 24 个 run 的崩盘记录证明,当前没有一个智能体自己能做到。

最后说一句公允的话:ASPIRE 给出的不是"自我进化不可能"的判决书,而是一张现状体检表。模糊目标这个设定确实更贴近人类学习的真实形态,也把自我演化研究从"自动调参"拉向了"自主学习"的正题。这个方向值得跟进,但短期内别指望智能体自己悟出该学什么——那一步,目前还得人来。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我