当智能体开始"互相卷":一篇综述把 Agent 的协同进化讲透了
你有没有发现一个挺拧巴的现象:我们花大力气训练一个会自我改进的 Agent,部署上线之后它确实在进步,但进步着进步着就停了——任务还是那些任务,反馈还是那套反馈,它把自己的学习上下文"刷穿"了,然后就撞上一个看不见的天花板。
这个问题在生物学里有个很漂亮的对应物,叫红皇后效应(Red Queen effect):物种必须不断进化,才能仅仅维持相对位置不变,因为你的对手也在进化。单侧的适应注定会撞上平台期,只有相互适应才能让进步持续下去。
这周读到一篇新鲜出炉的综述(arXiv:2608.10299,2026 年 8 月 10 日提交),把这个问题彻底摊开来讲了。说实话我第一反应是"又一篇 self-evolving agent 综述"——这个题材今年已经被写烂了。但读完发现不一样:之前那些综述大多把"协同进化"当作自我进化的一个子章节,而这篇是第一次把协同进化(co-evolution)本身作为组织轴,提出一个渐进式三阶段框架,讲清楚 Agent 系统如何一步步甩掉人类工程师焊死在它身上的约束。对于正在做 Agent 自我改进、多智能体训练或者在线学习系统的人来说,这篇值得放进收藏夹。
📖 核心摘要
这篇综述要解决的核心问题是:单体自我进化的 Agent 为什么总会遇到天花板?作者的回答是——因为它的学习环境是静态的。固定任务、固定反馈、固定交互空间,就像一个永远只做同一套题库的考生,分数再高也只是过拟合了这套题。论文提出一个渐进式三阶段分类法:阶段一 Agent–Agent 协同进化(智能体之间互相施加进化压力)、阶段二 Agent–Environment 协同进化(任务、反馈、交互空间跟着智能体一起变)、阶段三 Meta 协同进化(连"怎么进化"这件事本身也交给系统去进化)。作者还做了一件综述里很少见的事:跨论文收集证据,用一张图量化展示协同进化相比冻结对手确实能涨分(比如 SEAL 从 35.8 到 40.2),但也诚实地指出收益会随进化推进而递减。这篇的定位很清晰——它不是方法论文,而是一张地图 + 一份问题清单,值钱的地方在于分类的洁癖和对"什么算真正的协同进化"的严格定义。
论文信息
- 标题:Co-Evolution in Agentic Systems: Toward Self-Directed Evolution Beyond Human Design
- 作者:Qing Zong, Jiayu Liu, Junhao Shen, Zecong Tang, Linsi Wu, Yuxuan Liu, Rui Wang, Zhaowei Wang, Weiqi Wang, Cheng Qian, Xiusi Chen, Yangqiu Song
- 机构:香港科技大学、UIUC、香港中文大学、香港大学、北京大学
- 链接:https://arxiv.org/abs/2608.10299
- 提交时间:2026 年 8 月 10 日
🎯 问题动机:自我进化为什会"卡壳"
先聊聊背景。过去一年"自我进化智能体"(self-evolving agent)这个方向火得不行,相关的综述也出了好几篇。但作者指出一个观察角度的缺失:这些综述把协同进化当作自我进化底下的一个小分类,而没有意识到它可能是整个故事的主线。
什么叫单体自我进化的天花板?论文里 Figure 1 画得很形象。

图1:左边是单体自我进化——一个机器人被关在固定交互空间的"机器"里,任务和反馈都被锁死(注意 Task 和 Feedback 盒子上的挂锁),进步曲线冲向平台期(Plateau)后躺平,机器人一脸生无可恋。右边是多组件协同进化——两个机器人在浮岛上互相施加压力,任务卡片在变化、反馈仪表在调整、交互空间沿着绿色箭头不断向上扩张。同样是"进化",右边的系统在成长的同时,它的"考题"和"评分标准"也在跟着长。
这张图其实把整篇综述的论点说完了:进步被锁住的根源不在智能体本身,而在它所处的学习上下文是死的。红皇后效应告诉我们,持续进步需要相互适应——你的对手在变强,你才必须继续变强。一旦对手被冻结,进化就退化成有限集上的优化,收敛到平台期只是时间问题。
那"协同进化"到底怎么严格定义?这是我觉得这篇综述最有洁癖的地方。很多论文里两个 Agent 交换一下信息、互相给个反馈,就敢说自己"co-evolve"了。作者直接立了规矩:协同进化要求至少两个进化单元联合适配,并持续重塑彼此后续的进化。形式化地说,两个单元 \(x\) 和 \(y\) 要同时满足 \(x^{(t+1)} \neq x^{(t)}\)、\(y^{(t+1)} \neq y^{(t)}\),并且二者之间存在进化压力(evolutionary pressure)。光聊天不算,光交互不算,必须互相改变对方接下来的进化轨迹才算。
另外几个定义也值得记住,因为后文全靠它们支撑:
- Agentic System:\(S = (A, E)\),智能体集合加环境。
- Agent:统一建模为 \(a_i = (m_i, h_i)\)——模型骨干(backbone)加脚手架(harness,包括记忆、工具、技能、提示词、工作流)。共享同一个骨干但 harness 角色不同的,算不同智能体。Agent 进化的判定:\(\Delta a_i \neq 0 \iff (\Delta m_i \neq 0) \lor (\Delta h_i \neq 0)\)。这个定义很务实——现在很多"进化"其实不动权重,只改 harness,也算数。
- 智能体集合:\(A = (\{a_1, \dots, a_n\}, \Pi)\),其中 \(\Pi\) 编码角色分配、通信拓扑、分工。组织结构变了,集合也算进化了。
- 进化机制:\(\Omega\) 驱动状态转移 \(S^{(t+1)} = \Omega(S^t, \tau^t)\),规定进化什么、何时触发、如何生成变体、在哪里发生、如何评估。
这套形式化不复杂,但把"谁在变、什么在变、怎么算变"钉死了,后面整个分类法才能站得住。
🧠 方法核心:渐进式三阶段分类法
整篇综述的骨架是一个三阶段分类法。它的组织逻辑不是按任务、不是按技术路线,而是按进化自由度的边界——系统被允许改变的东西一步步变多,人类焊死的约束一条条被拆掉。

图2:三阶段框架的全景。Stage 1(Agent–Agent)里只有智能体在变——骨干、脚手架、组织结构,环境上还挂着一把"人类固定"的锁。Stage 2(Agent–Environment)里环境构件加入进化名单:任务、反馈、交互空间都和智能体一起变。Stage 3(Meta Co-Evolution)里连进化机制 \(\Omega\) 本身也进了进化范围,底下五个决策维度 what、when、how、where、evaluation 全部交给系统自己决定。一条"进化自由度边界扩张"的箭头贯穿三个阶段。
这个视角我觉得挺聪明的。之前的分类要么按"进化什么组件"平铺(改权重的、改记忆的、改工具的……),要么按"单智能体 vs 多智能体"切。而这篇问的是一个更本质的问题:哪些东西还不允许变?答案从"环境和机制"到"只剩机制"再到"什么都不剩",三个阶段自然浮现。
阶段一:Agent–Agent 协同进化
环境固定,进化压力来自同伴。形式化:\(A^{(t+1)} = \Omega(A^t, E, \tau^t)\)。每个智能体进步的主要来源,是周围那群也在进步的家伙。这个阶段又分三支。
对抗性智能体(Adversarial Agents)。对立目标互相碾压,一方变强直接抬高对方的难度。这条线的祖师爷是 GAN——生成器和判别器互相逼出来的画质,至今仍是协同进化最经典的案例。具身控制里有 RARL(对抗扰动力训练鲁棒策略)、格斗游戏和捉迷藏里涌现工具使用的自我对弈。到了 LLM 时代,这条线最热的落点是安全:攻击者 Agent 生成越狱提示,防御者 Agent 学拒绝,两边一起训练——ACE-Safety 用 MCTS 搜攻击、AdvGRPO 用 GRPO 联合训攻防、Self-RedTeam 把红队和防御合并成一个自我对弈角色、ARLAS 还把战场扩展到工具调用场景(把有害指令藏进工具输出里)。成对之外还有多源对抗:AlphaStar 的联赛训练用 exploiters 专攻主力策略的弱点,还要打历史版本防遗忘;TriPlay-RL 让攻击者、防御者、评估者三角共进化;AdvEvo-MARL 让攻击者对抗整个 Agent 团队,把安全性内建进群体。
协作性智能体(Collaborative Agents)。共享目标下一起变强。平行协作一支从 MARL 时代就有积累(MADDPG、COMA、平均场),LLM 时代的新玩法是从协作过程本身提取压力——CoMAS 和 MAPoRL 从讨论交互里挖奖励信号(比如某一轮是否纠正或说服了后续回复),CORAL 让跨工作空间的智能体通过共享记忆扩散技能,GEA 干脆以群体为进化单元。角色分化协作一支的典型是"生成–修订"循环:CORY 的 pioneer 答题、observer 修订,还定期交换角色;RL Tango 让生成器和验证器共同强化;WaltzRL 把对话智能体和批评智能体联合训练。按能力分工的还有 EvoScientist(研究员 + 工程师)、SiriuS(物理学家、数学家、总结者等领域专家)。
进化中的智能体组织(Evolving Agent Organizations)。再进一步,连组织结构本身也参与进化:R3DM 从行为中发现角色并与策略共同适配,SkillMAS 联合更新技能与团队结构,MetaAgent-X 把工作流设计器和执行器端到端一起训。
阶段二:Agent–Environment 协同进化
阶段一里环境是死的,这直接限制了智能体能遇到的新经验。阶段二把环境也拉进进化循环:\((A^{(t+1)}, E^{(t+1)}) = \Omega(A^t, E^t, \tau^t)\)。智能体的行为开始反过来重塑塑造它自己的条件。同样分三支。
任务空间协同进化(Task-Space)。环境适配"智能体接下来该解什么题"。轻的做法是曝光与选择——任务池固定,只调度你看什么:课程学习按进度调采样权重、优先级别重放、基于后悔值的任务选择、PORTAL 挑通向困难目标的中间任务、SEAD 让模拟用户画像随服务 Agent 变强而变得更难缠。重的做法是自适应任务生成——直接把新任务生成在能力前沿附近:Agent0、AgentFrontier 按成功率校准难度,SENTINEL 和 CoEvolve 把失败的 rollout 转成新任务,Search Self-Play 和 Dr. Zero 生成多跳可验证的搜索题,MobileForge、SEAgent、WebRL、EvoCUA 在 GUI 和计算机使用场景造题,Socratic-SWE 从解决轨迹里构建仓库修复任务,RLAnything 更是联合重写任务、策略和奖励。
反馈空间协同进化(Feedback-Space)。环境在"怎么评判你"这件事上一起进化。偏好驱动一支从 Christiano 等人的偏好比较学习出发,到 PEBBLE(奖励模型变了就重标定回放缓冲区)、DUO(专挑奖励分歧大的行为配对)。结果驱动一支用 LLM 自己设计奖励函数(Eureka、REvolve)、奖励与策略共同搜索(ROSKA、LaRes)、从执行失败进化出单元测试和验证器(CURE、CoEvoSkills)。一致性增强一支的思路是"别让反馈源骗你":R* 要多个批评家达成一致才更新奖励参数,ARCO 要求步骤评分累加必须等于最终结果,ECHO 只有当建议真的改善了策略才更新诊断评论家。
交互空间协同进化(Interaction-Space)。适配"智能体在哪里行动"。可执行世界构建一支有 POET(环境–智能体对种群共同进化)、ADR(随策略改进扩大域随机化)、OMNI-EPIC(按"有趣性"过滤新环境)、XLand、AI Economist(连税收政策都学);基于模型的世界构建一支用共同进化的世界模型替代真实环境——WebEvolver 共同训练 web 世界模型和策略,DreamGym 合成经验,VLAW 让视频世界模型和策略互相促进。
阶段三:Meta 协同进化
到阶段二为止,进化机制 \(\Omega\) 还是人类设计的——系统能改变内容,但改变不了"内容如何变化"。阶段三把最后一道锁也打开:让低层协同进化系统通过自我生成的修订过程 \(\Gamma\) 修订自己的进化机制:
这一层递归就是通往开放性(open-endedness)的门票:持续新颖性(\(\Omega^{(t+1)} \neq \Omega^t\))加上无界发散。作者把进化机制拆成五个自适应决策维度——进化什么(what)、何时进化(when)、如何进化(how)、在何处进化(where)、如何评估(evaluation)。
但这里作者立了一个很严的判定标准:机制修订必须由低层协同进化生态系统的联合轨迹诱发,并且必须随后真的改变该生态系统的进化条件。按这个标准,PromptBreeder、Gödel Agent、HyperAgents、MemEvolve、SIA 这些只能算"单实体前驱"——它们让进化机制可进化,但底下没有一个多组件协同进化系统在跑。真正够格阶段三的,作者只点了 RQGM(Red Queen Gödel Machine)一家:共同进化任务智能体和评估器,元智能体利用联合反馈引导后续进化。作者在 Limitations 里也坦白:这个阶段的工作目前少得可怜。
这种"自己定的标准把绝大多数相关工作拦在门外"的做法,我其实挺欣赏的。宁可让分类空着,也不灌水。
📊 论文全景与跨论文证据
综述类论文最容易犯的毛病是"分类很好看,但证据全靠嘴"。这篇做了个不一样的东西——Figure 4,跨论文证据图。先把全景图放出来。

图3:论文全景图,横轴是 2017 到 2026 年的时间线,纵向上 Stage 1(Agent–Agent,蓝色系)和 Stage 2(Agent–Environment,绿色系)的工作密密麻麻,不同颜色对应对抗、协作、组织进化、任务空间、反馈空间、交互空间等子类。右侧 Stage 3 孤零零地挂着——单实体 meta-evolution 前驱(PromptBreeder、Gödel Agent、MemEvolve、SIA 等)之外,真正达标的只有 RQGM。整张图视觉上就是一句话:前两阶段已经卷成红海,第三阶段还是荒原。
然后是那张证据图。

图4:三个 Panel。Panel A 对比同一篇论文里"冻结对手"和"进化对手"两种设置的成绩:CoVerRL 从 33.4 到 36.9,GenEnv 从 40.8 到 45.8,SEAL 从 35.8 到 40.2,RLAnything 从 40.7 到 43.1,MAGIC 从 76.6 到 80.7,WaltzRL 从 91.3 到 94.7——全部正向。Panel B 把不同论文按阶段画在"匹配静态 vs 进化设置的平均分提升"散点上,GenEnv、SEAL、MAGIC、CoVerRL、RLAnything、WaltzRL 都有稳定的增益。Panel C 把 8 条进化轨迹归一化后叠在一起(mean 加跨论文标准差),曲线整体上扬但斜率逐渐放缓——进化越到后期,收益越薄。
说实话,看到 Panel A 的时候我停了一下。这几个数字的口径是"同一篇论文内部、冻结 vs 进化对手的对照",这比跨论文横向比较有说服力得多——因为每对数字共享同一套任务和测试设置,唯一变量就是"对手(或环境组件)有没有在一起进化"。六对数字全部为正,说明协同进化压力带来的增益不是个别系统的运气。
但 Panel C 也诚实地泼了冷水:归一化后的 8 条轨迹都在涨,可涨幅随进化进程递减。协同进化不是永动机,它推迟平台期,但似乎没能消灭平台期。这个观察其实给阶段三埋下了合理的动机——当进化内容本身趋于饱和,也许只有让进化机制也动起来,才能继续打开新空间。不过要注意,这个推断目前更多是愿景而非结论,原文也是这个态度。
⚠️ 开放挑战:评估、扩展、安全
论文第六章列了三个挑战,我觉得这部分对做工程的人最有用。
动态评估(Dynamic Evaluation)。现有基准——τ-bench、WebArena、SWE-bench、OSWorld 这批——测的都是"最终能力",测不了"进化过程"。协同进化系统的评估至少要回答三件事:所有进化组件是不是都在变好?收益能不能迁移到没见过的伙伴和环境?每个组件对联合进步的贡献是多少?更要命的是特有的失败模式:任务成功率上涨可能掩盖了评估器剥削(evaluator exploitation,学会骗过评分器)、伙伴过拟合(partner overfitting,只会跟固定陪练打)、多样性坍塌(diversity collapse,种群收敛到单一策略)。作者建议把固定基准和过程级测试结合起来——历史交叉对弈、组件消融、留出评估器。这个清单对正在搭 self-play 训练管线的人来说,基本可以直接抄。
扩展协同进化(Scaling Co-Evolution)。现在的系统大多只跑局部循环:攻击者–防御者、策略–奖励、智能体–任务生成,两两配对。未来的方向是让智能体、harness、环境同时变。难点不在于"让更多组件可自适应",而在于决定哪些该变、各组件的更新怎么互相影响、怎么保持进化压力富有成效而不是失稳或被单一组件主导。这个问题说实话目前没有好的答案,Meta 协同进化算是个开头——把进化决策也交给系统自己。
安全与治理(Safety and Governance)。进化自主性越强,人类越容易失去对系统行为的理解。进化中的智能体可能发展出超出人类监控能力的攻击策略、工具使用模式、通信协议——比如隐蔽串谋和隐写术——或者涌现组织层面的行为。到 Meta 协同进化阶段风险更尖锐,因为系统连"哪些行为被奖励和保留"都能改。作者给的治理方向是:沙盒化部署、持续监控、可回滚到已验证状态、保留人类干预点。都是很对的废话——作者在 Limitations 里自己也承认,这部分停在期望层面,没有给出可操作的协议。坦率是坦率,但这块确实是整个领域共同的短板。
🤔 我的判断
这篇综述值不值得读?我的答案是:如果你在碰 Agent 自我改进、self-play、自动课程、环境生成任何一个方向,值得花一个小时。
亮点有三个。其一,定义的洁癖。"光交互不算协同进化,必须互相重塑对方的进化轨迹"——这一条直接把一大批蹭概念的论文挡在门外,也让阶段三那个几乎空着的格子显得格外诚实。其二,分类的组织轴选得好。"进化自由度边界"比"按组件平铺"高了一个抽象层级,三个阶段之间有真正的逻辑递进关系,而不是并列罗列。其三,Figure 4 的跨论文证据。综述肯花力气做定量证据聚合的太少见了,虽然 Panel C 的归一化方法细节在附录里、样本只有 8 条轨迹,统计功效有限,但这个姿态本身值得鼓励。
槽点也有。阶段三基本是"一个半工作撑一个阶段"——RQGM 加一堆前驱,拿这么大的篇幅立一个格子,多少有点为了框架完整性而存在的味道。另外把 GAN 和 AlphaStar 这些"前 LLM 时代"的工作收编进来,历史脉络是完整了,但严格说这些系统里并没有 LLM Agent 意义上的 harness 进化,算不算同一物种的协同进化,可以争一争。还有就是安全治理那章,列的都是正确方向,但没有任何一条给出了可验证的机制设计——这不是这篇论文独有的问题,是整个领域都还没想明白的事。
工程上的启发,我会带走三条。第一,搭自我改进系统时,先问自己"我的系统里还有哪些东西是被我焊死的"——任务池、评分器、交互环境,每焊死一个就是给进化设一个天花板。第二,如果你在做 self-play 或攻防训练,评估的时候务必留"冻结对手"对照组和留出评估器,不然成功率上涨可能只是评估器被剥削了。第三,多样性监控要做成一等公民指标,多样性坍塌比性能不涨更隐蔽、更致命。
顺着上面再追问一句:Panel C 那条收益递减的曲线,究竟是协同进化的宿命,还是只是"还没进化到进化机制"的暂时现象?如果 RQGM 这类工作接下来一两年真的多起来,我们就有数据回答了。这篇综述最大的价值,可能就是给这个问题立好了坐标系。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我