RSIAgent: 先广后深自主探索的免训练递归自我改进

  • 论文标题: RSIAgent: Autonomous Exploration for Recursive Self-improvement in New Environments
  • arXiv ID: 2609.15364(2026 年 9 月 14 日提交,49 页)
  • 作者: Sibo Zhu, Shicheng Fan, Xinyue Wang, Wenyi Wu, Kun Zhou, Biwei Huang
  • 主题分类: cs.AI / cs.CL / cs.CV

一、一句话概括

RSIAgent 是一个完全不更新模型参数的多智能体框架:让"课程智能体出题 → 执行智能体干活 → 验证智能体验收"形成递归循环,在新环境中先广度后深度地自主探索,把验证过的经验(含动作—条件—后果的因果关系)固化成可复用记忆,测试时冻结记忆直接复用——最终让开源模型 Kimi-K3 和 GLM-5.3 在 OSWorld 2.0 和 Agents' Last Exam 上超越 GPT-6 Astra 等前沿闭源模型

RSIAgent 总览

Figure 1: (a) 无需任何金标签或人类监督,RSIAgent 通过递归的"课程—执行—验证"循环自主探索并适应新环境;(b) RSIAgent 使开源模型在 OSWorld 2.0 (78.98) 和 ALE (84.82) 上超越 GPT-6 Astra (72.60 / 82.26) 等闭源前沿模型。

二、研究动机与问题定义

数字智能体(digital agents)常常需要适应预训练模型未充分覆盖的新环境——陌生的界面、工具和失败模式。现有适应方法通常要收集额外交互数据再训练,往往还需要人工辅助,成本高且难以用于私有或持续变化的环境。

RSIAgent 的灵感来自人类学习新软件的过程:先决定学什么 → 与环境交互收集经验 → 从结果中蒸馏知识。作者指出这一过程本质上是一种因果发现(causal discovery):通过主动尝试不同动作并观察后果,推断哪些因素决定成功、失败与状态转移。

形式化定义:给定任务指令 \(q\),智能体与环境 \(\mathcal{E}\) 通过动作序列 \(a_1,\dots,a_T\) 交互。第 \(t\) 步,智能体 \(\pi_\theta\) 基于持久记忆 \(M\) 和交互历史 \(h_t=(o_0,a_1,\dots,a_{t-1},o_{t-1})\) 生成可执行动作:

\[a_t \sim \pi_\theta(\cdot \mid q, h_t, M), \qquad (s_t, o_t) \sim \mathcal{E}(\cdot \mid s_{t-1}, a_t)\]

其中 \(s_t\) 是环境底层状态(可能对智能体不可见),\(o_t\) 是观测。交互历史在任务切换时重置,而持久记忆 \(M\) 跨任务保留。动作采用 code-as-policy 形式——每个动作是可执行的 Python/Bash 程序,为 GUI 应用等异构软件提供通用控制接口。

核心问题:在不更新参数的前提下,设计探索策略使其能 (1) 高效识别有信息量的经验;(2) 用可靠环境反馈落地验证;(3) 将持续获得的知识巩固进记忆。

三、方法:RSIAgent 框架

3.1 三智能体递归循环

角色 职责 关键约束
Curriculum Agent(课程者) 高层协调者,决定下一步探索什么;根据当前目标、已累积记忆和既往结果生成练习任务(先决技能、有信息量变体、失败驱动练习、压力测试) 只能看记忆的一次性副本,不给候选打分、不编辑规范记忆
Actor Agent(执行者) 主策略模型,生成可执行动作;维护可进化的持久记忆(环境知识、可复用过程/脚本、失败教训) 验证落地后自行蒸馏经验并巩固进记忆,更新被后续实例继承
Verifier Agent(验证者) 独立评估者,直接检查环境反馈(执行结果、界面状态等可观测证据),返回 PASS/FAIL 及支持性反馈 与 actor 的私有推理和记忆隔离,减少相关性错误

三者的角色信息边界被严格划分:actor 看到任务指令、执行反馈和可用记忆;verifier 只看任务要求和候选环境(actor 的记忆、推理、日志对其隐藏);curriculum 能看到目标查询、已完成探索结果和 actor 的学习诊断,但无权改记忆。

3.2 Broad-then-Deep 两阶段探索

类比现代 LLM 的"预训练 → 后训练"范式,RSIAgent 把探索分成"先广后深"两阶段,但全程发生在智能体层面的推理时,而非权重层面。

RSIAgent 框架(FreeCAD 任务示例)

Figure 2: 以 FreeCAD 任务为例的框架总览。左:BRS 通过并行多组任务获取多样化经验;中:DRS 逐轮加深(锚定销 → 对齐孔 → 添加支撑肋),每轮"执行—验证—记忆更新"递归推进;右:测试时冻结记忆复用,记忆引导检索 → 应用代码修复 → 构建导出 → 验证成功。

Stage-1:Broad Recursive Self-exploration(BRS,广度递归自我探索)

  • 目标:通过多样化交互经验快速建立对新环境的整体理解;
  • 每轮 curriculum 提出多个跨不同方向的任务,并行执行与验证
  • 收集轨迹与反馈后,curriculum 识别剩余知识缺口,为下一轮生成更有信息量的任务;
  • 逐步扩展环境知识、可复用过程与失败模式的覆盖范围;
  • 参考配置:名义预算 8 个探索项目,最多 4 个并发,预算在完整轮次(wave)间检查。

Stage-2:Deep Recursive Self-exploration(DRS,深度递归自我探索)

  • 目标:聚焦知识缺口、困难案例和边界条件,精炼已累积记忆;
  • 顺序递归、难度递增:curriculum 提出一个很可能暴露隐藏约束或记忆弱点的挑战性任务 → actor 利用累积记忆尝试 → verifier 落地评估 → 经验在下一个任务提出前即被巩固进记忆 → curriculum 生成更难任务;
  • 一次成功不会自动终止探索,由 curriculum 审查验证结果与记忆决定是否继续(curriculum_review 停止策略)。

Stage-3:测试时记忆复用(Test-time Memory Reuse)

  • 探索结束后记忆冻结,curriculum 与所有记忆更新被禁用;
  • actor 直接复用记忆中的过程、已发现约束与失败教训;
  • "行动—验证"循环持续到 verifier 确认所有任务要求满足。

3.3 记忆构建机制:因果结构与所有权规则

记忆内容:有效的适应不应只是背成功轨迹,还要发现动作、环境条件与结果之间稳定的因果关系,并组织为可复用的因果结构。记忆包含四类知识:

  1. 环境特定知识(接口、工具、惯例、失败模式);
  2. 可复用过程与脚本(验证过的操作流程、代码片段);
  3. 失败教训(失败模式及其发生条件);
  4. 因果知识(动作—条件—后果关系,含隐藏约束、边界条件、未知依赖)。

值得注意:参考实现中记忆是 actor 自主撰写的一组文件,没有强制 schema、文件数或长度要求——因果结构以自然语言/文件形式自主组织,而非固定图结构。

记忆更新三原则

  • 经验所有制学习(Experience-Owned Learning):产生经验的 actor 自己决定保留什么。获得 PASS/FAIL 判定后进入两步——蒸馏(识别有用过程、约束和失败教训;失败项目也可贡献证据,但不会记为已验证成功)与调和(与旧条目核对,修订矛盾,为缺乏支持的结论加限定条件);
  • 规范记忆所有权(Canonical Memory Ownership):只有完成的 actor 学习更新才被提升到持久记忆库;工作阶段的临时编辑被丢弃;curriculum 和 verifier 无权批准记忆措辞;
  • 并行工作、顺序更新(Parallel Work, Sequential Updates):BRS 同一轮次的项目从相同的不可变轮前快照开始、互不可见;所有判定落地后,actor 上下文按 curriculum 撰写顺序逐一恢复,在最新规范记忆上顺序执行更新;下一轮次在提交完成后才选择。

3.4 "Training-free" 的四层含义

  1. 模型权重全程固定,适应完全通过上下文管理实现;
  2. 无金标签、无人类监督,不依赖外部任务奖励,完全靠环境反馈落地验证;
  3. 以"探索 → 记忆构建 → 冻结复用"替代参数再训练;
  4. BRS→DRS 类似"预训练→后训练",但发生在智能体推理层面。

3.5 参考配置(Appendix)

  • Actor:GLM-5.3(默认);Verifier / Curriculum:Kimi-K3(各自独立上下文);
  • 采样:temperature=1.0, top-p=1.0;单次调用上限 65,536 tokens;
  • 执行限制:目标 actor 500 次迭代 / 36,000 秒看门狗;练习与课程 2,000 次迭代 / 86,400 秒;
  • 验证机制:verifier 在受检查点保护的候选环境副本上探查(reset-and-replay),检查后恢复,防止验证探针改变提交物;目标接口额外支持 UNVERIFIED 判定;
  • 守卫条件:未解决的验证或基础设施错误会暂停流程而不会被转换为任务判定。

四、实验

4.1 设置

  • OSWorld 2.0(0808 offline):82 个离线任务,覆盖文档编辑、媒体制作、专业工程与科学软件工作流(T082 因环境搭建失败按 0 分计入);
  • Agents' Last Exam(ALE)Near-term:全部 67 个任务,含计算、金融、工程、科学分析和视觉媒体工作流;
  • 指标:Partial score(平均任务得分,反映渐进完成度)与 Binary accuracy(满分任务比例)。

4.2 主要结果(Table 1)

模型/方法 OSWorld Partial OSWorld Binary ALE Partial ALE Binary
Kimi-K2.6 22.10 4.60 21.70 9.20
DeepSeek V4 Pro 43.81 19.90
Qwen3.8-Max 52.50 27.00
Kimi-K3 58.30 71.60 40.30
Claude Opus 4.8 54.80 20.60 64.00 43.30
GPT-5.6 Sol 64.13 28.10 78.82 47.76
Claude Opus 5 70.19 34.72 79.54 46.27
GPT-6 Astra 72.60 82.26 52.24
RSIAgent (w/o RSI) 71.97 37.80 83.75 49.25
RSIAgent 78.98 42.68 84.82 50.75

关键发现:

  • RSI 带来显著提升:OSWorld Partial +7.01、Binary +4.88;ALE Partial +1.07、Binary +1.50;
  • RSIAgent 取得所有系统中最高 Partial 分,比 GPT-6 Astra 高 6.38(OSWorld)/ 2.56(ALE),并全面超过 Claude Opus 5;
  • 注意 GPT-6 Astra 在 ALE Binary(52.24)上仍略高于 RSIAgent(50.75)——完全通过率上仍有差距。

4.3 RSI 步数效果(Figure 3)

对三个代表性 OSWorld 任务(T044 视频编辑、T049 演示文稿修复、T065 铁路订票)追踪第 0–8 步得分:第 8 步时 T044 达 100%、T049 达 80%、T065 达 100%。当记忆覆盖任务关键需求后,解决剩余瓶颈会产生离散式分数跃升——单任务评估比渐进式记忆积累更容易显现这种"突破"。

4.4 消融实验(Figure 4)

四个 OSWorld 任务(T080 / T085 / T089 / T106)上比较四个变体:

变体 平均 Partial
Full RSI 74.54%
w/o DRS(仅广度) 65.52%
w/o BRS(仅深度) 56.50%

结论:广深结合在全部四任务上最优;仅广度在每个任务上都优于基线;仅深度在 T085、T089 上甚至低于基线——缺乏广度覆盖时深度探索不可靠,验证了"先 BRS 后 DRS"的设计顺序。

4.5 游戏环境评估(Table 2,GameCraft-Bench 40 任务)

与持续游戏改进基线 Play2Code 对比(按基础游戏生成器分组,Overall 列):

生成器 Baseline + Play2Code + RSIAgent (w/o RSI) + RSIAgent
Codex + GPT-5.5 52.77 51.05 57.84 61.28
Kimi-K2.6 31.28 36.02 42.61 46.37
GLM-5.3-Flash 30.55 38.25 44.73 48.72
Qwen3.8-27B 41.30 47.67 53.82 57.46

三个结论:(1) RSIAgent 在所有生成器上均显著提升游戏质量;(2) Play2Code 仅对弱生成器有效,基础游戏越强收益越小,甚至降低高质量游戏(GPT-5.5 组 52.77→51.05),而 RSIAgent 对强弱基础均能持续改进;(3) 加入 RSI 经验(对比 w/o RSI)进一步提升,说明积累的经验可跨游戏类型复用。

4.6 失败模式分析(Figure 5)

论文诚实指出三类限制递归自我改进的机制,且三者可相互作用:

  1. 探索针对性不足:练习若未挑战导致弱点的决策,目标特定缺陷仍未解决。案例中"获取不可得的用户信息"始终未被测试,有问题的"缺失信息规则"残留于记忆。启示:选题应挑战不确定知识,而非仅扩展任务多样性;
  2. 验证不完整:局部验证可能在未确认所有需求时通过——"产生了预期输出"不等于"底层解释或需求清单完整"。被接受的错误会成为后续记忆更新与探索决策的基础;
  3. 记忆巩固不可靠:未充分验证的决策可能成为可复用规则。案例中 actor 保留了"将缺失数据标记视为有效答案"的规则并反复复用。启示:记忆必须保留经验的条件与不确定性,局部接受不等于普遍有效。

五、局限与评价

论文自述局限:递归自我改进需要额外测试时探索与练习,计算成本可观;性能依赖探索预算、停止策略和记忆质量;基于模型的 verifier 误判会传播到后续探索与记忆更新中。

个人评价

  • 亮点 1:把"递归自我改进"从参数层面拉到了上下文/记忆层面,training-free 的定位让它天然适用于私有、持续变化的环境,工程落地门槛低;
  • 亮点 2:BRS→DRS 的"预训练→后训练"类比虽非全新(探索-精炼两阶段在 agent 文献中常见),但"并行工作、顺序更新"的快照隔离机制和"经验所有制/规范记忆所有权"的所有权划分是多智能体记忆管理中少见且严谨的工程设计;
  • 亮点 3:消融中"仅深度探索反而低于基线"的发现很有信息量——说明没有广度覆盖时,深度探索容易在错误的先验上越钻越深;
  • 存疑点 1:OSWorld 仅用了 82/108 任务子集,且 RSI 行用 41 个非诊断性 RSI 结果替换基线分数(含重试与回退),与闭源模型的对比口径并不完全对等;
  • 存疑点 2:核心收益可能部分来自"actor + verifier 双模型 harness"本身(w/o RSI 已达 71.97/83.75,超过多数基线),RSI 记忆带来的净增益在 ALE 上仅 +1.07 partial,摊薄到巨大的探索计算成本后性价比存疑;
  • 存疑点 3:verifier 本身是 LLM,"验证不完整"失败模式在论文案例中真实发生,说明 PASS 判定的可信度是整套系统的单点瓶颈。

六、关键结论

  1. RSIAgent 证明无需参数更新,仅靠自主探索 + 结构化记忆构建即可让智能体适应新环境,使开源模型在 OSWorld 2.0(78.98)和 ALE(84.82)Partial 分上超越 GPT-6 Astra;
  2. 先广后深(BRS→DRS) 是两阶段探索的有效顺序:仅广度已优于基线,仅深度可能有害,广深结合最优;
  3. 记忆的价值不在背轨迹,而在组织动作—条件—后果的可复用因果结构,且必须保留条件与不确定性;
  4. 系统的三大瓶颈——探索针对性、验证完整性、记忆巩固可靠性——为后续 agent 自我改进研究指明了改进方向。

参考链接

  • 论文页面: https://arxiv.org/abs/2609.15364
  • PDF: https://arxiv.org/pdf/2609.15364
  • HTML 全文: https://arxiv.org/html/2609.15364v1