与其给智能体"补课",不如把环境改成"好教练":FEE 用反馈增强破解长程任务 RL 的奖励稀疏

核心摘要

用 RL 训练 LLM 智能体做长程任务(long-horizon tasks),最头疼的不是算法,而是奖励稀疏——智能体在几十步的交互里瞎撞,一整条轨迹下来零奖励,梯度直接消失。主流解法是给智能体"补课":先用专家轨迹做 SFT 热身。但专家轨迹又贵又难规模化,SFT 过度还容易把探索能力锁死。这篇来自复旦和 CASIA 的论文(arXiv 2609.08404)把视角掉转了 180 度:不改智能体,改环境。他们构建反馈增强环境 FEE(Feedback-Enriched Environments),系统研究了"给什么反馈"(动作指导 vs 观测增强)和"什么时候给"(episode 内早晚期、训练全程早晚期)两个维度,发现最优策略是早期给动作指导、晚期切观测增强。在 SciWorld 和 BFCL 上,用 Qwen3-4B/8B 配 GRPO、DAPO、GSPO 三种算法,FEE 训练平均比标准环境高 2.82 个点。更值钱的是 Discussion 部分的四个分析发现,尤其是"环境反馈会被内化进策略权重"这一条,直接回应了"这会不会只是推理时的拐杖"的质疑。这篇不是底层算法突破,但方向感和实验扎实度都值得细读。


📖 论文信息

  • 标题:Environments as Scaffold: Enriching Feedback to Bootstrap Self-Evolving Agents in Long-Horizon Tasks
  • 作者:Hongbang Yuan、Zhuoran Jin、Yixin Cao(通讯作者)
  • 机构:复旦大学、中科院自动化所(CASIA)、上海创智学院
  • 链接:https://arxiv.org/abs/2609.08404
  • 代码:https://github.com/HongbangYuan/EnvAsScaffold
  • 发布时间:2026 年 9 月 8 日

🎯 问题动机:奖励稀疏这块硬骨头,为什么非要从环境侧啃

做过 agentic RL 的人对这个问题应该都有体感。一个长程任务,比如让智能体在文本世界里完成一个科学实验,动不动要十几二十步交互。最后才给一个 0/1 的成功奖励。问题来了:一个没怎么训练过的模型,瞎蒙做对一条十几步轨迹的概率有多低?低到 rollout 一整批全是零奖励,GRPO 这类组内对比的算法算出来的 advantage 全是零,梯度直接消失,什么都学不到。

标准的解法大家都熟:SFT 热身。先拿专家轨迹把智能体喂到一个"至少偶尔能成功"的水平,再上 RL。这个路子 work,但有两个老毛病。

一是贵。专家轨迹的采集成本高、难规模化,尤其是你想覆盖大量不同环境的时候。

二是更隐蔽的问题——SFT 会锁死探索。你想想看,SFT 本质上是让模型模仿专家的行为分布,模仿得越像,行为空间就被收得越窄。到了 RL 阶段,智能体该去探索的那些"非典型但有价值"的路径,概率已经被压得很低了。这就像给学生补课补过头,标准答案背得滚瓜烂熟,但遇到新题型反而不会做了。

作者的反问很直接:为什么一定要动智能体?环境也是可以设计的。

说实话这个视角转换我喜欢。RL 里大家都知道课程学习(curriculum learning)的价值——从简单任务开始逐步加难。但课程学习调的是"做什么任务",这篇论文调的是"任务给什么反馈"。同样是让任务变简单,后者不用改任务本身,只需要在环境的观测空间里加料。这个改法和 agent 侧的所有优化(算法、模型、数据)都是正交的,理论上可以白捡增益。


🏗️ 方法核心:两个维度、四种组合、一个切换策略

图1:FEE 整体示意

图1:FEE 的整体框架。左侧是一个"测试金属勺导电性"的任务实例——标准反馈只说"你进入了实验室",动作指导(Action Guidance)会追加"从桌上拿起金属勺"这样的下一步提示,观测增强(Observation Enrichment)则给出完整的任务进度追踪(1/4 完成、哪些子目标还 pending)。右上是主实验结果:无论 Qwen3-4B 还是 8B,无论 GRPO、GSPO 还是 DAPO,FEE(红柱)都稳超标准环境。右下是 GSPO 下 vanilla 与 enriched 环境的训练成功率曲线。

先把形式化说清楚。环境被建模为一个目标条件的 POMDP,\(e_\phi = (\mathcal{G}, \mathcal{S}, \mathcal{A}, O, \mathcal{T}, r)\)。智能体每步基于观测 \(o_t\) 和历史 \(h_t\) 输出动作:

\[a_t \sim \pi_\theta(a_t \mid g, o_t, h_t)\]

FEE 做的事情一句话讲完:对观测空间做干预\(o_t^+ = \mathcal{E}(o_t, h_t)\),得到增强环境 \(e_\phi^+\)。状态和转移函数都不动,只改智能体"看到什么"。这个设计很聪明——环境的物理规则没变,所以增强环境里学到的策略可以直接拿到标准环境里评测,不存在分布不匹配。

然后是核心的设计空间,两个维度正交:

维度 选项 A 选项 B
给什么 动作指导 AG:直接建议下一步做什么,收窄搜索空间 观测增强 OE:补充隐藏状态信息,缓解部分可观测性
何时给 早期:episode 的前几步 / 训练的前半段 晚期:episode 的后几步 / 训练的后半段

举个具体例子。导电实验里,没指导的智能体可能浪费一堆步数在教室里翻找材料;动作指导直接告诉它"进实验室",把无关分支剪掉。电路组装任务里,原始观测只说"导线已连接",观测增强会补一句"阴极仍未通电"——智能体就知道问题出在哪,而不是瞎猜。

四种组合怎么排布最有效?作者跑了一组 pilot study:Qwen3-4B-Thinking + GRPO 训 200 步,episode 限 15 步,AG-Early/AG-Late 分别在第 1-3 步和第 6-10 步给动作指导,OE 同理,增强操作以 0.5 概率随机注入。

图2:不同反馈策略下的 RL 训练动力学

图2:pilot study 的核心结果。横轴训练步数,纵轴是标准环境上的任务成功率。蓝系的 AG 曲线整体压过棕色系的 OE 曲线;红色实线是 AG-Early 转 OE-Late 的混合策略,后期反超所有单一设置,达到最高成功率约 0.20。

这张图的读法有三层。

动作指导整体强于观测增强。 蓝曲线全程压着棕曲线。道理也直白:动作指导直接告诉智能体下一步往哪走,等于把组合搜索空间砍掉一大块;观测增强给的是原始语义信息,智能体还得自己做因果推理把它映射到动作上,学习曲线自然慢。

给什么,决定什么时候给。 AG-Early 在前期强于 AG-Late,但到后期被反超——基本导航学会之后,动作提示就变冗余了。OE 反过来,OE-Late 后期窜得很快,因为观测增强的认知负担重,得有一个基础还行的策略才能消化那些额外语义。

最优是切换:先 AG-Early,后 OE-Late。 红色曲线前 100 步用 AG-Early、后 100 步切 OE-Late,成功率约 0.20,压过所有固定策略。这个"先扶上马送一程,再撤掉拐杖给地图"的节奏,说实话和教人做事的直觉完全一致——新手期给指令,熟练期给信息。

到这里 FEE 的完整配方就出来了:训练 200 步,前 100 步 AG-Early,后 100 步 OE-Late,增强以 0.5 概率注入。


🧪 实验结果:4B/8B × 三种算法 × 两个 benchmark,全面正收益

主实验在 SciWorld 和 BFCL-v3 Multi-Turn 两个 benchmark 上展开,模型用 Qwen3-4B 和 Qwen3-8B,RL 算法覆盖 GRPO、DAPO、GSPO 三家。对照组里还放了 GPT-5.4、Kimi-K2-Thinking、Qwen3-235B-Thinking 作为性能天花板参考。学习率 \(1 \times 10^{-6}\),每 5 步在严格隔离的测试任务上评一次,报告峰值。

模型 BFCL Base Long Ctx Miss Func Miss Param SciWorld 平均
GPT-5.4 47.00 56.00 56.00 49.00 52.34 52.07
Kimi-K2-Thinking 69.00 54.00 68.00 57.00 19.53 53.51
Qwen3-235B-Thinking 36.00 29.00 32.00 23.00 55.47 35.09
Qwen3-4B(未训练) 35.00 28.00 27.00 24.00 3.90 23.58
4B + GRPO 标准 58.00 52.00 34.00 32.00 28.91 40.98
4B + GRPO 增强 68.00 46.00 43.00 30.00 34.38 44.27
4B + DAPO 标准 61.00 44.00 39.00 41.00 34.38 43.88
4B + DAPO 增强 71.00 50.00 45.00 34.00 39.06 47.81
4B + GSPO 标准 54.00 40.00 29.00 25.00 34.38 36.48
4B + GSPO 增强 54.00 40.00 37.00 22.00 39.84 38.57
Qwen3-8B(未训练) 35.00 24.00 30.00 25.00 21.88 27.18
8B + GRPO 标准 66.00 35.00 52.00 37.00 43.75 46.75
8B + GRPO 增强 66.00 36.00 48.00 38.00 49.22 47.44
8B + DAPO 标准 65.00 33.00 47.00 34.00 50.00 45.80
8B + DAPO 增强 71.00 35.00 49.00 34.00 51.56 48.11
8B + GSPO 标准 58.00 29.00 41.00 27.00 53.91 41.78
8B + GSPO 增强 65.00 32.00 40.00 34.00 60.94 46.39

表1:主实验结果。加粗为同组内更优。FEE 在几乎所有配置下都跑赢标准环境,全配置平均提升 2.82 个点。

几个值得停下来看的点。

RL 的收益远大于 FEE 的收益,但 FEE 是白捡的。 4B 从 23.58 涨到 47.81(DAPO 增强),这个大头是 RL 本身带来的——直接把 4B/8B 拉过 Qwen3-235B-Thinking,逼近 GPT-5.4 的 52.07。FEE 贡献的是标准环境之上的那 2 到 4 个点。别嫌少,这 2.82 个点是纯环境侧改动换来的,和任何 agent 侧优化都能叠加。8B + GSPO 在 SciWorld 上从 53.91 到 60.94,涨了 7.03 个点,单项来看相当能打。

等等,Miss Param 和 Miss Func 上怎么有回退? 这是我看到 Table 1 时最先皱眉的地方。4B + DAPO 在 Miss Param(用户请求缺关键参数)上从 41.00 掉到 34.00,8B + GRPO 在 Miss Func(没有可用工具)上从 52.00 掉到 48.00。作者的解释我觉得是成立的:FEE 里的主动引导让智能体养成了"跟着提示走"的习惯,遇到需要质疑输入、主动澄清的场景,反而倾向于闷头执行。这其实暴露了 FEE 的一个真实代价——反馈增强训练出来的服从性,会削弱智能体的批判性。做工程落地的人要警惕这一点:如果你的场景里"该问的时候要问"很重要,FEE 可能帮倒忙。


🔬 Discussion:四个比主表更值钱的发现

我觉得这篇论文最扎实的部分其实是 Discussion。作者没有停在"我们的方法涨了几个点",而是追问了四个机制层面的问题。

发现一:FEE 是训练稳定器

图3:策略熵曲线对比

图3:Qwen3-4B 在 SciWorld 上 300 步训练的策略熵曲线。实线无熵正则,虚线有熵正则。蓝色标准环境在约 250 步熵崩到零;橙色 FEE 全程维持稳定熵值。加了熵正则后标准环境崩得更早(约 130 步),FEE 仍能撑到近 200 步。

熵崩溃是 agentic RL 的老大难——策略分布坍缩到一个尖峰,探索能力归零,训练直接废掉。图里蓝实线在 250 步附近从 2.5 垂直掉到 0,那个画面做过 RL 的人看了都血压高。FEE 的橙色曲线全程稳在 0.5-1.0 区间。

更有意思的是加熵正则的对照。熵正则是强制探索的手段,但在标准环境里反而加速了崩溃(130 步就没了),因为强行维持高熵让梯度信号更噪。FEE 在同样压力下多撑了 70 步。作者的结论是:多样化的环境反馈本身就是一种稳定剂,和显式熵正则正交。这个结论对工程很实用——与其费劲调熵系数,不如把环境的反馈做丰富。

发现二:探索能力的提升是真探索,而且会迁移

图4:训练过程中的探索动态

图4:Qwen3-4B 在 BFCL 上每个采样环境的 avg@8 成功率散点,纵轴按难度排序(底部易、顶部难)。左图标准环境里顶部困难区域几乎全红(成功率 0);右图 FEE 训练后期绿色点明显向困难区域扩散,全局平均(蓝线)也更高。

图5:分难度等级的评测成功率

图5:把 400 个环境按标准训练模型的成功率分成难(235 个)、中(73 个)、易(92 个)三档,在标准环境上评测。FEE 训练的模型在困难档从 6.5 涨到 10.9,提升 4.3 个点,中等档和容易档只掉了 1 个点以内。

这组图回答了一个关键质疑:FEE 训练的模型,会不会只在"有提示的环境"里厉害,回到标准环境就露馅?答案是不会。困难环境上 6.5 → 10.9,提升 4.3 个点,而容易环境几乎无损(87.6 → 87.0)。说明智能体学到的是主动探索的策略,能摸到以前根本到不了的状态,而不是记住了提示内容。

发现三:反馈被内化进了权重,不是推理时的拐杖

图6:反馈内化探针实验

图6:内化实验。对 BFCL 文件系统操作(cd、mkdir、touch 等 8 个命令)构造选择题,比较模型给"原始工具输出"和"增强版输出(含当前绝对路径)"分配的概率差。FEE 训练的模型(彩色实线)随训练推进越来越偏好增强版输出,标准训练的模型(灰色虚线)始终钉在 -1.0 附近。

这个实验设计得挺巧的。增强反馈里多了"当前绝对路径"这个信息,如果模型只是推理时利用这个提示,那在标准环境(没有增强反馈)里做选择题时,它不应该偏好带路径的答案。但实测 FEE 训练的模型越来越倾向选增强版输出——关于"路径应该长什么样"的知识已经写进权重了。这直接回应了"脚手架撤掉就塌"的担忧:环境是 scaffold,但建出来的房子是实心的。

发现四:组内反馈必须一致,否则优势估计被污染

图7:组内一致性对比

图7:SciWorld 上 GRPO 训练的验证成功率。橙色组内一致(同组采样拿到相同反馈)平稳上升;蓝色组内随机(同组内不同轨迹拿不同增强反馈)剧烈震荡,成功率在 0.1 到 0.49 之间反复横跳。

这条发现的技术含量我觉得是被低估的。GRPO 这类算法的 advantage 是组内相对计算出来的——同一个 prompt 采 N 条轨迹,用组内奖励的相对高低当优势。如果同组里有的轨迹拿到了增强反馈、有的没拿,那奖励差异里就混进了"反馈运气"的成分,不再纯粹反映策略质量。图里蓝线的表现完全符合这个推断:最高冲到 0.49,最低砸到 0.08,优化信号全是噪声。

这个结论对实际训练的约束很具体:增强注入的 0.5 概率,必须在 group 粒度上统一掷骰,不能在 trajectory 粒度上各自随机。不注意这点的实现,FEE 可能直接起反效果。


💡 我的判断

这篇论文的价值定位,我的看法是:方向正确、实验扎实、机制分析出彩,但不是万能药

亮点有三个。一是视角转换本身。整个行业都在卷 agent 侧——更好的算法、更好的数据、更好的初始化——这篇论文提醒大家环境侧是一块被低估的杠杆。Related work 里提到 QuestA 这类在任务上加语言提示做 scaffolding 的工作,FEE 可以看作这条线在"环境重构"维度上的系统化,从零散 trick 变成了有设计空间的框架。二是"给什么决定何时给"的设计规律,AG 早期 pruning、OE 晚期 enrichment,这个节奏感有直觉支撑也有实验背书。三是 Discussion 的四个发现,尤其是内化和组内一致性,都是能直接指导工程实现的干货。

但问题也得说清楚。

增益幅度有限。 平均 2.82 个点,很多单项配置的提升在 1-3 个点之间。作为环境侧的免费午餐可以接受,但别指望它替代 agent 侧的优化。

难题环境里会失效。 作者很坦诚地在 Limitations 里承认:在 AppWorld 上训 Qwen3-4B/8B,加了增强反馈依然拿不到正奖励,训练全程陷在零奖励轨迹里。FEE 的前提是智能体"踮踮脚能够到",如果任务难度和基础能力差距太大,增强反馈也救不回来。这说明它解决的是"奖励稀疏",不是"能力鸿沟"。

阶段定义是手拍的。 episode 内 1-3 步算早期、训练 100 步切换,这些超参数都是人工指定的,敏感性没做系统研究。换个 benchmark,这个节奏大概率要重调。

服从性副作用是真实代价。 Miss Param / Miss Func 上的回退不是噪声,是机制性的——喂提示喂多了,智能体就不爱质疑了。如果你的应用里智能体需要对模糊指令保持警惕,用 FEE 得掂量。

顺带一提,和同期的工业界方案比,FEE 和 WebSailor 这类"环境 scaling"路线是互补的——WebSailor 解决"没有足够多的难任务",FEE 解决"任务太难奖励太稀"。两者叠加,一个铺量一个降坡,可能是下一代 agentic RL 训练栈的标准配置。

如果你正在做 agentic RL,我的建议很直接:这套"早期动作指导 + 晚期观测增强 + 组内一致注入"的配方,实现成本不高(改环境观测、不用动训练框架),值得在自己的环境上试一把。但先确认你的任务难度在智能体能力的延展区内,否则先去解决数据问题。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我