别再找"最优提示深度"了——Agent-G² 说正确答案是一个高斯分布

训练 LLM 智能体做长程任务(比如 ALFWorld 里"把杯子洗干净放进柜子"这种几十步的操作),最让人头疼的不是模型不够聪明,而是奖励太稀疏——走几十步只在终点给一个 0/1 信号,从零开始探索的 rollout 大部分连成功状态的边都摸不到,GRPO 的优势估计直接坍缩。

一个越来越主流的做法是 hint-based RL:rollout 之前先执行一段专家轨迹的前缀,让模型从"离成功更近"的状态开始探索。思路没毛病,但马上冒出一个工程上极其敏感的问题——这段前缀留多长? 留太短,rollout 还是全失败;留太长,rollout 全成功,奖励饱和,组内没有对比,优势还是估不出来。

现有方法都把这个问题建模成"给每个任务找一个最优深度 d"。这篇 Agent-G² 上来就说:这个建模方向本身就错了。

核心摘要:浙大 REAL 实验室牵头的这篇工作发现,"有用的引导深度"根本不是一个点,而是一个带——训练信号在这个带上的分布近似高斯(σ=0.22,R²=0.92)。于是他们把每个任务的引导深度建模成一个高斯分布,均值由"全局基线 + 聚类难度修正"在线估计,方差跟踪类内任务差异,直接从已有的 GRPO rollout 统计里白嫖,不需要任何额外的探测 rollout。结果在 ALFWorld 上 1.5B 模型做到 95.3%、7B 做到 98.4%,比最强的逐样本探测方法便宜 3 倍以上,还更准。我的判断:这不是一个复杂的方法,但它把一个被广泛默认的错误假设扒了出来,而且工程上几乎是零成本替换——这类"诊断驱动"的论文比堆模块的论文值钱。


论文信息

  • 标题:Agent-G²: Gaussian Guidance for Agentic Reinforcement Learning
  • 作者:Zixuan Wang、Yanrui Miao(共同一作)、Zhengxi Lu、Teng Pan、Yiwen Qiu、Hongxing Li、Peng Qiu、Ruiqing Zhang、Yongliang Shen(通讯)
  • 机构:浙江大学(REAL 实验室)、山东大学、百度
  • 链接:https://arxiv.org/abs/2608.23318 | 代码:https://github.com/ZJU-REAL/Agent-G2 | 项目页:https://zju-real.github.io/Agent-G2

🎯 为什么"找一个最优深度"是条死路

先交代一下背景。hint-based RL 在数学推理上已经有一堆工作,但那些任务结构比较均一;智能体任务不一样,同一个 batch 里难度天差地别——ALFWorld 里一个两步的 "Pick" 和一个二十步的 "Pick Two" 放在一起训练,你告诉我用同一个前缀深度?

现有方法分两派,论文用 Figure 1 概括得很清楚:

图1:三种 hint-based RL 范式对比

图1:(a) 调度派——按训练步数给所有样本共享一个深度 d,Step decay / Cosine decay 都属此类;(b) 探测派——逐样本二分搜索或枚举找最优深度,代价是 O(log n) 的额外 rollout 且有噪声;(c) Agent-G²——每个任务从高斯分布里采深度,参数从已有 rollout 在线估计,零额外开销。

两派的问题,作者不是嘴上批评,而是做了一组诊断实验把它量化了。他们在 Qwen2.5-1.5B / ALFWorld 训练到第 50 步(此时无提示成功率接近 50%,各任务的有效深度散布最宽)时,扫了一个深度网格,每个(任务 × 深度)组合跑 32 条 rollout 估计成功率 \(p_i(d)\),把 \(p_i(d)\in[0.4,0.6]\) 的深度集合定义为"信息量带"——成功率卡在成功与失败边界附近时,GRPO 的组内对比最强,训练信号最足。

诊断结果相当难看:

图2:标量深度调度的错配问题

图2:(a) 四种共享深度调度器里,三种按步数衰减的调度只有 15%–23% 的分配落在信息量带内(绿色),大部分都过度引导(红色);就算是最强的 Target-acc 调度也有 38% 的分配在带外。(b) 探测派想降低错配率 ρ 就得烧 rollout:二分搜索在 2 条探测 rollout 下错配率 75%,枚举法要把错配率压到接近零需要每候选深度 32 条 rollout、20 倍的 GRPO 预算。

你看这个数:共享调度派直接把一半以上的任务分配到了带外;探测派想把错配率压下去,代价是 rollout 预算翻 2 倍到 20 倍。这不是调参能调好的问题——一个标量深度,结构上就不可能同时匹配难度各异的任务。

但作者没有停在这里。他们追问了更深一层:探测派的前提——"每个任务存在一个唯一最优深度,找到它就完事"——成立吗?

💡 核心发现:有效深度是一个高斯形状的"带"

答案是不成立。Figure 3 是整篇论文最值钱的一张图:

图3:有效引导形成一个带,且信息量剖面近似高斯

图3:(a) 注入深度 k 从 0 增大时,under-guided(灰)、in-range(绿)、over-guided(红)三类任务占比的变化——绿色带横跨多个相邻深度,而不是一个点;(b) 把所有任务的"相对深度" Δd = d − d* 对齐后,用伯努利方差 p(1−p) 作为训练信息量的代理,画出来的剖面是单峰、近似对称的,高斯拟合 σ=0.22,R²=0.92。

两个观察串起来的逻辑链很漂亮:既然信息量带横跨多个深度,那"精确找到 d*"就是个伪目标;既然信息量围绕带中心呈高斯衰减,那正确的做法就是用一个高斯分布去覆盖这个带——均值定位带的中心,方差匹配带的宽度。采样天然地覆盖了邻域内所有有信息量的深度,而不是赌一个点。

说实话我看到这里的第一反应是:这个想法简单得有点"这也行?"。但回头想想,curriculum learning 里"成功率 50% 附近学得最快"是老知识(Florensa 等人的 automatic goal generation 就是这个原理),把"目标成功率"从点估计放松成分布匹配,确实是没人系统做过的松弛。好的松弛往往就长这样——事后看显然,事前没人做。

🏗️ Agent-G²:全局基线 + 聚类修正的在线高斯调度

方法本身可以用一句话概括:给每个任务 i 维护一个高斯分布 \(\mathcal{N}(\mu_i, \sigma_i^2)\),从中采一个引导比例,转成专家前缀长度;而分布的参数全部从当批 rollout 的统计量里在线更新,一个额外 rollout 都不花。

图4:Agent-G² 完整流水线

图4:流水线五步——(1) 按专家轨迹长度离线把任务聚成 K 类(Short/Medium/Long);(2) 全局基线 μ_global 与每类统计量 (A_k, V_k) 组合出每任务的高斯参数;(3) 每任务采一个前缀长度,R 条 rollout 共享该前缀后的状态;(4) 用"前缀 SFT + GRPO"更新策略;(5) 同一批 rollout 的终局奖励回头刷新 μ_global、A_k、V_k。底部是闭环反馈:高斯引导随训练从"深而窄"演化到"浅而收敛"。

具体机制分三块:

全局基线跟踪策略整体进度。每个 batch 算平均成功率 \(\text{acc}_{\mathcal{B}}\),往目标 \(p_{\text{target}}=0.5\) 的方向走一步:

\[\mu_{\text{global}} \leftarrow \mathrm{clip}\big(\mu_{\text{global}} + \mathrm{sign}(p_{\text{target}} - \text{acc}_{\mathcal{B}})\,\Delta,\, 0,\, 1\big)\]

成功率低了就把前缀加深,高了就放浅。逻辑朴素得像个 bang-bang 控制器,但够用。

聚类统计捕捉难度差异。训练集按专家轨迹长度离线分成 K=3 类,每类用 EMA 维护成功率均值 \(A_k\) 和方差 \(V_k\)。然后每任务的高斯参数:

\[\mu_i = \mathrm{clip}\big(\mu_{\text{global}} + \lambda(p_{\text{target}} - A_k),\, 0,\, 1\big), \qquad \sigma_i = \max(\gamma V_k,\, \sigma_{\min})\]

类内成功率越低,中心往深引导偏;类内任务表现越参差,方差拉得越开,采样覆盖面越广。难任务多给提示、简单任务少给、摸不准的就多撒点——直觉上完全说得通。

训练目标是 GRPO 加一项前缀上的 teacher-forcing 辅助损失:

\[\mathcal{L}(\mathcal{B}) = \mathcal{L}_{\text{GRPO}}(\mathcal{B}) + \eta\,\mathcal{L}_{\text{aux}}(\mathcal{B})\]

辅助项对采样的专家前缀做模仿,起稳定器作用。整个循环里,更新策略的 rollout 和更新调度的 rollout 是同一批——这是"零额外开销"的关键,也是跟探测派最本质的区别。

🧪 实验:95.3% 的背后

实验在 ALFWorld 和 WebShop 两个长程智能体基准上做,骨干是 Qwen2.5-1.5B / 7B-Instruct,5 个种子取平均。Agent-G² 专属超参(Δ=0.1、α=0.2、γ=1.0)跨基准固定,没有逐任务调。

主结果表相当热闹,对比了五大类方法。摘关键的:

方法(Qwen2.5-1.5B) 类型 ALFWorld All WebShop Score WebShop Succ
Full SFT 模仿 56.3 86.6 69.5
GRPO 无提示 RL 72.8 75.8 56.8
GiGPO 无提示 RL 86.1 83.1 65.0
BEACON 无提示 RL 91.4 86.1 75.6
RLVMR 辅助 RL 87.9
Step decay 调度派 Hint-RL 89.8 89.1 74.2
Enumeration 探测派 Hint-RL 86.0 90.1 78.1
Agent-G² 分布式引导 95.3 92.3 78.9
方法(Qwen2.5-7B) 类型 ALFWorld All WebShop Score WebShop Succ
BEACON 无提示 RL 94.5 87.7 79.7
RLVMR 辅助 RL 91.8
Step decay 调度派 Hint-RL 91.4 92.1 83.6
Enumeration 探测派 Hint-RL 96.1 96.0 89.8
Agent-G² 分布式引导 98.4 92.3 84.4

表1节选:ALFWorld 为成功率(%),WebShop Score 为奖励得分、Succ 为最终购买成功率。完整表格还含 6 类任务细分与 prompting 基线(GPT-4o、Gemini-2.5-Pro、ReAct、Reflexion 等)。

几个值得注意的点:

1.5B 的 Agent-G²(95.3%)超过了所有 7B 的非探测方法(包括 7B BEACON 的 94.5%)。作者在结论里特意强调了这句——调度设计可以替代模型规模的堆叠。这个结论我很喜欢,因为它说明引导质量是被严重低估的变量,大家习惯堆参数,很少有人回去检查"前缀留多长"这种看似不起眼的旋钮。

相对最强基线的提升幅度:比最强无提示方法(BEACON)高 3.9 个点,比最强辅助监督方法(RLVMR)高 7.4 个点,比最强探测方法(Enumeration,7B 上)高 2.3 个点——而且探测派是烧着额外 rollout 才拿到那个成绩的。

成本对比更直观:

方法 单步耗时(秒) 相对 Agent-G²
Step decay 57 0.65×
Target acc 80 0.91×
Agent-G² 88 1.00×
Binary Search 285 3.24×
Enumeration 425 4.83×

表2:Qwen2.5-1.5B / ALFWorld 上每个梯度步的墙钟时间中位数。

Agent-G² 比共享调度派贵一点(88s vs 57–80s,毕竟要执行长度不一的前缀),但比探测派便宜 3.2–4.8 倍,rollout 开销不到逐样本探测的三分之一。再叠加收敛速度——Figure 6 显示它大约用一半的梯度步就达到调度派的最终精度——综合训练效率是最优的。

图5:超越模仿 + 按簇分解的调度

图5:(a) Agent-G²(95%)远超 Full SFT(56%)和只模仿采样前缀的 Sampled-Prefix SFT(27%)——68.4 个点的差距说明收益来自前缀之后状态上的 RL 学习,不是抄专家 token;(b) t=29 时 Short/Medium/Long 三个簇的深度密度已经明显分离,这个分离不是手工设的,是从 rollout 反馈里涌现出来的。

图6:训练动态

图6:(a) 验证成功率曲线:Agent-G²(红)全程领先最强的标量深度基线,步数 50–150 之间差距最大——恰好是 (b) 中深度分布最宽、任务异质性最强的窗口期;到 t=200 分布收缩到接近零,因为所有簇的成功率都过了阈值,不再需要提示。

这个"先深后浅、先宽后窄"的演化过程在附录的 Figure 7 里看得更完整:

图7:四个训练阶段的按簇高斯调度快照

图7:t=5 深度初始化(分布靠右,深引导为主)→ t=30 簇间分离(Long 簇中心明显更深)→ t=75 方差见顶 → t=200 收敛到浅引导。Long 簇的 σ 保持更久——难任务需要更长时间的宽覆盖。

消融实验(表3,ALFWorld / 1.5B)把每个组件都验了一遍:

变体 All Δ
完整 Agent-G² 95.3
不采样,直接用均值 μ_i 89.8 降 5.5 个点
换成方差匹配的均匀分布 88.3 降 7.0 个点
去掉簇中心修正(μ_i = μ_global) 91.4 降 3.9 个点
去掉自适应方差(σ_i = σ_min) 93.8 降 1.5 个点
不聚类(K=1) 89.1 降 6.2 个点
去掉辅助损失 86.7 降 8.6 个点
去掉 GRPO(退化为前缀 SFT) 26.6 降 68.7 个点

两个细节值得圈一下。把高斯换成方差匹配的均匀分布只掉 7 个点、仍然高于不采样——说明收益主要来自"随机覆盖信息量带"这件事本身,而不是高斯的确切形状,作者自己也诚实地承认了这点。去掉自适应方差后 Long 任务从 94.7% 暴跌到 78.3%,说明难任务上"撒得开"比"瞄得准"更关键。

🤔 我的判断

这篇论文最打动我的不是方法本身——说实话方法部分的每个组件(全局 bang-bang 调整、EMA 统计、按长度聚类)单拎出来都朴素得不能再朴素——而是它的论证结构:先用诊断实验证明"标量深度"这个假设在结构上是错的,再把"带 + 高斯剖面"的经验发现直接映射成分布的两个参数,最后让调度参数白嫖现有 rollout 统计。整条链没有一处是硬凑的。

但也要泼几盆冷水。

依赖专家轨迹是硬门槛。 每个训练任务要有一条专家轨迹,作者把它列在 limitations 第一条。数学推理和 ALFWorld/WebShop 这类环境里专家轨迹好拿,但真实业务场景里这往往是最贵的资产。弱监督(次优演示、语言提示)能不能接进这个框架,论文自己也说没答案。

按轨迹长度聚类是个糙代理。 长度 ≈ 难度在 ALFWorld 这种任务族里成立,换个领域未必。而且聚类是离线固定的——策略变强后任务的相对难度在漂,簇不会跟着漂。K=1 掉到 89.1 说明聚类重要,但"怎么聚得更好"这篇没碰。

WebShop 上并非全面领先。 7B 的 Enumeration 在 WebShop Score(96.0)和 Succ(89.8)上都压过 Agent-G²(92.3 / 84.4),所以"最强非探测方法"这个定语在 WebShop 上是必要的修饰。当然,考虑到 Enumeration 近 5 倍的单步成本,这个交换在多数场景下仍然划算。

诊断只在单点做。 σ=0.22、R²=0.92 的高斯拟合是在 Qwen2.5-1.5B / ALFWorld 第 50 步这一个训练点上做的(附录补了跨训练窗口的拟合,Table 6,但仍是单一基准单一模型)。换骨干、换环境,这个剖面还是不是高斯、方差多大,需要重新验。好在均匀分布消融说明形状不是关键因素,这个风险比看起来小。

跟同期工作摆在一起看:StepHint、TRAPO 这类端到端方法在表 1 里全面输给朴素的 Step decay,多少说明"学一个深度预测器"这条路目前在 agentic 任务上还没走通;Agent-G² 绕开预测器、直接把调度变成一个可在线估计的统计问题,是当下更务实的路线。它不是底层突破,但它把一个被默认的错误假设矫正了过来,并且给了几乎零成本的替换方案——如果你正在做 hint-based RL 或者任何形式的课程式智能体训练,这个改动值得直接抄进代码里。

还有一个更本质的问题悬着:高斯覆盖解决的是"深度分配",但"哪些状态值得作为探索起点"这个问题比"前缀留多长"更一般。把引导从"专家轨迹前缀"推广到"信息量最大的中间状态集合",可能是这条线下一步真正有意思的地方。


觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我