别再找"最优提示深度"了——Agent-G² 说正确答案是一个高斯分布
训练 LLM 智能体做长程任务(比如 ALFWorld 里"把杯子洗干净放进柜子"这种几十步的操作),最让人头疼的不是模型不够聪明,而是奖励太稀疏——走几十步只在终点给一个 0/1 信号,从零开始探索的 rollout 大部分连成功状态的边都摸不到,GRPO 的优势估计直接坍缩。
一个越来越主流的做法是 hint-based RL:rollout 之前先执行一段专家轨迹的前缀,让模型从"离成功更近"的状态开始探索。思路没毛病,但马上冒出一个工程上极其敏感的问题——这段前缀留多长? 留太短,rollout 还是全失败;留太长,rollout 全成功,奖励饱和,组内没有对比,优势还是估不出来。
现有方法都把这个问题建模成"给每个任务找一个最优深度 d"。这篇 Agent-G² 上来就说:这个建模方向本身就错了。
核心摘要:浙大 REAL 实验室牵头的这篇工作发现,"有用的引导深度"根本不是一个点,而是一个带——训练信号在这个带上的分布近似高斯(σ=0.22,R²=0.92)。于是他们把每个任务的引导深度建模成一个高斯分布,均值由"全局基线 + 聚类难度修正"在线估计,方差跟踪类内任务差异,直接从已有的 GRPO rollout 统计里白嫖,不需要任何额外的探测 rollout。结果在 ALFWorld 上 1.5B 模型做到 95.3%、7B 做到 98.4%,比最强的逐样本探测方法便宜 3 倍以上,还更准。我的判断:这不是一个复杂的方法,但它把一个被广泛默认的错误假设扒了出来,而且工程上几乎是零成本替换——这类"诊断驱动"的论文比堆模块的论文值钱。
论文信息
- 标题:Agent-G²: Gaussian Guidance for Agentic Reinforcement Learning
- 作者:Zixuan Wang、Yanrui Miao(共同一作)、Zhengxi Lu、Teng Pan、Yiwen Qiu、Hongxing Li、Peng Qiu、Ruiqing Zhang、Yongliang Shen(通讯)
- 机构:浙江大学(REAL 实验室)、山东大学、百度
- 链接:https://arxiv.org/abs/2608.23318 | 代码:https://github.com/ZJU-REAL/Agent-G2 | 项目页:https://zju-real.github.io/Agent-G2
🎯 为什么"找一个最优深度"是条死路
先交代一下背景。hint-based RL 在数学推理上已经有一堆工作,但那些任务结构比较均一;智能体任务不一样,同一个 batch 里难度天差地别——ALFWorld 里一个两步的 "Pick" 和一个二十步的 "Pick Two" 放在一起训练,你告诉我用同一个前缀深度?
现有方法分两派,论文用 Figure 1 概括得很清楚:

图1:(a) 调度派——按训练步数给所有样本共享一个深度 d,Step decay / Cosine decay 都属此类;(b) 探测派——逐样本二分搜索或枚举找最优深度,代价是 O(log n) 的额外 rollout 且有噪声;(c) Agent-G²——每个任务从高斯分布里采深度,参数从已有 rollout 在线估计,零额外开销。
两派的问题,作者不是嘴上批评,而是做了一组诊断实验把它量化了。他们在 Qwen2.5-1.5B / ALFWorld 训练到第 50 步(此时无提示成功率接近 50%,各任务的有效深度散布最宽)时,扫了一个深度网格,每个(任务 × 深度)组合跑 32 条 rollout 估计成功率 \(p_i(d)\),把 \(p_i(d)\in[0.4,0.6]\) 的深度集合定义为"信息量带"——成功率卡在成功与失败边界附近时,GRPO 的组内对比最强,训练信号最足。
诊断结果相当难看:

图2:(a) 四种共享深度调度器里,三种按步数衰减的调度只有 15%–23% 的分配落在信息量带内(绿色),大部分都过度引导(红色);就算是最强的 Target-acc 调度也有 38% 的分配在带外。(b) 探测派想降低错配率 ρ 就得烧 rollout:二分搜索在 2 条探测 rollout 下错配率 75%,枚举法要把错配率压到接近零需要每候选深度 32 条 rollout、20 倍的 GRPO 预算。
你看这个数:共享调度派直接把一半以上的任务分配到了带外;探测派想把错配率压下去,代价是 rollout 预算翻 2 倍到 20 倍。这不是调参能调好的问题——一个标量深度,结构上就不可能同时匹配难度各异的任务。
但作者没有停在这里。他们追问了更深一层:探测派的前提——"每个任务存在一个唯一最优深度,找到它就完事"——成立吗?
💡 核心发现:有效深度是一个高斯形状的"带"
答案是不成立。Figure 3 是整篇论文最值钱的一张图:

图3:(a) 注入深度 k 从 0 增大时,under-guided(灰)、in-range(绿)、over-guided(红)三类任务占比的变化——绿色带横跨多个相邻深度,而不是一个点;(b) 把所有任务的"相对深度" Δd = d − d* 对齐后,用伯努利方差 p(1−p) 作为训练信息量的代理,画出来的剖面是单峰、近似对称的,高斯拟合 σ=0.22,R²=0.92。
两个观察串起来的逻辑链很漂亮:既然信息量带横跨多个深度,那"精确找到 d*"就是个伪目标;既然信息量围绕带中心呈高斯衰减,那正确的做法就是用一个高斯分布去覆盖这个带——均值定位带的中心,方差匹配带的宽度。采样天然地覆盖了邻域内所有有信息量的深度,而不是赌一个点。
说实话我看到这里的第一反应是:这个想法简单得有点"这也行?"。但回头想想,curriculum learning 里"成功率 50% 附近学得最快"是老知识(Florensa 等人的 automatic goal generation 就是这个原理),把"目标成功率"从点估计放松成分布匹配,确实是没人系统做过的松弛。好的松弛往往就长这样——事后看显然,事前没人做。
🏗️ Agent-G²:全局基线 + 聚类修正的在线高斯调度
方法本身可以用一句话概括:给每个任务 i 维护一个高斯分布 \(\mathcal{N}(\mu_i, \sigma_i^2)\),从中采一个引导比例,转成专家前缀长度;而分布的参数全部从当批 rollout 的统计量里在线更新,一个额外 rollout 都不花。

图4:流水线五步——(1) 按专家轨迹长度离线把任务聚成 K 类(Short/Medium/Long);(2) 全局基线 μ_global 与每类统计量 (A_k, V_k) 组合出每任务的高斯参数;(3) 每任务采一个前缀长度,R 条 rollout 共享该前缀后的状态;(4) 用"前缀 SFT + GRPO"更新策略;(5) 同一批 rollout 的终局奖励回头刷新 μ_global、A_k、V_k。底部是闭环反馈:高斯引导随训练从"深而窄"演化到"浅而收敛"。
具体机制分三块:
全局基线跟踪策略整体进度。每个 batch 算平均成功率 \(\text{acc}_{\mathcal{B}}\),往目标 \(p_{\text{target}}=0.5\) 的方向走一步:
成功率低了就把前缀加深,高了就放浅。逻辑朴素得像个 bang-bang 控制器,但够用。
聚类统计捕捉难度差异。训练集按专家轨迹长度离线分成 K=3 类,每类用 EMA 维护成功率均值 \(A_k\) 和方差 \(V_k\)。然后每任务的高斯参数:
类内成功率越低,中心往深引导偏;类内任务表现越参差,方差拉得越开,采样覆盖面越广。难任务多给提示、简单任务少给、摸不准的就多撒点——直觉上完全说得通。
训练目标是 GRPO 加一项前缀上的 teacher-forcing 辅助损失:
辅助项对采样的专家前缀做模仿,起稳定器作用。整个循环里,更新策略的 rollout 和更新调度的 rollout 是同一批——这是"零额外开销"的关键,也是跟探测派最本质的区别。
🧪 实验:95.3% 的背后
实验在 ALFWorld 和 WebShop 两个长程智能体基准上做,骨干是 Qwen2.5-1.5B / 7B-Instruct,5 个种子取平均。Agent-G² 专属超参(Δ=0.1、α=0.2、γ=1.0)跨基准固定,没有逐任务调。
主结果表相当热闹,对比了五大类方法。摘关键的:
| 方法(Qwen2.5-1.5B) | 类型 | ALFWorld All | WebShop Score | WebShop Succ |
|---|---|---|---|---|
| Full SFT | 模仿 | 56.3 | 86.6 | 69.5 |
| GRPO | 无提示 RL | 72.8 | 75.8 | 56.8 |
| GiGPO | 无提示 RL | 86.1 | 83.1 | 65.0 |
| BEACON | 无提示 RL | 91.4 | 86.1 | 75.6 |
| RLVMR | 辅助 RL | 87.9 | – | – |
| Step decay | 调度派 Hint-RL | 89.8 | 89.1 | 74.2 |
| Enumeration | 探测派 Hint-RL | 86.0 | 90.1 | 78.1 |
| Agent-G² | 分布式引导 | 95.3 | 92.3 | 78.9 |
| 方法(Qwen2.5-7B) | 类型 | ALFWorld All | WebShop Score | WebShop Succ |
|---|---|---|---|---|
| BEACON | 无提示 RL | 94.5 | 87.7 | 79.7 |
| RLVMR | 辅助 RL | 91.8 | – | – |
| Step decay | 调度派 Hint-RL | 91.4 | 92.1 | 83.6 |
| Enumeration | 探测派 Hint-RL | 96.1 | 96.0 | 89.8 |
| Agent-G² | 分布式引导 | 98.4 | 92.3 | 84.4 |
表1节选:ALFWorld 为成功率(%),WebShop Score 为奖励得分、Succ 为最终购买成功率。完整表格还含 6 类任务细分与 prompting 基线(GPT-4o、Gemini-2.5-Pro、ReAct、Reflexion 等)。
几个值得注意的点:
1.5B 的 Agent-G²(95.3%)超过了所有 7B 的非探测方法(包括 7B BEACON 的 94.5%)。作者在结论里特意强调了这句——调度设计可以替代模型规模的堆叠。这个结论我很喜欢,因为它说明引导质量是被严重低估的变量,大家习惯堆参数,很少有人回去检查"前缀留多长"这种看似不起眼的旋钮。
相对最强基线的提升幅度:比最强无提示方法(BEACON)高 3.9 个点,比最强辅助监督方法(RLVMR)高 7.4 个点,比最强探测方法(Enumeration,7B 上)高 2.3 个点——而且探测派是烧着额外 rollout 才拿到那个成绩的。
成本对比更直观:
| 方法 | 单步耗时(秒) | 相对 Agent-G² |
|---|---|---|
| Step decay | 57 | 0.65× |
| Target acc | 80 | 0.91× |
| Agent-G² | 88 | 1.00× |
| Binary Search | 285 | 3.24× |
| Enumeration | 425 | 4.83× |
表2:Qwen2.5-1.5B / ALFWorld 上每个梯度步的墙钟时间中位数。
Agent-G² 比共享调度派贵一点(88s vs 57–80s,毕竟要执行长度不一的前缀),但比探测派便宜 3.2–4.8 倍,rollout 开销不到逐样本探测的三分之一。再叠加收敛速度——Figure 6 显示它大约用一半的梯度步就达到调度派的最终精度——综合训练效率是最优的。

图5:(a) Agent-G²(95%)远超 Full SFT(56%)和只模仿采样前缀的 Sampled-Prefix SFT(27%)——68.4 个点的差距说明收益来自前缀之后状态上的 RL 学习,不是抄专家 token;(b) t=29 时 Short/Medium/Long 三个簇的深度密度已经明显分离,这个分离不是手工设的,是从 rollout 反馈里涌现出来的。

图6:(a) 验证成功率曲线:Agent-G²(红)全程领先最强的标量深度基线,步数 50–150 之间差距最大——恰好是 (b) 中深度分布最宽、任务异质性最强的窗口期;到 t=200 分布收缩到接近零,因为所有簇的成功率都过了阈值,不再需要提示。
这个"先深后浅、先宽后窄"的演化过程在附录的 Figure 7 里看得更完整:

图7:t=5 深度初始化(分布靠右,深引导为主)→ t=30 簇间分离(Long 簇中心明显更深)→ t=75 方差见顶 → t=200 收敛到浅引导。Long 簇的 σ 保持更久——难任务需要更长时间的宽覆盖。
消融实验(表3,ALFWorld / 1.5B)把每个组件都验了一遍:
| 变体 | All | Δ |
|---|---|---|
| 完整 Agent-G² | 95.3 | – |
| 不采样,直接用均值 μ_i | 89.8 | 降 5.5 个点 |
| 换成方差匹配的均匀分布 | 88.3 | 降 7.0 个点 |
| 去掉簇中心修正(μ_i = μ_global) | 91.4 | 降 3.9 个点 |
| 去掉自适应方差(σ_i = σ_min) | 93.8 | 降 1.5 个点 |
| 不聚类(K=1) | 89.1 | 降 6.2 个点 |
| 去掉辅助损失 | 86.7 | 降 8.6 个点 |
| 去掉 GRPO(退化为前缀 SFT) | 26.6 | 降 68.7 个点 |
两个细节值得圈一下。把高斯换成方差匹配的均匀分布只掉 7 个点、仍然高于不采样——说明收益主要来自"随机覆盖信息量带"这件事本身,而不是高斯的确切形状,作者自己也诚实地承认了这点。去掉自适应方差后 Long 任务从 94.7% 暴跌到 78.3%,说明难任务上"撒得开"比"瞄得准"更关键。
🤔 我的判断
这篇论文最打动我的不是方法本身——说实话方法部分的每个组件(全局 bang-bang 调整、EMA 统计、按长度聚类)单拎出来都朴素得不能再朴素——而是它的论证结构:先用诊断实验证明"标量深度"这个假设在结构上是错的,再把"带 + 高斯剖面"的经验发现直接映射成分布的两个参数,最后让调度参数白嫖现有 rollout 统计。整条链没有一处是硬凑的。
但也要泼几盆冷水。
依赖专家轨迹是硬门槛。 每个训练任务要有一条专家轨迹,作者把它列在 limitations 第一条。数学推理和 ALFWorld/WebShop 这类环境里专家轨迹好拿,但真实业务场景里这往往是最贵的资产。弱监督(次优演示、语言提示)能不能接进这个框架,论文自己也说没答案。
按轨迹长度聚类是个糙代理。 长度 ≈ 难度在 ALFWorld 这种任务族里成立,换个领域未必。而且聚类是离线固定的——策略变强后任务的相对难度在漂,簇不会跟着漂。K=1 掉到 89.1 说明聚类重要,但"怎么聚得更好"这篇没碰。
WebShop 上并非全面领先。 7B 的 Enumeration 在 WebShop Score(96.0)和 Succ(89.8)上都压过 Agent-G²(92.3 / 84.4),所以"最强非探测方法"这个定语在 WebShop 上是必要的修饰。当然,考虑到 Enumeration 近 5 倍的单步成本,这个交换在多数场景下仍然划算。
诊断只在单点做。 σ=0.22、R²=0.92 的高斯拟合是在 Qwen2.5-1.5B / ALFWorld 第 50 步这一个训练点上做的(附录补了跨训练窗口的拟合,Table 6,但仍是单一基准单一模型)。换骨干、换环境,这个剖面还是不是高斯、方差多大,需要重新验。好在均匀分布消融说明形状不是关键因素,这个风险比看起来小。
跟同期工作摆在一起看:StepHint、TRAPO 这类端到端方法在表 1 里全面输给朴素的 Step decay,多少说明"学一个深度预测器"这条路目前在 agentic 任务上还没走通;Agent-G² 绕开预测器、直接把调度变成一个可在线估计的统计问题,是当下更务实的路线。它不是底层突破,但它把一个被默认的错误假设矫正了过来,并且给了几乎零成本的替换方案——如果你正在做 hint-based RL 或者任何形式的课程式智能体训练,这个改动值得直接抄进代码里。
还有一个更本质的问题悬着:高斯覆盖解决的是"深度分配",但"哪些状态值得作为探索起点"这个问题比"前缀留多长"更一般。把引导从"专家轨迹前缀"推广到"信息量最大的中间状态集合",可能是这条线下一步真正有意思的地方。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新AI前沿,关注我