经验不是想复用就复用:BCIT 给自主后训练加了一道「授权关卡」
你有没有想过一个问题:一个全自动的模型训练 Agent,跑着跑着积累了几十条「上次这么训效果不错」的经验——这些经验在模型已经变了好几轮之后,还作数吗?
上周读到 arXiv 2608.26730 这篇论文,它把这个很少有人认真讨论的问题单独拎了出来,还起了个名字:条件经验迁移(Conditional Experience Transfer)。说实话我第一反应是「这不就是检索加规则吗」,但读完之后发现,它真正值钱的地方在于把一个隐含的工程直觉——过去的效果只是来源上下文里的证据,不是当前上下文里的许可证——变成了一套显式的、可审计的决策机制。
核心摘要
自主后训练系统(自动提议更新、训练候选、评估反馈、迭代下一轮)会不断积累「更新→结果」的历史记录。但一个更新的效果绑定在它的父模型、数据配比和训练阶段上,父模型一旦换人,旧证据就可能失效甚至误导。这篇论文提出 BCIT(Boundary-Calibrated Intervention Transfer,边界校准干预迁移):在动用真金白银的全量训练算力之前,先对每条经验做授权裁决——硬冲突直接否决、证据不足就做有预算上限的当前状态试训、证据达标才放行全量训练。在 Qwen3-4B 跨金融推理、text-to-SQL、函数调用三个方向的实验中,BCIT 在等算力预算下把最终模型均分从 Flat-Additive 的 44.4 拉到 47.0,同时有害更新的授权率从 62.5% 压到 25.0%。这不是底层算法突破,而是一个把「该不该信旧经验」制度化的控制层设计——但恰恰是自主训练系统走向实用绕不开的那一层。
论文信息
- 标题:Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training
- 作者:Tingyun Li, Wenfeng Feng, Weiqing Li, Abudukelimu W