蒸馏 Claude 给 Qwen 总是翻车?问题出在「风格」上
核心摘要
我们用闭源大模型(Claude、GPT、Gemini)当老师、开源模型(Qwen3-1.7B/4B)当学生做蒸馏训练,想让开源学生学会 agentic search。这事儿有两道坎:一是 token 词汇表对不上、专有模型的 logits 又不可见,传统 KL 对齐在数学上根本定义不了;二是退一步让开源模型模仿老师的自然语言轨迹,结果学生学了一身"老师的说话腔调",检索-推理该干嘛还是不会,风格漂移和幻觉一起来。
这篇论文(arXiv:2607.24280)的解法挺直接:用一个结构化 JSON 协议当中间表示——让专有模型驱动的多智能体系统把"怎么思考、查什么、证据是什么"打包成任务类型、推理计划、抽取式事实、答案校验五个字段,然后把这套协议作为特权信息喂给学生模型的训练分支。这套方案叫 MAPD(Multi-Agent Protocol Distillation),在 7 个 QA benchmark 上比最强 baseline(SDAR)平均多拿 3-5 个点,多跳任务提升尤其猛(最高 7.9%)。
读完的感受:这不是"用闭源老师"的胜利,而是"风格解耦"的胜利。把专有模型特有的语言外壳剥掉,只学它的认知策略——这个想法本身比框架花活儿值钱得多。值得做 agent / 蒸馏方向的人细读。
论文信息
- 论文标题:From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
- 作者:Junlin Liu, Jiangwang Chen, Zixin Song, Shuaiyu Zhou, Chunji Lv, Hank Wu, Kailin Jiang, Jinyang Wu, Bohan Yu, Chenxi Zhou
- arXiv: 2607.24280
- 代码:https://github.com/AaronLiu0702/MAPD
- 发布时间:2026 年 7 月 27 日
为什么要从闭源模型蒸馏?这事儿的坑到底在哪
我之前在团队里推 agentic search 训练的时候,第一反应就是"用 GPT-4 蒸馏到 Qwen,肯定比从 Qwen 自己蒸馏强"。这个直觉其实很朴素——闭源模型推理能力强,蒸馏出来的小模型应该能继承。
但实操就翻车了。我观察到的现象和这篇论文在 Introduction 里写的完全一致:
- 直接对 logits 做 KL 散度?算不了。Qwen 的 token 体系和 Claude 的 token 体系不是一套词汇表,tokenize 出来的东西没法对齐;而且 Claude 根本不给你 logits(API 调用返回的只有文本)。
- 退一步,让学生模型模仿老师的自然语言轨迹?表面能学,实质在走偏。学生把"好的,让我先想想……"、"从某个角度来说……"这种 Claude 特有的"腔调"学了个十足,轮到真正要拆解问题、检索证据、综合答案的时候,能力并没有真的迁移过来。风格漂移和幻觉一起来。
这两道坎就构成了"闭源老师带不动开源学生"的核心矛盾。Figure 1 把这件事总结得很清楚——

图 1:三种蒸馏路径的对比。红色路线(直接 KL 对齐)被"异构 token 词汇表 + logits 不可见"卡死;橙色路线(自然语言轨迹模仿)诱发风格漂移和幻觉;绿色路线是 MAPD,用结构化协议当桥,把风格问题和事实问题分离。
注意 Figure 1 最右边那张脸的对比:失败、苦脸、苦笑。这就是我们之前调试时看到"训练 loss 在降但准确率没动"时的心情。
怎么解决:让多智能体系统先生成一份"标准答案"
MAPD 的核心思想其实一句话就能讲清:别让学生学老师的"话",让学生学老师的"思路"。
那这个"思路"怎么获得?作者设计了一个离线多智能体系统(MAS)来生成"标准答案"——一个结构化的 JSON 协议。这个 MAS 流水线分三步:
第一步:多智能体协作搜索(Stage A)
MAS 里有三个角色:Orchestrator(编排者)、Searcher(搜索者)、Repair(修复者)。
工作流是这样的: 1. Orchestrator 把问题 \(x\) 拆成带依赖关系的子任务,并行分派给多个 Searcher 2. 每个 Searcher 最多发 \(K=3\) 个检索查询,从 wiki-18 语料库拿 top-3 段落,压缩成简短发现 3. Orchestrator 汇总后做精确匹配(EM)检查,通过就过;没通过就调用 Repair agent 4. Repair agent 用 ground-truth 答案诊断——是"表达问题"(证据对了但答案格式没对齐)还是"搜索问题",针对性重做,最多 2 轮
这里有个细节我之前没在别的工作里看到:ground-truth 答案只用作 Repair 的诊断信号,绝不进入探索日志和检索查询。这是为了避免"开卷作弊"——如果学生训练时看到的证据就是答案本身,那蒸馏出来的不叫学生,叫复读机。
第二步:协议生成(Stage B)
Protocolizer agent 把 Stage A 的非结构化探索日志转换成结构化 JSON 协议。两种情况: - 成功轨迹 → 生成 Succeeded Protocol,包含完整验证的答案 - 失败轨迹 → 生成 Evidence Protocol,省掉答案,替换成"已确认 X,但是 Y 缺证据"这种中性表述
协议长这样(5 个字段):
| 字段 | 含义 |
|---|---|
| Task Type | 任务类型(single_hop / multi_hop / comparison / others),决定整体策略 |
| Reasoning Plan | 有序子目标数组,把复杂任务拆成可处理的检索+推理步骤 |
| Grounding Facts | 从检索段落里逐字抽取的事实集(必须是字面子串) |
| Partial Findings | 失败轨迹中的中间发现(可选) |
| Answer Verification | 最终答案 + 布尔标志 answer_grounded |
第三步:质量门控(Stage C)
协议进训练集之前过四道关:JSON 格式合法、答案 EM 匹配、事实抽取可验证、无 oracle 泄露。作者报告在 3000 个实例上达到了 99.33% 的通过率——挺扎实的。
整个 MAS 流水线只在离线阶段跑一遍。一次性成本:25,600 个实例、25,584 个协议通过、每实例约 6.3 次 LLM 调用、约 12.5K tokens,整份训练集生成一次只要 1454 美元。推理时这个 MAS 完全不参与,零开销。
怎么用这份协议训练学生模型
光生成协议不够,问题是这玩意儿怎么作为监督信号送进学生模型。
这里 MAPD 用了 On-Policy Self-Distillation(OPSD)的框架,但是改了特权信息的来源。
标准的 OPSD 是这样的:让一个学生模型的两个分支共享参数—— - 学生分支:条件于 \(s_t = (x, y_{<t})\) - 教师分支(特权分支):条件于 \(s_t^+ = (x, p, y_{<t})\)
两个分支都从同一当前策略参数采样下一个 token 的分布,然后最小化反向 KL:
梯度只通过学生路径回传。这个设计精妙在同源:因为学生和老师都是同一个模型自己,所以 token 词汇表天然对齐了,不再有"Claude 的 token 怎么对应到 Qwen 的 token"这个根本问题。
但标准的 OPSD 里 \(p\) 来自学生自己的成功 rollout,这就把监督质量封顶在学生现有能力上限。MAPD 的关键改造:把 \(p\) 换成 MAS 生成的结构化协议 \(p = f(z)\)。
最终的联合目标:
- \(\mathcal{L}_{\text{OPSD}}\):从结构化协议来的 dense token 级信号,负责逐步信用分配
- \(\mathcal{L}_{\text{GRPO}}\):从最终 EM 来的 sparse RL 信号,负责对结果负责
- \(\lambda_{\text{OPSD}}\):控制蒸馏压力的超参

图 2:MAPD 框架。左边蓝色框是 Stage A 多智能体协作搜索(带 Repair 机制),中间橙色框是 Stage B 协议生成 + Stage C 质量门控,右边绿色框是联合训练阶段(OPSD 蒸馏信号 + GRPO RL 信号)。重点:协议在训练前一次性预合成,推理时学生模型只需要原始输入。
Figure 2 让我觉得作者讲故事能力挺强——他们没有把协议生成和训练混着画,而是先离线(左边和中间),再在线(右边),用颜色一区隔,训练时协议怎么进入特权分支的路径就一目了然了。
实验数据说话
主实验:7 个 QA benchmark、3 个教师、2 个学生规模
训练数据只用 NQ + HotpotQA 的训练集。评估用 7 个 benchmark——NQ、TriviaQA、PopQA(单跳)和 HotpotQA、2WikiMultihopQA、MuSiQue、Bamboogle(多跳)。其中 5 个完全没在训练里出现(分布外测试),2 个共享的确保无问题级别重叠。
学生用 Qwen3-1.7B 和 Qwen3-4B,从预训练 checkpoint 初始化。教师默认是 Claude-Opus-4.6,对比还跑了 GPT-5.5 和 Gemini-3.1-Pro。超参:8 卡 GPU,batch size 128,每 prompt 8 rollout,学习率 1e-6,200 步,max prompt 长度 4096,max response 长度 512。
先看 1.7B 的主结果(Table 1 完整版):
| Method | NQ | TriviaQA | PopQA | HotpotQA | 2Wiki | MuSiQue | Bamboogle | Avg. |
|---|---|---|---|---|---|---|---|---|
| Vanilla | 29.9 | 46.4 | 39.1 | 23.9 | 18.8 | 4.9 | 16.8 | 25.7 |
| OPSD | 4.2 | 8.3 | 4.6 | 6.6 | 15.3 | 0.7 | 1.6 | 5.9 |
| GRPO | 36.9 | 54.6 | 43.1 | 29.8 | 27.5 | 6.8 | 22.4 | 31.6 |
| GRPO+OPSD | 37.0 | 54.6 | 41.4 | 29.9 | 23.3 | 6.5 | 20.8 | 30.5 |
| SDAR | 43.4 | 58.1 | 47.6 | 37.0 | 34.3 | 10.6 | 32.0 | 37.6 |
| MAPD | 45.1 | 58.6 | 48.6 | 39.0 | 36.2 | 11.2 | 36.8 | 39.4 |
| 相对 SDAR 增益 | +3.9% | +0.9% | +2.1% | +5.4% | +5.5% | +5.7% | +15.0% | +4.8% |
Qwen3-4B 上同样稳定——MAPD 拿到 44.4% 平均分,比 SDAR 的 43.0% 多 3.3%。
几个数据点必须拎出来说:
1) 纯 OPSD 灾难性崩溃。 在 agentic 训练配置下,纯 OPSD 把 Qwen3-1.7B 从 25.7% 砸到 5.9%,4B 也从 28.8% 跌到 20.9%。作者诊断说长度截断比例从 5% 飙升到 74%——纯 self-distillation 在长轨迹上根本撑不住,它需要一个质量高于学生自身的特权信息源。这点对所有想做自蒸馏的人是警示:没有外部 PI 的自蒸馏,把学生自己的高分答案当老师,效果反而比纯 RL 还差。
2) 多跳任务提升远超单跳。 1.7B 在多跳平均 7.9% 增益,单跳只有 2.3%。Bamboogle 上更夸张——比 SDAR 多拿 15.0%。这其实非常符合直觉:多跳任务正好是 MAS 协作分解和证据聚合的拿手好戏,单跳任务主要靠记忆,闭源老师的优势没那么明显。
3) 增益的稳定性。 看 Table 1,MAPD 在所有 7 个 benchmark 上全部超过 SDAR,没有任何一个子任务掉队。这种全点位领先在我看来比"平均涨 5 个点"更有说服力。
消融实验:三个组件各自值多少
Table 2 把 MAPD 的三个关键组件拆开看——PM(专有模型)、SP(结构化协议)、MAS(多智能体系统):
| 变体 | PM | SP | MAS | 1.7B Avg. | 4B Avg. |
|---|---|---|---|---|---|
| GRPO+OPSD | ✗ | ✗ | ✗ | 30.5 | 38.3 |
| SDAR | ✗ | ✗ | ✗ | 37.6 | 43.0 |
| Raw trajectory (single PM) | ✓ | ✗ | ✗ | 30.1 | 37.3 |
| Raw trajectory (MAS) | ✓ | ✗ | ✓ | 29.2 | 36.1 |
| Protocol (single PM) | ✓ | ✓ | ✗ | 37.1 | 42.9 |
| MAPD | ✓ | ✓ | ✓ | 39.4 | 44.4 |
这个消融能看出几个事:
- 结构化协议是跨模型蒸馏的命脉:拿原始自然语言轨迹当 PI(变体 3、4)比不用闭源老师(GRPO+OPSD)还差。换成结构化协议(变体 5)就直接拉回到 SDAR 同一水平,1.7B 涨 7 个点、4B 涨 5.6 个点。
- MAS 不能替代结构化协议:变体 4(带 MAS 但不带 SP)甚至略差于变体 3(不带 MAS 也不带 SP),因为 MAS 让轨迹变长变丰富,但同时也更嘈杂,反而加剧风格转移。
- MAS 解决的是信号质量问题:完整 MAPD 比"用协议但不用 MAS"再多拿 2-3 个点——MAS 让协议事实更准确、推理更完整。
我的解读:这其实呼应了我之前的怀疑——"风格解耦"是核心,MAS 是工具。作者的写作很清醒,没有把功劳全归在多智能体框架上,消融直接把"协议结构"和"MAS 流水线"的贡献拆得很清楚。
损失权重 λ 的甜点位
Table 3 扫了三种教师 × 两种学生规模 × 三个 λ 值(0.01、0.05、0.10):

图 3:λ 在 0.01-0.10 区间内的表现。绿色阴影区是 0.04-0.06 的"sweet spot"。实线是 4B,虚线是 1.7B。三种教师模型用不同颜色区分。
数据里能看到:
- λ=0.01(弱蒸馏):平均比 0.05 低 1-2 个点。作者诊断是"蒸馏信号过早消失"——大概训练 100 步时师生分布差距就坍缩了
- λ=0.10(强蒸馏):4B 上 KL 散度膨胀到 1.06,约为 λ=0.01 的 4 倍。响应长度从 135 tokens 崩到 42 tokens,工具调用饱和在最大值 3.0/episode。模型学会了"检索不推理"的捷径——单跳略升,但多跳急剧下降
- λ=0.05:所有教师、所有学生规模上都是最佳或次佳,是真正的甜点位
这个曲线很优雅,也跟经验吻合——太弱的蒸馏信号没意义,太强的会让 RL 失衡。
跨教师泛化

图 4:Claude-Opus-4.6、GPT-5.5、Gemini-3.1-Pro 三种教师下 MAPD 的表现。虚线是 SDAR 基线(1.7B=37.6, 4B=43.0)。MAPD 在三个教师上全部超过基线,方差在 1-2 个点内。
数据看下来,三种教师在 1.7B 上分别是 39.4% / 39.0% / 37.9%,4B 上是 44.4% / 44.6% / 44.0%。协议成功抽象了教师特异性——这意味着如果哪天某个闭源 API 涨价了或者下架了,工程上可以直接换教师,训练流程不用动。
我的判断:风格解耦这条路值得更多人去走
读完 MAPD 我最大的收获不是"多智能体系统做协议生成"这个具体方案,而是它背后一个更普遍的洞察——在异构模型之间做知识迁移,瓶颈往往不是"知识"本身,而是"知识的表达形式"。
闭源大模型的推理能力为什么难迁移到开源小模型?因为开源学生一旦模仿闭源老师的语言风格,就被拉到了分布外的区域——token 概率分布偏离自然语料的统计规律,模型内部的注意力机制也跑偏。这个观点作者没直接讲,但消融数据完全支持。
从工程角度看 MAPD 的几个亮点:
1) 协议设计是真正可复用的资产。 JSON 的 5 个字段(task type / reasoning plan / grounding facts / partial findings / answer verification)很工程化,团队要自己搭一套类似的 pipeline,抄这个 schema 就能起步。相比之下,许多 agent 蒸馏论文里的"teacher trajectory"基本是"AI 自己聊了一段",没法直接拿来当接口用。
2) "离线生成 + 在线训练"的解耦是个聪明选择。 一次性的 $1454 成本换 25K 条高质量协议,比每步训练都调用闭源老师便宜太多。而且推理时协议完全不参与——零延迟开销。
3) 跨教师泛化不是 PR 词。 Table 3 + Figure 4 的数据是真做了三种教师实验,不是空喊。如果你们团队的闭源 API 经常换(比如做多供应商备份),这个特性值不少钱。
需要批评或者打个问号的地方:
- 纯 OPSD 崩溃的现象是反直觉的。 作者给了一个解释(长度截断饱和),但这个机制是不是唯一原因我没完全想清楚。是不是 token-level 的 reverse KL 在长轨迹上的数值稳定性本身就有问题?这个我猜值得再深挖。
- MAS 协议生成引入了 ground-truth 答案的依赖。 Repair agent 用 ground-truth 做诊断,ground-truth 不进训练数据这件事是作者自己说的。但协议生成阶段用了 GT 答案这件事会不会在某些场景下"过度优化"——比如真实业务里很多 QA 任务根本没有 GT 答案可以用?
- "Style drift"被论文当作主要负面效应,但度量并不直接。 论文没有专门 ablation 协议和"去掉风格词"的对比——他们说"协议结构解耦了风格",但要更严格地验证,可能需要类似"教师模型的句法特征是否还残留在学生输出里"这种测量。
不过整体看,这篇论文我觉得是近一两个月 agent + 蒸馏方向里问题意识最清楚的一篇。它没有堆"我们在 X benchmark 上多涨 3 个点"这种空话,而是把"为什么之前的蒸馏方案不 work"这件事掰开讲清楚了,再针对每个失败点给出一个具体的、可复现的解法。
工程落地的几点建议
如果你也在做 agentic search 的训练,下面几个点可能用得上:
1) 先检查你的 PI 是不是"高质量且风格解耦"。 MAPD 的实验反复证明:没有好 PI,self-distillation 比纯 RL 还差。PI 的关键是 (a) 质量高于学生自身,(b) 与学生输出风格分离。直接拿学生的成功 rollout 当 PI 在 agentic 场景下基本不 work。
2) JSON 协议这种"中间表示"是个被低估的工程模式。 比起"让大模型生成自然语言解释"再让小模型学,强制结构化输出能 (a) 用程序自动验证质量,(b) 剥离风格,(c) 让下游训练流程不用解析自由文本。先把能学的教会,剩下的再搜(Treasure the data, search for the rest)。
3) 离线协议合成的成本敏感性。 1454 美元做 25K 条协议,听起来不多,但协议质量门控的通过率是 99.94%——这个数字背后是 4 项自动检查 + 3000 样本的人工复核。如果你的协议生成没有这么严格的质检,训练效果大概率打折。
4) λ=0.05 可以当默认值。 论文在三种教师 × 两种规模上反复确认了 0.05 的甜点位。如果你想复现这个方案,别忘了这个超参——直接拿 0.01 或 0.10 跑出来会失望。
最后
MAPD 这套方案,说到底是在讲一件事:在异构模型之间迁移能力,不要让学生去模仿老师的"语言",让学生去模仿老师的"思路"。
把这条原则落地,靠的是三个工具的组合: - 多智能体系统负责把"思路"从无序轨迹里抽取出来 - 结构化 JSON 协议负责把"思路"和"语言"解耦 - OPSD 联合 GRPO负责把"思路"以密集 + 稀疏两种粒度灌给学生
对研究者来说,协议 schema 本身可能比整个框架更值得带走——你完全可以把 MAS 替换成单 agent pipeline,把 Claude 替换成 GPT,把 Qwen 替换成 Llama,核心 idea 是"风格解耦 + 同源自蒸馏"这两个不变的东西。
对做产品的人来说,这篇论文最有用的信息是:闭源模型蒸馏到开源模型,在 agentic 任务上,成本 1454 美元 + 200 步训练 + 7 个 benchmark 涨 3-5 个点。这事儿值得做。
觉得有启发的话,欢迎点赞、在看、转发。跟进最新 AI 前沿,关注我。