论文标题: From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search
论文地址: https://arxiv.org/abs/2607.24280
开源代码: https://github.com/UCAS-IPA/MAPD
作者单位: 中国科学院大学、清华大学、北京大学、北京理工大学、华东师范大学、中国科学技术大学
发表时间: 2026年7月27日


背景知识

在深入解读 MAPD 这篇论文之前,有必要先了解几个核心概念。

什么是智能体搜索(Agentic Search)? 传统的问答系统是一次性的——你问一个问题,模型给一个答案。但智能体搜索不同,它让大语言模型像人类一样,通过多步推理与检索交替进行来解决知识密集型任务。模型可以主动决定“先搜什么、再搜什么”,像一个真正的智能体一样在信息海洋中探索。

什么是知识蒸馏(Knowledge Distillation)? 简单说就是“好学生向学霸学习”。用一个能力更强的大模型(教师)来指导一个更小的模型(学生),把教师的“知识” transfer 给学生。传统蒸馏依赖于匹配教师和学生的输出概率分布,但闭源模型不给你看这些内部数据。

什么是 GRPO? 这是 DeepSeek 提出的一种强化学习算法,是 PPO 的简化版本,省去了价值网络,通过组内相对比较来计算优势。在智能体搜索中,模型通过 GRPO 从“答对或答错”这个稀疏的最终反馈中学习——但问题是,这种反馈太“粗糙”了,模型很难知道中间哪一步做对了、哪一步做错了。

一、背景:Agentic Search的"蒸馏困境"

1.1 Agentic Search为何需要密集监督?

Agentic Search(智能体搜索)已成为LLM解决知识密集型任务的核心范式。与单轮问答不同,Agentic Search要求模型在多轮交互中交替进行推理检索,逐步收敛到正确答案。现有主流优化框架(如Search-R1、WebRL)依赖基于结果的强化学习(RLVR)——只有最终答案正确才能获得奖励信号。

这种稀疏监督的根本缺陷在于:对于一个需要4轮检索+3步推理才能解决的复杂问题,RLVR只能在终点给出一个0或1的信号,中间每一步的搜索策略、推理路径、信息整合方式都得不到任何梯度指导。这就像让一个人在黑暗中走迷宫,只有走出迷宫才知道对错,但完全不知道哪一步走偏了。

1.2 专有模型蒸馏的两座"大山"

为了补全密集监督,研究者自然想到用能力更强的专有模型(Proprietary Model)作为教师进行蒸馏。然而,这条路在Agentic Search场景下被两座大山堵死:

第一座山:异构Tokenizer + 不可访问的Logits

传统知识蒸馏(KD)要求学生在token级别匹配教师的输出分布(KL散度对齐)。但专有模型(如Claude、GPT、Gemini)使用各自的Tokenizer,与开源学生模型(如Qwen)的词汇表完全不兼容。更致命的是,专有模型通过API提供,logits是黑盒不可访问的,token级对齐在数学上直接失效。

第二座山:自然语言轨迹模仿导致风格漂移与幻觉

既然无法做token对齐,一个自然的退而求其次是让学生直接模仿教师生成的自然语言推理轨迹(Chain-of-Thought)。但这在Agentic Search中会引发灾难性后果:

  • 风格漂移(Style Drift):Claude的推理风格冗长、爱用特定连接词;GPT习惯分段论证;Gemini偏好结构化列表。强制Qwen模仿这些"外语式"表达,会扭曲其自身的token分布。
  • 分布差距(Distribution Gap):专有模型的语言能力远超开源学生,学生被迫模仿超出自身能力边界的语言模式,导致幻觉加剧而非推理能力提升。论文Table 2的消融实验证实:直接蒸馏原始轨迹(w/o SP&MAS)的平均成功率比不用专有模型的GRPO+OPSD基线还要低

二、核心创新:用"结构化协议"架起蒸馏桥梁

论文完整架构
MAPD的技术精髓可以概括为:一个中间表示、一套离线合成管道、一个联合训练目标

2.1 结构化JSON协议:把"认知策略"从"语言外壳"中剥离

MAPD的核心洞察是:教师真正有价值的是其推理策略,而非遣词造句。因此,论文设计了一种风格归一化的结构化JSON协议(Structured JSON Protocol),将教师的问题解决过程抽象为五个纯粹语义维度:

字段 含义 作用
task_type 任务类型(single_hop / multi_hop / comparison / others) 决定顶层认知策略
reasoning_plan 有序的子目标数组 将复杂任务分解为可执行的搜索与推理步骤
grounding_facts 从检索环境中提取的证据集合 强制忠实推理,抑制参数化幻觉
partial_findings 多轮搜索失败时的中间发现 记录"已确认X,但Y缺失"的诊断信息
answer_verification 最终答案 + answer_grounded布尔标志 确保结论被检索事实严格支撑

这种设计的精妙之处在于双向解耦

  • 对教师:无论Claude、GPT还是Gemini,其探索轨迹都被"翻译"为同一种语义协议,消除了模型特异性。
  • 对学生:协议作为Privileged Information(PI)注入训练,学生只需学习协议背后的策略结构,无需模仿任何教师的表面语言风格。

2.2 三阶段MAS合成管道:离线生成高质量协议

MAS合成管道
协议不是人工写的,而是由一套专有模型驱动的多智能体系统(MAS)自动合成。整个管道分为三个阶段,且ground-truth答案被严格限制在离线阶段,绝不泄露给学生:

Stage A:多智能体协作搜索

  • Orchestrator Agent:将查询分解为带依赖注解的子任务,按拓扑层级调度。
  • Searcher Agents:并行执行检索,每个Searcher最多发起K次查询,将检索到的段落压缩为简洁发现。
  • EM检查:若候选答案与ground-truth匹配,进入Stage B;若失败,触发Repair Agent。
  • Repair Agent:利用ground-truth作为诊断指引(但不写入探索日志),回溯失败原因——是"表达问题"(证据已找到但答案格式错误)还是"搜索问题"(证据缺失)?然后针对性重新分解和补充检索,最多R轮修复。

Stage B:协议生成(Protocolizer)

Protocolizer Agent将Stage A产生的非结构化探索日志转化为结构化JSON协议,并分为两种变体:

  • Succeeded Protocol:搜索成功,包含完整验证答案。
  • Evidence Protocol:搜索失败,省略确定性答案,替换为中性部分发现摘要(如"已确认Duncan Farm属于Hopewell交换体系,但’cultivated’的精确语义未解决")。

生成过程强制两条铁律:

  1. 无后见之明(No Hindsight)reasoning_plan必须逐步制定,严禁提及最终结果或后续搜索结果,防止数据泄露。
  2. 抽取式锚定(Extractive Grounding)grounding_facts必须是检索段落中的逐字子串,杜绝模型编造。

Stage C:质量门(Quality Gate)

每份协议必须通过四道自动关卡才能进入训练集:

  1. Schema Validation:JSON结构合法且字段完整。
  2. EM一致性(仅Succeeded Protocol):提取答案与ground-truth严格匹配。
  3. Grounding Verification:所有事实均能在检索原文中找到逐字匹配。
  4. Leak Detection:推理步骤中未注入任何oracle知识。

论文报告该管道的协议合格率高达99.33%(3000条样本人工验证)。

2.3 联合训练目标:密集蒸馏信号 + 稀疏RL信号

在这里插入图片描述
在线训练阶段,MAPD采用同策略自蒸馏(OPSD)GRPO的联合优化:
L(θ)=λOPSD⋅LOPSD(θ)+LGRPO(θ) \mathcal{L}(\theta) = \lambda_{\text{OPSD}} \cdot \mathcal{L}_{\text{OPSD}}(\theta) + \mathcal{L}_{\text{GRPO}}(\theta) L(θ)=λOPSDLOPSD(θ)+LGRPO(θ)

OPSD(Online Policy Self-Distillation)

从同一策略参数中分叉出两个分支:

  • Student Branch:条件为 st=(x,y<t)s_t = (x, y_{<t})st=(x,y<t),即仅输入问题和已生成token。
  • Teacher Branch(Privileged):条件为 st+=(x,p,y<t)s_t^+ = (x, \mathbf{p}, y_{<t})st+=(x,p,y<t),额外输入结构化协议作为特权信息。

两个分支共享同一模型权重,反向传播时梯度只流向Student Branch,最小化两个分支输出分布的反向KL散度:

LOPSD(t)=DKL(πθk(⋅∣st)∥πθk(⋅∣st+)) \mathcal{L}_{\text{OPSD}}^{(t)} = \mathbb{D}_{\text{KL}}\big(\pi_{\theta_k}(\cdot \mid s_t) \parallel \pi_{\theta_k}(\cdot \mid s_t^+)\big) LOPSD(t)=DKL(πθk(st)πθk(st+))

由于两个分支使用同一模型的同一Tokenizer,这天然规避了异构Tokenizer问题。协议作为PI提供了"教师视角"的密集监督,告诉学生"如果知道最优策略,下一步应该怎么分布"。

GRPO(Group Relative Policy Optimization)

提供稀疏但可靠的结果驱动信号,通过分组采样和裁剪代理目标优化策略,防止OPSD alone导致的分布坍塌。

关键超参数 λ\lambdaλ 的"甜蜜点"

论文对 λ∈{0.01,0.05,0.1}\lambda \in \{0.01, 0.05, 0.1\}λ{0.01,0.05,0.1} 进行了系统消融:

  • λ=0.01\lambda = 0.01λ=0.01(蒸馏过弱):OPSD信号在训练约100步后即被GRPO淹没,教师-学生差距过早收敛。但即便如此,仍比纯GRPO有提升(37.1% vs 31.6%)。
  • λ=0.05\lambda = 0.05λ=0.05(最佳平衡点):在Qwen3-1.7B上达到39.4%,Qwen3-4B上达到44.4%。蒸馏信号持续存在,且不会破坏策略稳定性。
  • λ=0.1\lambda = 0.1λ=0.1(蒸馏过强):引发Agentic Search特有的行为退化——平均回复长度从135 token暴跌至42 token,工具调用次数饱和在最大值3.0次/episode。模型学会了"检索但不推理"的捷径:单跳任务略有提升,但多跳任务(如2WikiMultihopQA从45.7%跌至38.4%)严重受损。

这一发现揭示了Agentic Distillation的根本张力:蒸馏太少则指导不足,蒸馏太多则侵蚀多步推理能力


三、实验验证:跨教师、跨基准的稳健提升

3.1 主实验:七个QA基准全面领先

论文在7个知识密集型QA基准上评估,涵盖单跳(NQ、TriviaQA、PopQA)和多跳(HotpotQA、2WikiMultihopQA、MuSiQue、Bamboogle)推理。其中5个评估集完全未参与训练,属于严格OOD测试。

方法 Qwen3-1.7B 平均 Qwen3-4B 平均
Vanilla 25.7 28.8
OPSD 5.9 20.9
GRPO 31.6 37.4
GRPO+OPSD 30.5 38.3
SDAR(最强基线) 37.6 43.0
MAPD (Ours) 39.4 44.4
相对SDAR提升 +4.8% +3.3%

关键发现:

  • MAPD全面超越所有基线,包括纯RL、纯蒸馏和混合方法。
  • 多跳任务增益显著高于单跳:Qwen3-1.7B在多跳基准上的相对增益达7.9%,远超单跳的2.3%。这与MAS管道的多步分解和证据聚合能力直接对应。
  • 纯OPSD在Agentic配置下灾难性崩溃:Qwen3-1.7B仅得5.9%,原因是缺乏外部PI时,自蒸馏驱动模型生成病态冗长输出(长度裁剪率从5%飙升至74%)。这反向证明了引入外部高质量PI的必要性

3.2 消融实验:三个组件缺一不可

配置 PM SP MAS Qwen3-1.7B Qwen3-4B
GRPO+OPSD 30.5 38.3
SDAR 37.6 43.0
原始轨迹(单PM) 30.1 37.3
原始轨迹(MAS) 29.2 36.1
协议(单PM,无MAS) 37.1 42.9
MAPD(完整版) 39.4 44.4

三个关键结论:

  1. 结构化协议是跨模型蒸馏的必需品:直接蒸馏原始自然语言轨迹(无SP&MAS)比不用专有模型还差。引入结构化协议后,单教师设置下性能跃升+7.0/+5.6个百分点。这证实了风格漂移和分布差距是真实存在的瓶颈。

  2. MAS不能替代结构化协议:仅用MAS而不做协议规范化(w/o SP),性能反而略降(29.2%/36.1%)。因为MAS产生了更丰富但也更嘈杂的自然语言轨迹,加剧了风格迁移问题。

  3. MAS提升协议质量:完整版MAPD优于单教师协议(w/o MAS),说明MAS的协作搜索深度和错误恢复能力是单模型调用无法比拟的。SP保证信号"可学习",MAS保证信号"事实准确、推理完整"。

3.3 跨教师泛化:协议真正实现了"教师无关"

MAPD的一个核心优势是跨专有教师模型的可迁移性。论文用Claude-Opus-4.6、GPT-5.5、Gemini-3.1-Pro分别生成协议,在完全相同的MAPD架构和超参数下训练:

教师模型 Qwen3-1.7B Qwen3-4B
Claude-Opus-4.6 39.4 44.4
GPT-5.5 39.0 44.6
Gemini-3.1-Pro 37.9 44.0

三者结果差异在2个百分点以内,方差极小。这证明结构化JSON协议成功抽象掉了教师特异性,隔离了语义推理与语言风格。对工业界而言,这意味着可以无缝切换API以优化成本-延迟权衡,无需重新调优。

3.4 成本分析:一次性投入,零推理开销

以Gemini-3.1-Pro为例,处理25,600条训练实例:

  • 协议合格率:99.94%
  • 每实例平均调用教师LLM:~6.3次
  • 每实例平均消耗token:~12.5K
  • 每实例均摊成本:$0.057
  • 整个训练集一次性生成成本:~$1,454

由于所有协议离线预合成并缓存,这笔成本仅在数据准备阶段产生一次,推理时零开销


四、学术洞见:MAPD揭示了什么深层规律?

洞见一:"中间表示"是异构模型对齐的关键

MAPD的成功本质上验证了表示学习的一个古老真理:当两个系统的原始表示空间不兼容时,引入一个语义等价但形式中立的中介表示,比强行对齐原始空间更有效。在LLM蒸馏中,这个中介就是结构化协议。它既不是token logits(不可行),也不是自然语言(有噪声),而是一种语义骨架

洞见二:Privileged Information的"保质期"问题

论文的训练动态分析揭示了一个有趣现象:当 λ=0.01\lambda=0.01λ=0.01 时,OPSD的蒸馏信号在约100步后就消失了(教师-学生KL差距坍塌)。但即便如此,模型仍比纯GRPO表现更好。这说明高质量PI的价值不仅在于全程陪伴,更在于训练初期的"方向设定"——就像火箭发射时的助推器,即使早早脱落,也已经把载荷推入了正确轨道。

洞见三:过度蒸馏会诱发"检索但不推理"的捷径

λ=0.1\lambda=0.1λ=0.1 时的行为退化(回复长度暴跌、工具调用饱和)是一个重要警示:在Agentic场景中,过度正则化会让模型放弃多步CoT,转而依赖高频检索碰运气。这提示我们,蒸馏的目标不应该是让学生"像教师一样说话",而是让学生"像教师一样思考"。结构化协议恰好守住了这条边界。


五、局限性与未来方向

论文坦诚讨论了MAPD的局限:

  1. 冷启动依赖:初始MAS设计和协议Schema需要一定领域知识,无法完全零样本启动。
  2. 协议Schema固定:当前五个字段是人工设计的,未来可探索让Schema本身也随训练自适应进化。
  3. 单领域验证:当前仅在知识密集型QA上验证,工具调用、代码生成等更广泛的Agentic场景有待探索。

未来方向包括:

  • 跨领域协议迁移(如从QA协议迁移到工具调用协议)
  • 多模态协议定义(融合图像、表格等异构证据)
  • 将协议库与外部知识图谱融合,实现可解释的神经-符号混合推理

六、核心思想总结与可借鉴点

MAPD的核心思想可以用一句话概括:不要让开源模型在黑暗中模仿专有模型的"口音",给它一张结构化的"思维导图"作为翻译。这张"思维导图"同时扮演三个角色:

  • 语义净化器:剥离教师模型的语言特异性,保留纯粹的认知策略。
  • 密集监督源:在RL稀疏奖励的荒漠中,提供token级的梯度绿洲。
  • 质量过滤器:通过MAS协作和四重质量门,确保监督信号的事实准确性。

对研究者的借鉴

  1. 当面对异构Tokenizer或黑盒API时,结构化中间表示是比文本模仿更可靠的蒸馏路径。
  2. MAS不必部署在推理时(高延迟、高成本),完全可以作为离线知识合成器,将协作策略蒸馏进单模型。
  3. 联合训练中的蒸馏权重 λ\lambdaλ 不是随意设置的,它存在与任务复杂度相关的"甜蜜点",需要通过训练动态监控(如回复长度、工具调用频率)来诊断。

对工程师的借鉴

  1. 如果你正在用Claude/GPT生成CoT数据来微调开源模型,请停下来考虑将其转化为结构化协议——这可能比原始文本带来更稳定的增益。
  2. 协议生成是一次性成本($1,454量级),却能在推理时完全消除对专有API的依赖,成本-效益比极高

MAPD 通过离线多智能体生成标准化结构化协议,搭建闭源强模型与开源小模型的知识桥梁,结合稠密蒸馏 + 稀疏强化联合训练,低成本、无副作用地将高阶检索推理能力迁移至开源智能体,为异构大模型知识蒸馏提供全新通用解决方案。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐