多智能体协议蒸馏让开源模型学会搜索推理
推荐指数 72.0 NO. 019 · 2026.07.29
upvotes64comments1
为什么值得看
提出MAP蒸馏框架,用多个开源智能体模拟专有模型的搜索决策过程,绕过无法获取logits的限制。开源模型经蒸馏后在复杂搜索任务上逼近专有模型水平,为AI搜索落地提供低成本路径。
媒体预览
编辑判断
这篇论文的巧妙之处在于绕过了蒸馏专有模型时最头疼的两个约束:黑盒API拿不到logits、tokenizer不同无法直接对齐。用多智能体投票来近似教师分布,本质上是用集成学习的思路做知识提取。
之前大家做搜索增强生成,要么直接用GPT-4做教师做SFT,要么自己从头训RL,前者贵且浅,后者稀疏难收敛。这个方法在HotpotQA上的实验显示7B模型能追到GPT-4o的87%水平,成本只有直接调用的1/20。
代码和训练脚本是否开源还没看到明确说明,如果放出来,做垂直领域搜索的中小团队可以省掉大量标注和RL调参成本,建议关注HuggingFace仓库更新。
相关内容
From Proprietary to Open-Source: Bridging the Distribution Gap via Multi-Agent Protocol Distillation in Agentic Search 提出多智能体协议蒸馏方法,将闭源模型的搜索推理能力迁移至开源模型,解决分布差距问题。 Chain-of-Agents:多智能体蒸馏技术让推理成本降低84.6% 多智能体蒸馏框架可降低推理成本84.6%,研究团队开源全部代码、数据和模型。 蒸馏DeepSeek-R1等深度推理大模型 DeepSeek-R1蒸馏小模型部署方案,支持SGLang和vLLM加速,671B参数模型MIT协议开源。