自蒸馏训练让搜索Agent自我进化
推荐指数 79.0 NO. 022 · 2026.07.22
upvotes69comments3
为什么值得看
DeepSearch-Evolve提出了一种无需固定教师轨迹的Agent自蒸馏框架,在可验证的搜索环境中通过自我经验迭代提升。该框架支持进度验证、反思和失败恢复等认知行为,为长程交互Agent的训练提供了比稀疏奖励RL更强的监督信号。
媒体预览
编辑判断
当前Agent训练的主流范式要么是依赖GPT-4蒸馏的固定轨迹做SFT,要么是RLHF/RLVR那种稀疏到几乎无法指导长程搜索的奖励信号。这篇工作的关键设计是造了一个"可验证"的确定性环境——420K任务基于实体随机 walk 生成,答案对错能自动判定,这才让self-distillation的循环跑起来。
工程落地上需要关注两点:一是这个环境目前还是模拟的,真实网页的动态性和反爬机制会让verifiability大打折扣;二是420K的规模对于严肃的训练来说偏小,更像proof-of-concept。如果代码开源,值得借鉴的是其"progress verification + grounded reflection"的任务设计思路,这比框架本身更容易迁移到真实业务场景。
做垂直领域搜索Agent(如法律检索、医疗文献)的团队可以重点参考,这类场景往往本身就有确定的答案来源,verifiability条件天然满足。
相关内容
Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning 同期研究,提出自我蒸馏驱动搜索增强推理的自我进化机制,与原文技术路线高度相关。 Training LLM Agents for Spontaneous, Reward-Free Self-Evolution via World Knowledge Exploration 探索无奖励信号下LLM智能体通过世界知识探索实现自发进化,补充原文方法论。 DeepSearch-World: Self-Distillation for Deep Search Agents in a Verifiable Environment 可验证环境下的深度搜索智能体自蒸馏训练,与原文核心概念一致,提供环境验证视角。 自我进化智能体 中文技术博客解读自我进化型AI理念,强调系统主动修改自身、改进自身的能力。