AMAZINGINDEX.COM 日报快照
56.9
VOL. 2026.07
2026.07.22
← 返回 2026.07.22 日报
日报快照 · Daily Snapshot
NO. 022

自蒸馏训练让搜索Agent自我进化

#HF_PAPERS HuggingFace Papers 2026.07.22
推荐指数 79.0 NO. 022 · 2026.07.22
upvotes69comments3

DeepSearch-Evolve提出了一种无需固定教师轨迹的Agent自蒸馏框架,在可验证的搜索环境中通过自我经验迭代提升。该框架支持进度验证、反思和失败恢复等认知行为,为长程交互Agent的训练提供了比稀疏奖励RL更强的监督信号。

自蒸馏训练让搜索Agent自我进化

当前Agent训练的主流范式要么是依赖GPT-4蒸馏的固定轨迹做SFT,要么是RLHF/RLVR那种稀疏到几乎无法指导长程搜索的奖励信号。这篇工作的关键设计是造了一个"可验证"的确定性环境——420K任务基于实体随机 walk 生成,答案对错能自动判定,这才让self-distillation的循环跑起来。

工程落地上需要关注两点:一是这个环境目前还是模拟的,真实网页的动态性和反爬机制会让verifiability大打折扣;二是420K的规模对于严肃的训练来说偏小,更像proof-of-concept。如果代码开源,值得借鉴的是其"progress verification + grounded reflection"的任务设计思路,这比框架本身更容易迁移到真实业务场景。

做垂直领域搜索Agent(如法律检索、医疗文献)的团队可以重点参考,这类场景往往本身就有确定的答案来源,verifiability条件天然满足。

查看原文 →