小数据SFT超越工业级搜索Agent
推荐指数 64.0 NO. 024 · 2026.05.07
upvotes37comments1
为什么值得看
OpenSeeker-v2用极少的高质量搜索轨迹做监督微调,在深度搜索任务上超过工业界复杂管线。对资源有限的学术团队和小公司而言,这证明了数据质量比堆叠训练阶段更重要。
媒体预览
编辑判断
工业界做搜索Agent的典型路径是预训练+CPT+SFT+RL四层堆叠,OpenSeeker-v2直接砍掉前三层只保留SFT,关键在'informative and high-difficulty trajectories'的筛选标准——不是数据量多,而是每条轨迹的信息密度和难度梯度。这和去年DeepSeek-R1用纯RL跳过SFT形成有趣对照:一个做加法一个做减法,共同指向'找到正确的数据/反馈信号比堆训练阶段更关键'。
目前代码和模型尚未开源,但方法本身复刻门槛不高。如果你在做垂直领域搜索Agent(如法律、医疗文献检索),可以先审视现有训练数据的质量分布,而不是急着上RL infra。