多轮工具调用Agent自蒸馏新方法
推荐指数 62.0 NO. 020 · 2026.09.01
upvotes60comments1
为什么值得看
DART-SD将多轮工具执行建模为菱形拓扑图,通过定位关键失败点进行局部自蒸馏,避免传统全轨迹模仿导致的拓扑坍塌。该方法让Agent在保留正确推理路径的同时定向修正错误,比端到端训练更适合复杂多步任务场景。
媒体预览
编辑判断
这篇论文戳中了一个被忽视的工程痛点:当前主流做法如ReAct、ToolFormer都是让模型模仿完整轨迹,但多步工具调用天然存在顺序无关的子目标组合爆炸,强行压成单一路径会丢失大量有效解空间。
作者用菱形拓扑显式建模这种组合结构,只在"分叉点"做局部蒸馏而非重写整条轨迹,这个思路可以迁移到任何有多步决策的Agent系统。实验部分值得关注是否对比了Qwen-Agent、LangGraph等现有框架的蒸馏方案。
代码和训练数据尚未看到开源链接,如果复现成本不高,做Agent infra的团队可以优先验证其在长链路工具调用场景下的错误定位精度。