Agent数据生成三大原则:准、难、多样
推荐指数 73.0 NO. 024 · 2026.08.28
upvotes2comments1
为什么值得看
论文提出ACE框架,将Agent训练数据生成定义为约束分布设计,强调执行验证的准确性、与学习者能力匹配的复杂度、以及多样性优先于规模。对正在用合成数据训练Agent的团队有直接指导价值,能避免常见的"数据多但学不动"陷阱。
媒体预览
编辑判断
这篇论文的实用价值在于把Agent数据生成从"玄学"变成了可操作的检查清单。之前大家做Agent数据,要么狂堆GPT-4生成的轨迹(贵且不一定有用),要么直接复用WebArena、OSWorld等benchmark(环境耦合太紧)。ACE框架的核心贡献是区分了candidate construction、verification和selection三个环节,指出很多工作把"生成候选"和"验证质量"混为一谈。
工程落地方面,论文没有给出具体开源代码,但方法论可以直接套用:先用环境执行过滤掉幻觉轨迹(Accuracy),再用当前模型能学动但不太会的样本(Complexity),最后保证任务分布覆盖而非单点重复(Diversity)。如果你正在用DPO或RL训练Agent,建议用这套标准重新审计现有的数据pipeline,很可能发现大量"伪正例"在拖后腿。
相关内容
AGENT DATA PROTOCOL: UNIFYING DATASETS FOR DIVERSE, EFFECTIVE FINE-TUNING OF LLM AGENTS 系统探讨了Agent数据集的创建方法,包括人工整理、合成数据生成和记录Agent轨迹等多样化策略,与原文数据生成原则直接相关。 Data Agents: Levels, State of the Art, and Open Problems 提出L5级数据Agent概念,强调生成式数据科学家能力,涉及自主编排、因果推理等开放问题,为Agent数据质量评估提供理论框架。 A Holistic Architecture for Orchestrating Data+AI Ecosystems 清华团队提出Data Agent六要素架构:感知、规划、反思等能力,为Agent数据生成的准确性、难度和多样性提供系统设计参考。