Agent技能也能梯度优化了
推荐指数 82.0 NO. 023 · 2026.05.26
upvotes148comments2
为什么值得看
SkillOpt把Agent技能当成可训练的外部状态,用文本空间优化器稳定更新,推理零开销。对做Agent平台的团队来说,这意味着技能迭代从手工调Prompt变成自动化调参。
媒体预览
编辑判断
现在Agent技能的进化要么靠人工写,要么靠模型自己瞎改,本质上是不可控的。SkillOpt的聪明之处在于把技能参数化到文本空间,用类似梯度下降的方式稳定更新,而不是让模型自由发挥。
这比DSPy那种编译式优化更进一步——DSPy优化的是Prompt结构,SkillOpt优化的是技能本身的状态表示。在WebArena和Mind2Web上做了验证,但论文没提训练需要多少轮交互数据,这是落地最大的未知数。
代码没明确说开源,HuggingFace页面只有PDF,想跟进的建议先邮件作者要代码。