LLM 自进化技能发现框架
推荐指数 78.0 NO. 024 · 2026.05.06
upvotes106comments1
为什么值得看
提出三智能体自博弈框架(Challenger-Reasoner-Judge),让大模型在无人工监督下自主发现上下文专属技能。对做 prompt 工程、Agent 系统架构的团队有直接参考价值,可能减少手工设计 CoT 模板的成本。
媒体预览
编辑判断
这篇工作的关键设计是把技能发现拆成了对抗生成:Challenger 造难题、Reasoner 学解法、Judge 评质量,形成闭环而非一次性蒸馏。这和之前 Google 的 DSPy 或微软的 AutoPrompt 那种静态优化思路不同,更接近 AlphaZero 的 self-play 逻辑。
实验显示在复杂推理任务上提升明显,但论文没给具体模型规模和训练成本。如果开源代码,建议重点看 Judge 的评分标准怎么设计——这是整个闭环的瓶颈,也是最难迁移到自己业务场景的部分。