进化策略替代RL微调长程Agent
推荐指数 82.0 NO. 021 · 2026.08.20
upvotes89comments2
为什么值得看
Agentic ESOpt用进化策略替代强化学习,实现长程LLM Agent的全参数微调,仅需消费级GPU。对想训Agent但卡不够的中小团队是务实路线。
媒体预览
编辑判断
RL训长程Agent的痛点不只是卡贵,而是trajectory越长credit assignment越崩——PPO的GAE在长链推理里信号衰减严重,这是结构性问题。ES用trajectory-level reward做加权扰动更新,天然绕过逐step梯度回传,把显存瓶颈从O(T)降到O(1)。
和OpenAI的GPT-4o post-training或DeepSeek-R1的RL方案比,ESOpt牺牲了一点样本效率,换到了单卡可跑和更好的长程稳定性。论文提到在WebShop和ALFWorld上超过PPO和ReAct,但还没看到开源代码——如果作者后续放出来,会是中小团队复现Agent微调的重要基线。
手头有V100/A6000级别卡、想训垂直领域Agent的工程师,建议等代码发布后优先试这个而非硬上GRPO。