固定GPU下RL训练突破200万token
推荐指数 78.0 NO. 021 · 2026.07.19
upvotes166comments3
为什么值得看
LongStraw提出了一种架构感知的执行栈,让GRPO强化学习后训练能在单卡预算下处理百万级token上下文。对AI Agent开发者意义重大,Agent的长轨迹记忆和工具调用历史终于能被完整纳入RL优化,不再依赖部署时的长度泛化猜测。
媒体预览
编辑判断
当前Agent框架的普遍做法是RL阶段用短上下文凑活,部署时靠长度泛化硬撑,这导致Agent在真实长轨迹中行为漂移严重。LongStraw的关键 trick 是共享prompt不做autograd、只保留后续token需要的模型状态、分支响应逐个replay,本质上是用计算换显存。
相比DeepSeek-V3的GRPO实现或其他长上下文RL工作,这篇的卖点是"固定GPU预算"下的可扩展性,而不是堆卡堆出来的。论文提到已用Qwen2.5-7B验证到2M token,但开源代码和完整训练配置尚未放出,想跟进的团队建议先邮件作者确认release timeline。
如果你在训Agent的post-training,且上下文瓶颈卡在128K-256K,这个方向值得优先复现——比盲目上TP8更实际。
相关内容