AMAZINGINDEX.COM 日报快照
49.8
VOL. 2026.07
2026.07.19
← 返回 2026.07.19 日报
日报快照 · Daily Snapshot
NO. 021

固定GPU下RL训练突破200万token

#HF_PAPERS HuggingFace Papers 2026.07.19
推荐指数 78.0 NO. 021 · 2026.07.19
upvotes166comments3

LongStraw提出了一种架构感知的执行栈,让GRPO强化学习后训练能在单卡预算下处理百万级token上下文。对AI Agent开发者意义重大,Agent的长轨迹记忆和工具调用历史终于能被完整纳入RL优化,不再依赖部署时的长度泛化猜测。

固定GPU下RL训练突破200万token

当前Agent框架的普遍做法是RL阶段用短上下文凑活,部署时靠长度泛化硬撑,这导致Agent在真实长轨迹中行为漂移严重。LongStraw的关键 trick 是共享prompt不做autograd、只保留后续token需要的模型状态、分支响应逐个replay,本质上是用计算换显存。

相比DeepSeek-V3的GRPO实现或其他长上下文RL工作,这篇的卖点是"固定GPU预算"下的可扩展性,而不是堆卡堆出来的。论文提到已用Qwen2.5-7B验证到2M token,但开源代码和完整训练配置尚未放出,想跟进的团队建议先邮件作者确认release timeline。

如果你在训Agent的post-training,且上下文瓶颈卡在128K-256K,这个方向值得优先复现——比盲目上TP8更实际。

查看原文 →