提示词里塞老师,不用梯度也能PPO
推荐指数 69.0 NO. 025 · 2026.06.18
upvotes40comments2
为什么值得看
ZPPO把PPO中的教师模型从梯度训练搬到提示词层面,用上下文示例引导策略优化。给算力紧张的RLHF团队省了一条GPU开销,小团队也能跑对齐。
媒体预览
编辑判断
PPO的痛点从来不是算法本身,是教师模型和策略模型一起训的显存爆炸。ZPPO把教师冻住塞进prompt,本质上是用上下文学习替代在线蒸馏,显存需求直接砍半。
不过代价是教师模型的能力天花板锁死了优化上限,复杂任务上可能不如标准PPO收敛得好。HuggingFace上40个赞说明社区关注,但2条评论也暗示大家还在观望实际效果。
如果你在用TRL或OpenRLHF做对齐且经常被OOM,可以优先试这个;如果是追求SOTA的大厂训推团队,建议等开源复现和完整benchmark再决定切主线。