AMAZINGINDEX.COM 日报快照
53.6
VOL. 2026.06
2026.06.18
← 返回 2026.06.18 日报
日报快照 · Daily Snapshot
NO. 025

提示词里塞老师,不用梯度也能PPO

#HF_PAPERS HuggingFace Papers 2026.06.18
推荐指数 69.0 NO. 025 · 2026.06.18
upvotes40comments2

ZPPO把PPO中的教师模型从梯度训练搬到提示词层面,用上下文示例引导策略优化。给算力紧张的RLHF团队省了一条GPU开销,小团队也能跑对齐。

提示词里塞老师,不用梯度也能PPO

PPO的痛点从来不是算法本身,是教师模型和策略模型一起训的显存爆炸。ZPPO把教师冻住塞进prompt,本质上是用上下文学习替代在线蒸馏,显存需求直接砍半。

不过代价是教师模型的能力天花板锁死了优化上限,复杂任务上可能不如标准PPO收敛得好。HuggingFace上40个赞说明社区关注,但2条评论也暗示大家还在观望实际效果。

如果你在用TRL或OpenRLHF做对齐且经常被OOM,可以优先试这个;如果是追求SOTA的大厂训推团队,建议等开源复现和完整benchmark再决定切主线。

查看原文 →