AMAZINGINDEX.COM 日报快照
55.9
VOL. 2026.07
2026.07.07
← 返回 2026.07.07 日报
日报快照 · Daily Snapshot
NO. 022

RL训练推理不一致的根治方案

#HF_PAPERS HuggingFace Papers 2026.07.07
推荐指数 81.0 NO. 022 · 2026.07.07
upvotes126comments1

提出新的策略优化目标,强制训练阶段与推理阶段的策略单调一致,解决LLM强化学习中因训练-推理引擎分离导致的崩溃问题。对正在做RLHF或DPO后训练的团队有直接参考价值,可减少调参试错成本。

RL训练推理不一致的根治方案

当前工业界RLHF普遍用vLLM做推理生成、用PyTorch做训练反向传播,两个引擎对同一token的概率计算存在系统性偏差,PPO的importance sampling ratio会因此失真。这篇的核心贡献是把优化目标从'训练策略'换成'推理策略的单调改进',本质上是用一个约束项把两个引擎的分布差异 bound 住。

实验在1B到7B模型上验证,但没有放Llama-3或Qwen级别的结果,也没有开源代码。如果后续有复现确认在70B规模有效,可能会成为RLHF的新默认设置;目前建议先关注,等代码释放再决定是否替换现有PPO实现。

查看原文 →