企业级RL后训练框架开源
推荐指数 80.0 NO. 001 · 2026.09.05
Stars2,526
为什么值得看
Miles v0.1 是 LMSYS 推出的面向大规模模型后训练的企业级强化学习框架,支持多种主流模型。后训练阶段的质量直接决定模型产品化效果,但工程门槛极高,这个框架试图把 RLHF/RLAIF 的基建标准化。
Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.
媒体预览
编辑判断
RL 后训练的工程复杂度被严重低估——大多数团队用 TRL 或自研脚本硬撑,分布式训练、奖励模型管理、回滚策略全是坑。Miles 背靠 SGLang 生态和 LMSYS 的 Chatbot Arena 数据优势,在推理引擎协同上有先天整合条件。
对比 OpenRLHF、verl 等同类框架,Miles 的差异化在于明确瞄准"生产级":支持多模态、Diffusion 模型(有独立 miles_diffusion 仓库),且文档和 Slack 社区运营很重。如果你团队正在从"能跑通 DPO"往"稳定上线 RL 迭代"过渡,这个值得优先调研而非自己造轮子。
风险点是 v0.1 刚发布,实际稳定性待验证;另外企业级功能如权限管理、审计日志是否完善需要自行测试。
Star History
生态分析
Beta
LMSYS 推出的企业级 LLM/VLM 后训练 RL 基建框架,填补学术工具与工业落地之间的工程鸿沟
独特价值:将 RLHF/RLAIF 工程标准化,降低大规模模型后训练的产品化门槛
竞品: