AMAZINGINDEX.COM 日报快照
55.0
VOL. 2026.09
2026.09.05
← 返回 2026.09.05 日报
日报快照 · Daily Snapshot
NO. 001

企业级RL后训练框架开源

#REPO GitHub Trending 2026.09.05
推荐指数 80.0 NO. 001 · 2026.09.05
Stars2,526

Miles v0.1 是 LMSYS 推出的面向大规模模型后训练的企业级强化学习框架,支持多种主流模型。后训练阶段的质量直接决定模型产品化效果,但工程门槛极高,这个框架试图把 RLHF/RLAIF 的基建标准化。

Miles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.

企业级RL后训练框架开源

RL 后训练的工程复杂度被严重低估——大多数团队用 TRL 或自研脚本硬撑,分布式训练、奖励模型管理、回滚策略全是坑。Miles 背靠 SGLang 生态和 LMSYS 的 Chatbot Arena 数据优势,在推理引擎协同上有先天整合条件。

对比 OpenRLHF、verl 等同类框架,Miles 的差异化在于明确瞄准"生产级":支持多模态、Diffusion 模型(有独立 miles_diffusion 仓库),且文档和 Slack 社区运营很重。如果你团队正在从"能跑通 DPO"往"稳定上线 RL 迭代"过渡,这个值得优先调研而非自己造轮子。

风险点是 v0.1 刚发布,实际稳定性待验证;另外企业级功能如权限管理、审计日志是否完善需要自行测试。

Star History
Beta

LMSYS 推出的企业级 LLM/VLM 后训练 RL 基建框架,填补学术工具与工业落地之间的工程鸿沟

独特价值:将 RLHF/RLAIF 工程标准化,降低大规模模型后训练的产品化门槛

竞品:
huggingface/trl ★ 9.3k TRL 更偏学术研究,Miles 聚焦企业级大规模部署
OpenRLHF/OpenRLHF ★ 4.1k OpenRLHF 开源社区驱动,Miles 有 LMSYS 企业背书
slime/slime ★ 800 Miles fork 自 slime,功能更完整、企业支持更强
查看原文 →