万亿参数模型纯RL涌现推理能力
推荐指数 82.0 NO. 023 · 2026.07.17
upvotes78comments2
为什么值得看
Ring-Zero首次将无人工标注的纯强化学习(Zero RL)扩展到万亿参数大模型,解决了大规模训练中的可读性差、token冗余和推理深度僵化问题。这对想摆脱昂贵人类标注、探索模型自主涌现推理能力的团队有直接参考价值。
媒体预览
编辑判断
目前Zero RL的标杆是DeepSeek-R1和Kimi k1.5,但都停留在几百B参数规模。这篇工作的核心突破是证明了纯RL的涌现现象在万亿级仍然成立,且通过算法改进解决了大模型特有的"思考冗长但无效"问题——这是小模型训练中不会暴露的。
论文提到训练pipeline已开源,但模型权重未释出。考虑到万亿参数训练成本,复现门槛极高,更现实的落地路径是借鉴其稳定性技巧(如自适应推理深度调度)用于百亿到千亿模型的RL微调。
值得关注的一个信号:作者团队来自某头部云厂商,这可能意味着2025年会有更多超大规模纯RL模型走通,SFT+RLHF的范式进一步被挤压。