AMAZINGINDEX.COM 日报快照
52.6
VOL. 2026.07
2026.07.17
← 返回 2026.07.17 日报
日报快照 · Daily Snapshot
NO. 023

万亿参数模型纯RL涌现推理能力

#HF_PAPERS HuggingFace Papers 2026.07.17
推荐指数 82.0 NO. 023 · 2026.07.17
upvotes78comments2

Ring-Zero首次将无人工标注的纯强化学习(Zero RL)扩展到万亿参数大模型,解决了大规模训练中的可读性差、token冗余和推理深度僵化问题。这对想摆脱昂贵人类标注、探索模型自主涌现推理能力的团队有直接参考价值。

万亿参数模型纯RL涌现推理能力

目前Zero RL的标杆是DeepSeek-R1和Kimi k1.5,但都停留在几百B参数规模。这篇工作的核心突破是证明了纯RL的涌现现象在万亿级仍然成立,且通过算法改进解决了大模型特有的"思考冗长但无效"问题——这是小模型训练中不会暴露的。

论文提到训练pipeline已开源,但模型权重未释出。考虑到万亿参数训练成本,复现门槛极高,更现实的落地路径是借鉴其稳定性技巧(如自适应推理深度调度)用于百亿到千亿模型的RL微调。

值得关注的一个信号:作者团队来自某头部云厂商,这可能意味着2025年会有更多超大规模纯RL模型走通,SFT+RLHF的范式进一步被挤压。

查看原文 →