自举训练闭环:模型自己出题自己学
推荐指数 77.0 NO. 011 · 2026.08.20
发布2026/08/19Score93Comments16
为什么值得看
Ornith-1.5 将自我脚手架扩展为完整自改进循环,模型自主生成任务、构建脚手架并产出 RL 训练数据。397B MoE 版本在 Terminal-Bench 2.1 上达 86.1 分,开源模型中 SOTA,可能改变预训练后依赖人类标注数据的行业惯例。
编辑判断
当前 RLHF 和 RL 训练的最大瓶颈是人类标注和合成数据的质量天花板,Ornith 的闭环设计本质上是用模型能力替代数据工程团队的外循环工作。这与 Anthropic 的 Constitutional AI、DeepSeek 的 GRPO 路线不同,Ornith 更激进——连任务设计都交给模型自己。
值得警惕的是 397B MoE 的实际激活参数量和推理成本,HN 讨论区有人质疑其效率是否优于同等算力投入的密集模型。如果你在做 post-training 管线,建议关注其开源的 scaffold 生成策略是否可迁移到自己的 base model 上,而非直接复用模型权重。
社区反馈
意见分歧 16 条评论
核心争论:自举训练能否真正替代人类标注,还是仅是对基座模型的有效后训练优化
相关内容
AI自我进化:LLM闭环系统与多智能体前沿技术综述 介绍SQLM自我提问模型与AZR绝对零范式,模型自主生成问题并通过强化学习训练,无需人类数据即可在数学和编程任务上持续改进。 智能体如何自我学习:闭环自我提升架构 分析自举训练中的分布坍塌风险,探讨SCA多样性过滤与ExIt方差采样等解决方案,并追溯STaR等早期自我博弈工作。 自进化(Self-evolving/RSI),一篇就够了 讨论模型能力跨越临界点后自然涌现的自我进化特性,以及脚手架改进与模型训练的相互加速机制。 2026智源大会热议 Agent 最前沿趋势,从“会执行”到“会进化” 界定递归自我改进的理想定义与工程实现差距,强调2025年后代码能力突破使RSI从思想进入可操作阶段。
How is ornith-1.5's base model developed? Is the base model one of the Open weights models, or one pre trained by ornith team from scratch? I couldn't find information to answer this question in the article.
It looks like they post-trained Qwen3.6. Interesting to see how far they could improve it with they harness/algorithm.
This looks cool