小学课本训练LLM:知识从哪来
推荐指数 77.0 NO. 004 · 2026.08.17
发布2026/08/16Score226Comments194
为什么值得看
研究团队用仅含美国K-5课程内容的88B token语料从零训练了0.6B/1.3B/5B三个规模的模型,并设置未过滤对照组。这是首次通过严格控制训练分布来区分模型是"学会"还是"引出"技能。
编辑判断
这项研究直接挑战了当前LLM训练的一个隐含假设:更多数据总是更好。之前区分"学习"vs"引出"主要靠探针实验或消融分析,这是第一次从源头控制输入分布来做因果推断。
对做模型训练的团队来说,这个框架可以复用到其他场景,比如评估代码数据比例对推理能力的影响,或者测试多语言数据混合的临界点。5B模型能在浏览器里跑,也意味着小规模受控实验的成本在快速下降。
值得担心的是,如果这类研究成为主流,高质量教育数据的争夺会比通用爬取数据更激烈,因为可过滤的"干净"语料池本身就很有限。
社区反馈
意见分歧 138 条评论
核心争论:LLM是"学会"知识还是仅"引出"已有技能,以及模型是否具备元认知能力
相关内容
大语言模型训练数据 FineWeb是Hugging Face提供的大规模英语网页数据集,包含15万亿清洗token,专为优化LLM训练数据处理流程而设计。 LLM 基础知识 LLM核心由模型权重和体系结构代码组成,使用tokenizer将文本拆分为子单词单位的token进行处理。 大型语言模型简介 词元是语言建模的最小单位,语言模型通过确定不同token的概率来补全文本。 学习路线图 | minimind从零理解llm训练 从零实现LLM训练的完整学习路径,涵盖梯度消失、RMSNorm实现、位置编码等核心技术点。 中小学AI启蒙新教材来了 《人工智能通识》系列教材由清华、北大等高校专家编制,为中小学生提供AI启蒙教育内容。
Not quite, because it knows about quantum entanglement and that’s a little beyond the fifth grade.
You didn’t even read the example you’re referencing.
> Quantum entanglement is when a person gets caught in two or more ropes that are connected in a special way. This can happen if the ropes cross each other or if one rope wraps around the other. This could be seen as an amusingly extreme example of the fact that if you come up with something and sta