德语模型:重复训练高质量数据胜过多样性
推荐指数 50.0 NO. 025 · 2026.05.06
upvotes12comments1
为什么值得看
研究发现对高质量德语语料重复训练,比单次训练更大但过滤较松的数据集效果更好。非英语语言模型团队可据此优化数据策略,显著降低训练成本。
媒体预览
编辑判断
英语社区已经验证过 Deduplication + Quality filtering 的范式,但非英语语料一直面临'量不够'和'质不高'的两难。这篇论文的结论是反直觉的:与其用更多低质数据换多样性,不如把精品语料多刷几遍。
对做中文、日语、韩语等小语种模型的团队有直接参考价值。中文互联网语料的噪声比德语更严重,这个结论可能更激进适用。建议关注作者是否会开源他们的 GermanWeb 过滤 pipeline,那会比论文结论本身更有工程价值。