AMAZINGINDEX.COM 日报快照
58.4
VOL. 2026.05
2026.05.06
← 返回 2026.05.06 日报
日报快照 · Daily Snapshot
NO. 025

德语模型:重复训练高质量数据胜过多样性

#HF_PAPERS HuggingFace Papers 2026.05.06
推荐指数 50.0 NO. 025 · 2026.05.06
upvotes12comments1

研究发现对高质量德语语料重复训练,比单次训练更大但过滤较松的数据集效果更好。非英语语言模型团队可据此优化数据策略,显著降低训练成本。

德语模型:重复训练高质量数据胜过多样性

英语社区已经验证过 Deduplication + Quality filtering 的范式,但非英语语料一直面临'量不够'和'质不高'的两难。这篇论文的结论是反直觉的:与其用更多低质数据换多样性,不如把精品语料多刷几遍。

对做中文、日语、韩语等小语种模型的团队有直接参考价值。中文互联网语料的噪声比德语更严重,这个结论可能更激进适用。建议关注作者是否会开源他们的 GermanWeb 过滤 pipeline,那会比论文结论本身更有工程价值。

查看原文 →