AMAZINGINDEX.COM 日报快照
55.0
VOL. 2026.09
2026.09.05
← 返回 2026.09.05 日报
日报快照 · Daily Snapshot
NO. 022

6B扩散模型纯图训练超越SOTA

#HF_PAPERS HuggingFace Papers 2026.09.05
推荐指数 75.0 NO. 022 · 2026.09.05
upvotes180comments2

LLaDA-Image用6B DiT结合冻结的视觉语言模块,通过纯图像预训练而非依赖图文对数据,蒸馏出2-4步快速生成版本。开源社区终于有训练配方完全透明的图像生成器,小团队复现门槛大幅降低。

6B扩散模型纯图训练超越SOTA

当前开源图像生成赛道被SD3、Flux等闭源训练配方的主导者把持,复现成本极高。LLaDA-Image的关键突破在于证明纯图像预训练+后续对齐就能达到SOTA,这意味着数据准备成本从清洗十亿级图文对降到只需要高质量图像。

Muon优化器在这里扮演了隐藏功臣的角色,它在视觉任务上的收敛效率比AdamW高出约30%,这可能是训练配方能被小规模团队复现的核心原因之一。代码和训练脚本已全开源,如果你正在做垂直领域的图像生成(如电商设计、游戏资产生成),建议直接拿这个底座做领域适配,而不是从头训SD系列。

需要警惕的是,冻结的LLaDA2.0-Mini语言模块对中文提示词的理解能力尚未验证,中文场景建议先做prompt翻译层。

查看原文 →