6B扩散模型纯图训练超越SOTA
推荐指数 75.0 NO. 022 · 2026.09.05
upvotes180comments2
为什么值得看
LLaDA-Image用6B DiT结合冻结的视觉语言模块,通过纯图像预训练而非依赖图文对数据,蒸馏出2-4步快速生成版本。开源社区终于有训练配方完全透明的图像生成器,小团队复现门槛大幅降低。
媒体预览
编辑判断
当前开源图像生成赛道被SD3、Flux等闭源训练配方的主导者把持,复现成本极高。LLaDA-Image的关键突破在于证明纯图像预训练+后续对齐就能达到SOTA,这意味着数据准备成本从清洗十亿级图文对降到只需要高质量图像。
Muon优化器在这里扮演了隐藏功臣的角色,它在视觉任务上的收敛效率比AdamW高出约30%,这可能是训练配方能被小规模团队复现的核心原因之一。代码和训练脚本已全开源,如果你正在做垂直领域的图像生成(如电商设计、游戏资产生成),建议直接拿这个底座做领域适配,而不是从头训SD系列。
需要警惕的是,冻结的LLaDA2.0-Mini语言模块对中文提示词的理解能力尚未验证,中文场景建议先做prompt翻译层。