扩散模型直接生成连续文本潜变量
推荐指数 78.0 NO. 023 · 2026.08.06
upvotes71comments1
为什么值得看
AURORA-LM 将文本编码为高维连续潜空间表示,让扩散模型直接在该空间生成,而非传统的离散 token 自回归。这突破了图像/视频/音频已普及但文本仍困于离散 token 的范式差距,为统一多模态生成提供了可行路径。
媒体预览
编辑判断
之前做连续文本生成的团队,比如 Google 的 CDCD 或 Meta 的 Diffusion-LM,要么把潜空间压得太低导致解码失真,要么直接用预训练 embedding 导致生成和解耦不好做。AURORA-LM 的关键取舍是反过来:不削潜空间维度去迁就扩散模型,而是让扩散模型去学一个高维、可解码的文本潜分布。
从工程角度看,这个方向的卡点一直是解码速度和训练稳定性。论文如果开源了训练代码和 autoencoder 权重,做视频生成或音乐生成的团队可以重点看看能不能把文本分支直接替进去,统一多模态 pipeline。HuggingFace 上 71 upvotes 但评论很少,说明大家还在观望有没有开源实现。
相关内容