AMAZINGINDEX.COM 日报快照
49.5
VOL. 2026.05
2026.05.09
← 返回 2026.05.09 日报
日报快照 · Daily Snapshot
NO. 019

连续潜空间扩散语言模型新架构

#HF_PAPERS HuggingFace Papers 2026.05.09
推荐指数 77.0 NO. 019 · 2026.05.09
upvotes38comments4

将扩散模型从离散token空间扩展到连续潜空间,统一了语言模型的自回归生成与扩散去噪过程。可能打破现有LLM架构范式,为长文本生成和可控生成提供新路径。

连续潜空间扩散语言模型新架构

现有LLM全是next-token prediction,这条路的天花板越来越明显——推理并行度差、长文本规划能力弱、可控性靠后期 hack。这篇的核心是把文本编码进连续潜空间后直接做扩散,本质上是让模型在'语义层面'而非'token层面'去噪生成。

跟之前SEDD、SSD-LM这些离散扩散语言模型比,连续空间的梯度更光滑,理论上更适合长程依赖建模。但代价是编码器/解码器的设计和训练稳定性,论文如果解决了这两个工程问题才值得跟。

建议关注有没有开源代码和训练成本数据,如果能在1B规模验证出比同尺寸Transformer更好的长文本一致性,这个方向会快速热起来。

查看原文 →