连续潜空间扩散语言模型新架构
推荐指数 77.0 NO. 019 · 2026.05.09
upvotes38comments4
为什么值得看
将扩散模型从离散token空间扩展到连续潜空间,统一了语言模型的自回归生成与扩散去噪过程。可能打破现有LLM架构范式,为长文本生成和可控生成提供新路径。
媒体预览
编辑判断
现有LLM全是next-token prediction,这条路的天花板越来越明显——推理并行度差、长文本规划能力弱、可控性靠后期 hack。这篇的核心是把文本编码进连续潜空间后直接做扩散,本质上是让模型在'语义层面'而非'token层面'去噪生成。
跟之前SEDD、SSD-LM这些离散扩散语言模型比,连续空间的梯度更光滑,理论上更适合长程依赖建模。但代价是编码器/解码器的设计和训练稳定性,论文如果解决了这两个工程问题才值得跟。
建议关注有没有开源代码和训练成本数据,如果能在1B规模验证出比同尺寸Transformer更好的长文本一致性,这个方向会快速热起来。