DiT 结构 token 竟是隐式语义寄存器
推荐指数 72.0 NO. 024 · 2026.07.23
upvotes65comments1
为什么值得看
研究者发现扩散 Transformer 中的文本模板 token(如"一张图")几乎不携带提示词信息,却在去噪过程中成为图像 token 的主要注意力汇聚点,像"寄存器"一样维持对象身份。这为理解 DiT 内部机制提供了因果证据,也为可控生成和模型编辑开辟了新切口。
媒体预览
编辑判断
这篇工作的真正价值在于方法框架而非单点发现——他们把 NLP 里成熟的因果干预范式搬进了 DiT 的多模态注意力空间,而且做了跨层、跨头、跨 token span 的系统分解。之前大家对 DiT 的理解主要靠可视化猜测,这套工具让"假设-验证"闭环成为可能。
工程上有个直接启发:如果你在做风格迁移或角色一致性编辑,过去可能要动整个文本编码器或 finetune 模型,现在可以精准定位到某几个模板 token 做局部干预,成本可能低一个数量级。论文代码是否开源还不确定,但方法本身复现门槛不高,值得跟踪。
相关内容
Structure-then-Detail Token Merging for Post-training DiT Acceleration 提出Attend to Not Attended方法,通过结构优先的token合并策略加速DiT推理,揭示token在DiT中的结构性作用。 Scalable Diffusion Models with Transformers(DiT)结构解析 详细解析DiT模型结构,说明其完全基于Transformer、使用隐空间扩散,token数量直接影响模型性能和FID指标。 扩散模型解读(一):DiT 详细解读 探索DiT的缩放性规律,发现增加输入token数量可提升模型性能,暗示token承载语义信息的可扩展性。