扩散模型并行感知加速多区域理解
推荐指数 71.0 NO. 024 · 2026.06.23
upvotes50comments5
为什么值得看
PerceptionDLM 用结构化注意力掩码让多模态扩散语言模型能并行处理多个图像区域的描述,推理更快且caption质量不降。对需要实时视觉分析的产品(如自动驾驶、机器人视觉)有直接工程价值。
媒体预览
编辑判断
现有MLLM做区域感知基本靠自回归逐token生成,多个区域要串行描述,延迟随区域数线性增长。PerceptionDLM的 trick 是把扩散模型的去噪过程改造成区域并行的结构化掩码注意力,本质上是用空间换时间——显存开销会增加但延迟大幅降低。
论文提到基于PerceptionDLM-Base,但没有明确说是否开源代码和权重。如果后续有开源,这可能是第一个能在消费级GPU上做实时多区域dense captioning的扩散方案,值得跟踪HuggingFace仓库动态。