并行解码让视觉定位提速数倍
推荐指数 80.0 NO. 023 · 2026.05.28
upvotes90comments1
为什么值得看
LocateAnything 提出并行框解码技术,将视觉 grounding 和检测中的坐标生成改为原子化几何单元并行处理,同时提升吞吐量和定位精度。对需要实时视觉理解的机器人、自动驾驶和 AR 场景有直接工程价值。
媒体预览
编辑判断
当前主流 VLM 如 GPT-4V、Qwen-VL 做 grounding 都是串行生成坐标 token,延迟随框数量线性增长,这是落地机器人视觉的隐形瓶颈。这篇把几何元素拆成原子单元并行解码,思路类似 DETR 的集合预测但适配了生成式 VLM 的框架。
论文声称在相同精度下 throughput 提升明显,但需关注实际 batch size 和硬件利用率,以及是否开源了训练代码——仅放推理 demo 的话复现成本会很高。做端侧视觉模型部署的团队可以盯一下后续开源情况。