NVIDIA开源3B视觉定位模型
推荐指数 75.0 NO. 004 · 2026.06.07
likes1,434downloads111,078
为什么值得看
LocateAnything是NVIDIA发布的3B参数视觉语言 grounding 模型,支持并行框解码实现高速目标定位。定位精度与7B模型相当但速度快数倍,适合实时机器人、自动驾驶等延迟敏感场景。
媒体预览
编辑判断
视觉 grounding 领域长期面临速度与精度的权衡,GLIP、Grounding DINO 等模型虽然准但慢,端侧部署困难。LocateAnything 的并行框解码把单次前向的框预测从串行改成并行,这是架构层面的取舍——用略增的显存换大幅提速。
做机器人或自动驾驶感知的团队可以重点关注,3B 参数意味着 Orin 级边缘芯片能跑得动。不过要注意它的训练数据偏向通用场景,工业检测、医疗影像等垂直领域需要额外微调。