AMAZINGINDEX.COM 日报快照
55.5
VOL. 2026.06
2026.06.07
← 返回 2026.06.07 日报
日报快照 · Daily Snapshot
NO. 004

NVIDIA开源3B视觉定位模型

#HF_MODEL HuggingFace Models 2026.06.07
推荐指数 75.0 NO. 004 · 2026.06.07
likes1,434downloads111,078

LocateAnything是NVIDIA发布的3B参数视觉语言 grounding 模型,支持并行框解码实现高速目标定位。定位精度与7B模型相当但速度快数倍,适合实时机器人、自动驾驶等延迟敏感场景。

NVIDIA开源3B视觉定位模型

视觉 grounding 领域长期面临速度与精度的权衡,GLIP、Grounding DINO 等模型虽然准但慢,端侧部署困难。LocateAnything 的并行框解码把单次前向的框预测从串行改成并行,这是架构层面的取舍——用略增的显存换大幅提速。

做机器人或自动驾驶感知的团队可以重点关注,3B 参数意味着 Orin 级边缘芯片能跑得动。不过要注意它的训练数据偏向通用场景,工业检测、医疗影像等垂直领域需要额外微调。

查看原文 →