通义千问统一机器人大脑模型
推荐指数 73.0 NO. 023 · 2026.05.30
upvotes71comments2
为什么值得看
阿里通义千问团队推出统一的视觉-语言-动作模型,用同一套架构覆盖机器人操作、导航和轨迹预测等多种具身任务。对做机器人或具身智能的工程师来说,这意味着不用再为不同任务训练专用模型,跨平台迁移成本大幅降低。
媒体预览
编辑判断
之前机器人领域的主流做法是每个任务、每种机器人形态各训一个模型,比如 Google 的 RT 系列专注操作,导航另起炉灶。这篇的核心突破是把 manipulation、navigation、trajectory prediction 全部塞进同一个 transformer 架构,靠共享的 VLA 表示实现跨本体迁移。论文声称在多个 benchmark 上达到或接近专用模型的水平,但关键要看实际部署时的推理延迟和 sim-to-real gap。
代码和模型权重是否开源还不明确,如果阿里像 Qwen 系列一样全开源,这对中小机器人团队是重大利好,可以直接拿来做 fine-tuning 而不是从头训 VLA。