VLA模型摆脱数据Scaling诅咒
推荐指数 72.0 NO. 019 · 2026.09.01
upvotes59comments1
为什么值得看
VLAct提出表示中心化的持续预训练方法,在固定机器人数据预算下通过保留视觉语言先验和共享动作语义来提升VLA模型性能。对算力有限的机器人创业团队尤为实用,无需堆数据就能跨仿真环境和未见本体泛化。
媒体预览
编辑判断
当前VLA赛道被RT-2、OpenVLA等带偏到'谁有更多真机数据谁赢'的军备竞赛,VLAct直接质疑这个前提。它的关键设计是冻结视觉语言编码器、只训轻量动作适配器,这相当于用CLIP/LLM的互联网知识'蒸馏'到机器人控制,而不是让机器人在有限数据里重新学视觉。
相比OpenVLA需要70B参数和数千小时真机数据,VLAct在10%计算预算下达到相近跨本体泛化能力。论文提到代码将开源,做双臂操作、移动机器人的小团队可以优先关注——这可能是'没有特斯拉数据量'的创业公司最现实的VLA落地路径。