用人视频预训练机器人VLA模型
推荐指数 74.0 NO. 024 · 2026.06.18
upvotes40comments3
为什么值得看
ACE-Ego-0提出可靠性感知训练框架,将第一人称人类视频与机器人轨迹统一用于VLA预训练,缓解机器人数据采集成本高的问题。对做具身智能的团队来说,这是用廉价人类视频替代部分昂贵机器人数据的可行路径。
媒体预览
编辑判断
这个工作的关键不是"用了人类视频"——之前RT-X、Open X-Embodiment也试过,而是加了可靠性感知权重来过滤人类视频中与机器人执行无关的噪声片段。之前的方法要么直接硬训导致策略漂移,要么需要昂贵的人工对齐标注。
从实验看,在CALVIN和LIBERO上比纯机器人数据预训练提升约15-20%,但论文没公开完整代码和训练成本。如果复现门槛不高,这可能是中小机器人团队绕过数据瓶颈的务实选择,建议等开源后优先测其在真实机械臂上的迁移稳定性。