用人手视频教会双臂机器人干活
推荐指数 74.0 NO. 024 · 2026.06.30
upvotes32comments1
为什么值得看
提出基于相对手腕平移的桥接动作表示,结合视觉-语言-动作模型,将人类操作视频直接迁移到双臂机器人。解决了人形与机器人 embodiment 差异导致的技能迁移难题,让廉价海量的人类视频数据真正可用。
媒体预览
编辑判断
之前从人类视频学机器人操作的主流做法是把人当成另一种6DoF机器人,直接对齐关节空间或末端位姿,结果 embodiment gap 太大导致迁移失败。这篇的关键洞察是:只取手腕的相对平移作为桥接表示,旋转和手指开合让模型自己学,大幅降低了跨本体映射的复杂度。
在模拟到真实的迁移上,这个方法比 ACT、Diffusion Policy 等当前主流模仿学习方案的成功率高出 15-30 个百分点,而且只需要单视角头显相机视频,不需要动捕手套或深度相机。
HuggingFace 页面已放出代码和预训练权重,做机器人数据飞轮或人形机器人技能库的团队可以优先跟进,核心瓶颈在于人类视频的动作标注成本是否能进一步压缩。
相关内容
清华×地平线突破性成果!H-RDT:用人类视频教会机器人双手操作 H-RDT基于超33.8万条轨迹、覆盖194项任务的数据训练,使用48维人类手部动作表示的EgoDex数据集。 30分钟人类第一人称视频,零样本教会机器人双臂操作 学界从EgoMimic、EgoZero到AINA探索人类第一人称视频作为机器人训练数据,马里兰大学王治为一作。 抢跑特斯拉,中国团队用视频学习教机器人学会操作 升级版视频学习框架使双臂机器人完成精准长程任务,自主识别倒扣透明碗等物体状态。 人类日常视频成机器人“私教”!100万段真实动作教会灵巧手干活 微软亚研&清华用100万片段、2600万帧数据集训练VLA模型,零样本应对陌生场景,微调后成功率超70%。