首个大规模触觉预训练机器人模型
推荐指数 71.0 NO. 022 · 2026.08.04
upvotes49comments1
为什么值得看
N_0-VTLA 是首个在百万级触觉数据上预训练的视觉-触觉-语言-动作基础模型,支持精细接触操作和离线策略优化。对做灵巧手、柔性抓取和力控机器人的团队,这意味着触觉感知终于能走视觉的 scaling law 路线。
媒体预览
编辑判断
之前机器人触觉大多走专用传感器+ handcrafted 特征的老路,跟视觉大模型的 progress 完全脱节。这篇的关键是把触觉编码成离散 latent tokens,硬塞进和视觉同一套 transformer 架构里做联合预训练,本质上是在复现 CLIP 时刻——把异构传感器数据拉进同一个表示空间。
NeoData 这个数据集目前没开源,这是最大悬念。如果后续放出,触觉方向的 data flywheel 才能转起来;否则学术界还是只能小规模复现。做硬件的团队可以关注他们用的 DIGIT 触觉传感器方案,成本比 GelSight 低一个数量级,可能是规模化部署的隐藏前提。
相关内容
让机器人学会挤牙膏!智在无界首发隐式触觉世界模型 智在无界发布隐式触觉世界模型,L25指尖集成12×6压阻式压力传感器,DexHand 021配备视触觉传感器,可完成挤牙膏、写毛笔字等精细操作。 智在无界发布隐式触觉世界动作模型,车间机械臂或将拥有“触觉” 智在无界发布隐式触觉世界动作模型,强调数据质量决定模型能力,推动机械臂触觉感知技术发展。 2025世界机器人大会解析触觉技术如何增强具身智能 一目科技发布视触觉传感器,用摄像头捕捉弹性材料接触形变,为机器人提供触觉增强的世界模型能力。 Bridging vision and touch: advancing robotic interaction prediction with self-supervised multimodal learning 自监督多模态学习结合视觉与触觉,推进机器人交互预测,引用Robonet大规模多机器人数据集。