物理约束让机器人视频生成不再穿模
推荐指数 71.0 NO. 025 · 2026.06.30
upvotes39comments0
为什么值得看
PhysisForcing 在 DiT 视频生成框架中加入像素轨迹和语义关系双重物理对齐损失,解决机器人操作视频中物体变形、运动不连续等物理不合理问题。对做仿真训练数据生成的机器人团队来说,这是降低 sim-to-real 鸿沟的关键补丁。
媒体预览
编辑判断
当前机器人数据瓶颈在于真机采集成本高、传统仿真又不够真实,用视频生成模型造数据是热门路线,但 Sora 类通用模型生成的抓取视频经常出现手指穿模、物体重影等问题,直接用来训练策略网络会带偏策略。
这篇的核心 trick 是把物理约束拆成两层:像素级轨迹连续性(防抖动穿模)和语义级物体关系(防抓取后物体还在原位),比单纯加物理引擎渲染快得多,也更容易 scale。
论文提到基于 DiT 架构,训练成本应该可控,但暂未看到代码开源。如果你在造机器人仿真数据生成管线,建议等代码放出后优先测一下抓取、堆叠这类对物理精度敏感的任务,看能否替代或补充当前 Isaac Sim + Domain Randomization 的流程。
相关内容
让视频模型真正“懂物理”:连接视觉、物理与世界模型 北京大学研究指出视频生成模型缺乏物理常识,存在物体穿透、重力失效等问题,探讨连接视觉、物理与世界模型的路径。 宾夕法尼亚大学团队让AI不再违背物理定律:一张照片就能生成符合物理的视频 宾夕法尼亚大学开发PhysCtrl系统,通过学习55万个物理仿真数据,结合空间-时间注意力机制,从单张照片生成符合物理定律的视频。 宾夕法尼亚大学突破:AI生成符合物理定律的视频 PhysCtrl系统给AI装上"物理学家的大脑",仅需普通照片并指定力与材质,即可生成符合真实物理规律的视频。 AIR学术|复旦大学朱思语:基于三维物理约束的交互式人像视频生成 清华大学AIR学术沙龙,复旦大学朱思语分享基于三维物理约束的交互式人像视频生成研究。