MoE+DiT 视频预训练专攻机器人
推荐指数 73.0 NO. 023 · 2026.07.10
upvotes39comments0
为什么值得看
LingBot-Video 用稀疏 MoE 替代密集 DiT,针对具身智能做视频预训练,解决生成模型重画质轻物理的域偏移问题。机器人团队可直接用它做数据增强和策略初始化,降低仿真到真实的迁移成本。
媒体预览
编辑判断
当前机器人视频预训练的主流做法是用 Sora/Pika 这类生成模型做数据增强,但它们在物理一致性上经常翻车——物体会穿模、重力失效、接触力不对。这篇工作最务实的点是承认了这个 gap,用 MoE 的路由机制把物理约束和视觉生成解耦到不同 expert,而不是让同一个网络两头兼顾。
不过要注意,论文里没提开源代码和训练成本。MoE 在推理时虽然只激活部分参数,但预训练阶段的总算力通常比 dense 模型更高,中小团队需要掂量一下集群预算。建议等代码放出后先看他们的数据增强 pipeline 怎么搭,这部分对做 sim-to-real 的参考价值最大。
相关内容
蚂蚁灵波开源全球首个具身智能MoE视频基模LingBot-Video 蚂蚁灵波开源LingBot-Video,全球首个具身智能MoE视频基座模型,专注机器人领域,与原文MoE+DiT视频预训练方向高度契合。 DiTEA: Mixture-of-Experts for Vision-Language-Action Model in Robotic Manipulation AAAI顶会论文,提出DiTEA架构将MoE应用于视觉-语言-动作模型,专门解决机器人操作任务,技术路线与原文直接相关。 MoE-DP: An MoE-Enhanced Diffusion Policy for Robust Long-Horizon Robotic Manipulation 将MoE与扩散策略结合用于机器人长程操作,展示强抗干扰能力,为MoE+DiT在机器人预训练提供技术参考。 DiT-MoE: Scaling Diffusion Transformers with Mixture of Experts 开源DiT-MoE实现,将扩散Transformer扩展至160亿参数,提供MoE+DiT基础代码与预训练权重,是原文技术底座。