自动驾驶训练时偷学世界模型,推理时扔掉
推荐指数 75.0 NO. 023 · 2026.08.11
upvotes22comments1
为什么值得看
SimWAM 将视频生成仅作为训练信号,通过联合流匹配让动作专家从视频专家学习动态先验,训练完成后可丢弃视频分支,得到轻量自包含的规划器。对端侧部署和实时推理是实质性减负,避免了现有 WAM 方法推理时生成长视频的高昂成本。
媒体预览
编辑判断
现有 WAM 路线如 GAIA-1、DriveDreamer 的通病是推理时必须并行跑视频生成,显存和延迟双高,工程落地困难。SimWAM 的 trick 在于用 isolated attention mask 切断动作预测对未来帧的依赖,实现"训练时耦合、推理时解耦",这比直接蒸馏更干净——动作专家不是学生成的像素,而是学注意力层面的动态表示。
论文没有给出 nuScenes 等标准 benchmark 的横向对比数字,这是主要遗憾。如果开源代码完整,建议关注两个验证点:去掉视频分支后的 planner 与原始 WAM 的轨迹 L2 差距多少,以及在不同算力车规芯片上的推理延迟。