QwenDrive:VLM统一自动驾驶三大任务
推荐指数 68.0 NO. 022 · 2026.09.03
upvotes336comments2
为什么值得看
Qwen-Drive-1.0 基于 Qwen-VL 架构,用共享表征将 3D 感知、视觉问答和运动规划统一在一个模型里,通过 BEV 感知头提取 3D 信息。对自动驾驶团队来说,这意味着不用再维护三个独立模型,端到端部署成本可能大幅降低。
媒体预览
编辑判断
自动驾驶领域长期割裂:感知用 BEVFormer、规划用 rule-based 或单独端到端模型,VQA 更是另一套系统。Qwen-Drive 的 trick 在于把 BEV 感知头作为 VLM 的 3D 信息探针,而不是从头训一个多模态大模型,这保留了预训练 VLM 的通用能力又注入了领域知识。
staged training 的设计很关键:先冻 VLM 训 BEV head,再联合微调,避免灾难性遗忘。目前 336 upvotes 但仅 2 条评论,说明社区关注度高但还没人跑通复现。如果你在做端到端自动驾驶,建议等代码开源后重点看 BEV head 和 VLM 的融合细节,以及规划输出的安全性约束是怎么处理的——这通常是 VLM 做规划的短板。