视频生成模型转做通用视觉感知
推荐指数 73.0 NO. 020 · 2026.07.14
upvotes37comments0
为什么值得看
GenCeption 将预训练的视频扩散生成模型改造为前馈感知模型,用文本指令驱动多种视觉任务。这意味着视频生成获得的时空先验和视觉语言对齐能力,可以直接迁移到理解任务,打破生成与感知的壁垒。
媒体预览
编辑判断
这篇论文的野心在于重新定义视觉基础模型的训练范式——不是像 CLIP 那样做对比学习,也不是像 SAM 那样做大规模标注监督,而是论证视频生成本身就是最强的预训练任务。生成模型被迫内化了物理世界的因果结构和时序动态,这些正是当前视觉理解模型最缺的常识。
从工程角度看,关键问题是推理成本:扩散模型做前馈感知是否需要保留完整的去噪过程?论文提到 feed-forward,暗示可能做了蒸馏或一步推理近似,但具体开销和是否开源代码尚未明确。如果能在单张 A100 上实时跑通,这套方法论会迅速被工业界跟进。
相关内容
UIUC研究新发现:视频生成模型就是3D视觉基础模型! 视频生成模型展现出强大3D感知能力,WAN2.1-14B在CO3Dv2数据集上指标已接近专门3D专家模型,验证生成模型作为通用视觉感知基础的潜力。 Video generation models as world simulators OpenAI提出视频生成模型可作为世界模拟器,训练文本条件扩散模型联合处理变时长、分辨率视频与图像,探索生成模型的物理世界理解能力。 视频生成与通用世界模型 VALSE研讨会系统介绍DriveDreamer自动驾驶世界模型、WorldDreamer通用视频生成等,探讨视频生成模型在感知、预测与场景理解中的应用。 Universal Visual Perception Representations Generating AAAI论文提出基于流匹配的通用视觉感知框架,可跨任务生成多样化视觉表征,将视觉感知统一建模为流匹配问题,实现跨域泛化。