开源视频MLLM终于全栈开放
推荐指数 89.0 NO. 021 · 2026.07.18
upvotes107comments1
为什么值得看
VideoChat3 是首个训练代码、策略、数据集完全开源的视频多模态大模型,解决了现有开源模型仅开放权重、无法复现的痛点。对想自研视频理解能力的团队来说,这是目前唯一能从头跟进的基线。
媒体预览
编辑判断
视频MLLM领域长期被'伪开源'困扰:LLaVA-Video、InternVL等主流方案只放模型权重,训练细节靠社区猜。VideoChat3把数据构建流程、训练策略甚至失败实验都公开了,这对想垂直微调的医疗/安防视频团队是救命稻草。
它的效率优化值得关注:用动态帧采样把显存压到24GB可训,单卡A100能跑7B模型。对比Qwen2-VL同等精度下推理速度快40%,但长视频理解能力稍弱。
如果你在做直播审核、短视频标签这类需要私有化部署的业务,这是目前成本最低的可控方案。