视频理解基准测试半数无需看图
推荐指数 73.0 NO. 023 · 2026.07.11
upvotes42comments1
为什么值得看
Video-Oasis 诊断套件发现现有视频理解基准中一半题目不看视频也能答对,暴露了 Video-LLM 评估体系的系统性缺陷。对做视频大模型的团队来说,这意味着你刷的 benchmark 排名可能毫无意义,需要先审计测试集再谈性能。
媒体预览
编辑判断
视频理解领域长期存在一个默契的'作弊空间':模型靠帧采样、字幕、甚至视频元数据就能在主流 benchmark 上刷出高分,而社区选择性忽视这个问题。Video-Oasis 的价值在于它不提供新基准,而是给了一套可持续的审计工具,让研究者能系统性地给现有 benchmark '验毒'。
这个方向比发新 SOTA 更重要。目前 Video-LLM 的论文数量爆炸,但工程落地时视频理解能力往往不达预期,根源之一就是训练目标和评估目标双双失真。如果你在做视频 Agent、自动驾驶感知或视频搜索,建议直接用 Video-Oasis 跑一遍自己的测试集,很可能发现模型'看懂'的部分远不如想象中多。
论文没有放出完整代码,但方法论足够清晰可以复现。预计这会成为 CVPR 2025 视频理解 track 的标配引用。
相关内容
Breaking Down Video LLM Benchmarks: Knowledge, Spatial Perception, or True Temporal Understanding? 论文分析视频LLM基准测试,区分知识、空间感知与真实时序理解能力,与原文主题高度相关。 MVPBench: A Multi-Video Perception Evaluation Benchmark for Multi-Modal Video Understanding 多视频感知评估基准,用于评测多模态视频理解能力,补充视频基准测试研究。 StreamingBench: 评估多模态语言模型中的实时视频理解 实时视频理解基准,揭示Gemini 1.5 Pro等模型与人类基准的差距,关注视频理解能力评估。 MVBench: A Comprehensive Multi-modal Video Understanding Benchmark CVPR 2024高亮论文,全面的多模态视频理解基准,涵盖NExT-QA/STAR/TVQA等测试集。