AMAZINGINDEX.COM 日报快照
55.7
VOL. 2026.07
2026.07.11
← 返回 2026.07.11 日报
日报快照 · Daily Snapshot
NO. 023

视频理解基准测试半数无需看图

#HF_PAPERS HuggingFace Papers 2026.07.11
推荐指数 73.0 NO. 023 · 2026.07.11
upvotes42comments1

Video-Oasis 诊断套件发现现有视频理解基准中一半题目不看视频也能答对,暴露了 Video-LLM 评估体系的系统性缺陷。对做视频大模型的团队来说,这意味着你刷的 benchmark 排名可能毫无意义,需要先审计测试集再谈性能。

视频理解基准测试半数无需看图

视频理解领域长期存在一个默契的'作弊空间':模型靠帧采样、字幕、甚至视频元数据就能在主流 benchmark 上刷出高分,而社区选择性忽视这个问题。Video-Oasis 的价值在于它不提供新基准,而是给了一套可持续的审计工具,让研究者能系统性地给现有 benchmark '验毒'。

这个方向比发新 SOTA 更重要。目前 Video-LLM 的论文数量爆炸,但工程落地时视频理解能力往往不达预期,根源之一就是训练目标和评估目标双双失真。如果你在做视频 Agent、自动驾驶感知或视频搜索,建议直接用 Video-Oasis 跑一遍自己的测试集,很可能发现模型'看懂'的部分远不如想象中多。

论文没有放出完整代码,但方法论足够清晰可以复现。预计这会成为 CVPR 2025 视频理解 track 的标配引用。

查看原文 →