视频时序定位终于不用RL硬训了
推荐指数 72.0 NO. 023 · 2026.07.22
upvotes139comments1
为什么值得看
TimeLens2 用集合监督替代传统强化学习,让多模态大模型能精准定位视频中任意查询对应的证据时间段。对做视频理解、内容审核、智能剪辑的团队来说,这是首个真正通用的时序 grounding 方案。
媒体预览
编辑判断
之前视频时序定位的主流做法是强化学习,但奖励设计要么对非重叠预测不敏感,要么依赖脆弱的段匹配规则,导致模型在长视频上泛化差。TimeLens2 的关键改进是把整个问题重新建模为区间集合预测,从标注到优化保持一致的集合语义,避开了 RL 的奖励工程陷阱。
论文构建了 93K 的多跨度标注数据集,覆盖不同领域和查询形式,这比之前依赖单次标注的长视频数据集可靠得多。代码和模型权重尚未确认是否开源,但方法本身对现有视频 MLLM 的改造代价很低,主要工作在数据层和损失函数层,算力需求可控。如果你在用 Qwen2-VL 或 LLaVA-Video 做视频问答但时序精度不够,这个监督范式值得迁移。