AMAZINGINDEX.COM 日报快照
56.9
VOL. 2026.07
2026.07.22
← 返回 2026.07.22 日报
日报快照 · Daily Snapshot
NO. 023

视频时序定位终于不用RL硬训了

#HF_PAPERS HuggingFace Papers 2026.07.22
推荐指数 72.0 NO. 023 · 2026.07.22
upvotes139comments1

TimeLens2 用集合监督替代传统强化学习,让多模态大模型能精准定位视频中任意查询对应的证据时间段。对做视频理解、内容审核、智能剪辑的团队来说,这是首个真正通用的时序 grounding 方案。

视频时序定位终于不用RL硬训了

之前视频时序定位的主流做法是强化学习,但奖励设计要么对非重叠预测不敏感,要么依赖脆弱的段匹配规则,导致模型在长视频上泛化差。TimeLens2 的关键改进是把整个问题重新建模为区间集合预测,从标注到优化保持一致的集合语义,避开了 RL 的奖励工程陷阱。

论文构建了 93K 的多跨度标注数据集,覆盖不同领域和查询形式,这比之前依赖单次标注的长视频数据集可靠得多。代码和模型权重尚未确认是否开源,但方法本身对现有视频 MLLM 的改造代价很低,主要工作在数据层和损失函数层,算力需求可控。如果你在用 Qwen2-VL 或 LLaVA-Video 做视频问答但时序精度不够,这个监督范式值得迁移。

查看原文 →