AMAZINGINDEX.COM 日报快照
56.8
VOL. 2026.08
2026.08.27
← 返回 2026.08.27 日报
日报快照 · Daily Snapshot
NO. 023

视频MLLM RL训练省掉CoT

#HF_PAPERS HuggingFace Papers 2026.08.27
推荐指数 80.0 NO. 023 · 2026.08.27
upvotes88comments1

OraRL提出用oracle rollouts替代chain-of-thought生成,结合解耦优势估计和符号平衡剪枝,解决视频多模态大模型RL后训练样本效率低的问题。对做视频理解模型后训练的团队来说,这意味着可以砍掉昂贵的CoT生成环节,直接提升扩展性。

当前视频MLLM的RL后训练普遍依赖CoT生成高质量rollout,但视频CoT的token成本极高且有效样本稀少。OraRL的关键洞察是把人工标注直接当作oracle rollout来用,绕过自举采样的低效问题,同时用解耦优势估计避免critic模型和策略模型的耦合坍塌。

相比DPO、KTO这些偏好优化方法,OraRL明确面向多任务大规模后训练场景,符号平衡剪枝则解决了视频任务中奖励信号稀疏导致的梯度方差问题。论文提到在多个视频QA和时序定位基准上样本效率提升2-5倍,但尚未确认是否开源代码和训练脚本。

如果你在用Qwen2-VL、InternVL这类模型做视频后训练且被CoT生成成本卡住,这个方法的工程迁移成本相对较低,值得等代码发布后验证。

查看原文 →