视频MLLM RL训练省掉CoT
推荐指数 80.0 NO. 023 · 2026.08.27
upvotes88comments1
为什么值得看
OraRL提出用oracle rollouts替代chain-of-thought生成,结合解耦优势估计和符号平衡剪枝,解决视频多模态大模型RL后训练样本效率低的问题。对做视频理解模型后训练的团队来说,这意味着可以砍掉昂贵的CoT生成环节,直接提升扩展性。
媒体预览
编辑判断
当前视频MLLM的RL后训练普遍依赖CoT生成高质量rollout,但视频CoT的token成本极高且有效样本稀少。OraRL的关键洞察是把人工标注直接当作oracle rollout来用,绕过自举采样的低效问题,同时用解耦优势估计避免critic模型和策略模型的耦合坍塌。
相比DPO、KTO这些偏好优化方法,OraRL明确面向多任务大规模后训练场景,符号平衡剪枝则解决了视频任务中奖励信号稀疏导致的梯度方差问题。论文提到在多个视频QA和时序定位基准上样本效率提升2-5倍,但尚未确认是否开源代码和训练脚本。
如果你在用Qwen2-VL、InternVL这类模型做视频后训练且被CoT生成成本卡住,这个方法的工程迁移成本相对较低,值得等代码发布后验证。
相关内容
Video理解后训练综述:SFT、RL、TTS GRPO成为视频推理主流方法,避免人工偏好数据需求,需协同设计策略算法、多维奖励函数和高质量数据集。 GRIT: Teaching MLLMs to Think with Images 无需SFT或bbox标注,仅需20个训练数据,通过format、counting、acc三类reward实现纯视觉CoT推理。 Visual Planning: Let's Think Only with Images 纯视觉CoT方法,主要解决grid-based navigation问题,探索无文本思维链的视觉推理。 用于长视频推理的多模态工具增强强化学习 受DeepSeek-R1启发,应用GRPO后训练提升MLLM图像推理能力,构建MTVR数据集用于长视频理解。