视频自回归训练补上梯度缺失一环
推荐指数 59.0 NO. 024 · 2026.07.24
upvotes29comments1
为什么值得看
Self Gradient Forcing 提出双阶段训练策略,让自回归视频扩散模型在生成历史帧时也能接收未来帧的梯度反馈,解决"历史上下文-梯度断层"问题。对长视频生成团队来说,这是降低曝光偏差的另一条可行路径,且无需全序列反向传播。
媒体预览
编辑判断
当前主流的自回归视频生成如 OpenAI Sora、Google Lumiere 的滚动生成方案,都依赖 KV cache 复用但无法优化历史写入质量,导致误差随长度累积。SGF 的 trick 在于用第一遍无梯度 rollout 保存中间状态,第二遍选择性注入梯度,规避了全序列 BPTT 的显存爆炸。
这个方法理论上可以嫁接在任何基于 Self Forcing 的现有模型上,但论文尚未公布代码和训练开销数据,实际能外推到多长视频、对推理速度有无影响,需要等开源后验证。如果你在做长视频生成的训练 infra,建议跟踪其后续实现。
相关内容
End-to-End Training for Autoregressive Video Diffusion via Resampling Forcing 提出Resampling Forcing框架,实现自回归视频模型端到端训练,解决梯度缺失问题。 基于视频的自回归预训练的实证研究 构建Toto视频模型,用Transformer在超万亿视觉标记上预训练,验证自回归视频预训练有效性。 何必DiT!字节首次拿着自回归,单GPU一分钟生成5秒720p 首个VBench超越扩散模型的离散自回归视频生成器,实现快速文生视频、图生视频。 NOVA:无需矢量量化的自回归视频生成 采用标准自回归帧间预测,无需VQ,在帧内空间上实现高效视频生成。