视频生成推理成本砍90%
推荐指数 82.0 NO. 021 · 2026.05.08
upvotes93comments1
为什么值得看
Stream-T1 把 Test-Time Scaling 从扩散模型搬到流式视频生成,用分块合成+少量去噪步数大幅降低候选探索开销,同时实现细粒度时序控制。对做实时视频生成或想省训练成本的团队有直接参考价值。
媒体预览
编辑判断
当前视频生成的 TTS 路线基本被 Sora、可灵这类扩散模型主导,但候选帧搜索的成本让推理 scaling 成了奢侈品。这篇的关键洞察是流式生成(如 StreamingT2V、LTX Video 的路线)天然适合 TTS:chunk 粒度小、步数少,搜索空间指数级下降。
从工程角度看,如果结合现有流式模型的 checkpoint,这个方法可能让单卡实时视频生成+质量提升成为现实,而不需要堆 A100 做并行采样。论文提到代码将开源,建议关注其实际推理延迟数字,以及和原生流式模型相比的 FVD 差距是否可接受。