视频生成模型的概率对齐评测基准
推荐指数 68.0 NO. 023 · 2026.08.29
upvotes74comments2
为什么值得看
PAWBench首次将世界模型评估从"单视频合理性"推进到"行为分布匹配",提出概率对齐概念及配套评测工具PAWEval。当前主流视频生成模型在重复采样时无法复现参考物理过程的行为分布,暴露世界建模能力的根本缺陷。
媒体预览
编辑判断
这篇工作的狠劲在于戳破了行业的一个默认假设:大家之前评视频生成只看VBench、FVD这些单帧/单视频指标,相当于用照片质量考核司机。PAWBench逼模型回答"同样刹车,车停下来的位置分布对不对",直接把Sora、Veo们拉到了物理仿真器的考场上。
从工程落地看,概率对齐的评测成本极高——需要大量重复采样来估计分布,这对推理基础设施是沉重负担。论文提到开源了PAWEval工具包,但尚未看到与主流API的集成方案。做视频生成infra的团队可以优先跟进,这可能会成为下一代世界模型竞赛的入场券。