世界模型评测首次引入推理链
推荐指数 64.0 NO. 025 · 2026.08.19
upvotes107comments1
为什么值得看
HarnessEval-W 用分层子代理把世界模型评测拆解为可验证的推理链,让评分附带透明证据而不仅是数字。对做视频生成、物理模拟的团队来说,终于不用再盲信一个黑盒分数了。
媒体预览
编辑判断
当前世界模型评测的主流做法是用 FVD、PSNR 等指标暴力对比像素差异,Sora、Runway 等模型的技术报告里那些漂亮数字就是这么来的,但像素接近不代表物理合理。HarnessEval-W 的代理化思路本质上是在评测环节复刻了人类审稿人的判断过程,这跟 LLM 领域从 BLEU 分数转向 LLM-as-a-Judge 的演进路线一致。
论文提到用了 GPT-4o 作为基础代理,评测成本会比传统指标高 1-2 个数量级,这是落地的主要障碍。但如果开源社区能复现并蒸馏出轻量版评判模型,可能成为视频生成领域的 Chatbot Arena。
做世界模型创业的公司值得关注,如果竞争对手还在用传统指标刷榜,这可能是建立评测壁垒的机会。
相关内容
世界模型调研|从视频预测到物理推理 —— 世界模型的技术演进 明确区分世界模型与视频生成模型:前者核心在于因果理解与可规划性,后者追求逼真渲染。LeCun强调世界模型应学习抽象表征而非像素重建。 对话清华商宇丨从生成视频到支撑行动,世界模型需要新的评测标准 WorldArena评测体系采用开环+闭环双轨设计,拆分生成能力为十余子维度,提供雷达图诊断模型优劣,超越单一成功率评分。 清华和腾讯混元、斯坦福等合作,发布首个面向多模态思维链的大模型评测基准 RBench-V 首个多模态思维链评测基准,要求解题过程涉及视觉生成或编辑,覆盖数学、物理、计数与游戏四大领域,强调推理链中的多模态输出。 “世界模型" 浅调研(2026.5) 极佳科技GigaWorld-Policy采用blockwise causal mask实现训练时视频监督+推理时action,与世界模型+推理链技术路线相关。