AMAZINGINDEX.COM 日报快照
54.2
VOL. 2026.08
2026.08.19
← 返回 2026.08.19 日报
日报快照 · Daily Snapshot
NO. 025

世界模型评测首次引入推理链

#HF_PAPERS HuggingFace Papers 2026.08.19
推荐指数 64.0 NO. 025 · 2026.08.19
upvotes107comments1

HarnessEval-W 用分层子代理把世界模型评测拆解为可验证的推理链,让评分附带透明证据而不仅是数字。对做视频生成、物理模拟的团队来说,终于不用再盲信一个黑盒分数了。

当前世界模型评测的主流做法是用 FVD、PSNR 等指标暴力对比像素差异,Sora、Runway 等模型的技术报告里那些漂亮数字就是这么来的,但像素接近不代表物理合理。HarnessEval-W 的代理化思路本质上是在评测环节复刻了人类审稿人的判断过程,这跟 LLM 领域从 BLEU 分数转向 LLM-as-a-Judge 的演进路线一致。

论文提到用了 GPT-4o 作为基础代理,评测成本会比传统指标高 1-2 个数量级,这是落地的主要障碍。但如果开源社区能复现并蒸馏出轻量版评判模型,可能成为视频生成领域的 Chatbot Arena。

做世界模型创业的公司值得关注,如果竞争对手还在用传统指标刷榜,这可能是建立评测壁垒的机会。

查看原文 →