多智能体世界模型突破双人限制
推荐指数 73.0 NO. 024 · 2026.05.29
upvotes154comments1
为什么值得看
提出基于单纯形旋转编码和稀疏枢纽注意力的生成式多智能体世界模型,实现任意数量智能体的可扩展、置换对称交互。解决了游戏、机器人仿真等场景中多实体同时控制的难题,为交互式视频生成开辟新范式。
媒体预览
编辑判断
当前主流世界模型如 GAIA-1、DriveDreamer 都假设单控制信号,多智能体场景只能串行或简化处理。这篇的核心 trick 在于用单纯形顶点编码智能体身份,配合稀疏注意力把交互复杂度从 O(n²) 降到接近 O(n),理论上能扩展到数十个智能体。
实验主要在简化游戏环境上验证,尚未展示真实机器人或开放世界结果。代码和模型尚未开源,但方法本身不依赖特定架构,值得在现有视频生成框架(如 Sora、CogVideo 的扩散 transformer)上快速复现验证。如果你在做具身智能或游戏 AI 生成,建议优先关注稀疏枢纽注意力的实现细节,这可能是工程落地的关键瓶颈。