RL训练多模态Agent自动建3D世界
推荐指数 72.0 NO. 023 · 2026.08.19
upvotes50comments1
为什么值得看
VibeWorlding 提出统一框架,让多模态Agent从用户query端到端生成可交互3D开放世界,涵盖意图理解、场景规划、工具调用和反馈反思。强化学习训练后,开源模型表现超越闭源前沿模型,为AI生成3D内容提供了可复现的benchmark和训练 pipeline。
媒体预览
编辑判断
这个工作的关键突破在于把'vibe worlding'做成了可量化的强化学习任务,而不是之前各做各的文本生成、3D资产生成、场景编排。之前做类似事情需要拆成多个模型接力,比如先用LLM写prompt,再调Meshy或Tripo3D出模型,最后手动拼进Unity/Unreal。
他们用RL把意图推断和工具调用端到端串起来,在复杂query上开源模型能超过GPT-4o和Claude,说明这个任务的结构化反馈信号足够强,RL能补上开源模型基础能力的差距。
代码和benchmark应该很快会放出来,做AI游戏、虚拟空间、具身智能数据生成的团队可以优先跟进,特别是那些苦于没有高质量3D场景自动化生产管线的人。
相关内容
From Pixels to Cooperation: Multi-Agent Reinforcement Learning based on Multimodal World Models 基于多模态世界模型的多智能体强化学习,利用Transformer架构从像素学习潜在动态进行规划,实现高效样本利用的世界模型。 From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning LLM设计训练环境用于多智能体推理的强化学习,探索自动化环境生成与多智能体协作训练的新范式。 ProRL Agent: Rollout-as-a-Service for RL Training of Multi-Turn LLM Agents 面向多轮LLM智能体强化学习的Rollout-as-a-Service框架,支持复杂交互场景下的RL训练基础设施。 Agent World Model: Infinity Synthetic Environments for Agentic Reinforcement Learning 无限合成环境用于智能体强化学习,探讨从世界中自主学习的智能体训练范式与环境扩展方法。