具身智能三系统架构突破泛化瓶颈
推荐指数 75.0 NO. 024 · 2026.08.27
upvotes89comments2
为什么值得看
GigaBrain-0.7 采用三系统架构+异构预训练,将 VLA 模型扩展到更大规模数据并提升跨任务泛化能力。对做机器人/具身智能的读者来说,这是验证架构创新能否带来涌现能力的关键尝试。
媒体预览
编辑判断
当前 VLA 领域的主流做法是端到端单系统(如 RT-2、OpenVLA),GigaBrain 的三系统拆分(感知、推理、执行)实际上是在模仿人类认知架构,这和大厂们押注的 Scaling Law 路线不同——它赌的是结构创新而非单纯堆数据。
从论文摘要看,核心变量是 joint alignment training 能否让三个异构模块真正协同,而不是各自为政。如果开源,建议重点跑它的跨本体迁移实验,这是判断是真泛化还是过拟合的关键指标。
算力需求目前未披露,但 0.7B 的参数量暗示可能面向端侧部署,做低成本机器人本体的团队可以优先关注。
相关内容
面向具身智能的世界模型综述 提出三轴分类框架,从功能耦合性、时间建模、空间表示三个维度厘清世界模型设计逻辑,涵盖DreamerV3、Sora、V-JEPA 2等代表性方案。 基于大模型的具身智能系统综述 系统梳理大模型驱动的具身智能技术路线,探讨视觉-语言融合、开放词汇检测等关键能力在机器人系统中的应用。 Embodied AI: From LLMs to World Models 从认知科学和神经科学出发,提出具身智能三关键组件闭环架构:主动感知、认知推理与交互执行,强调感知-认知-交互的动态耦合。 Discrete Policy: Learning Disentangled Action Space for Multi-Task Robotic Manipulation 针对多任务机器人操作中动作模式多样化挑战,提出解耦动作空间学习方法,解决抓、放、推、拉等技能的模式区分与适应问题。