VLA机器人模型加入双记忆机制
推荐指数 67.0 NO. 025 · 2026.07.10
upvotes44comments1
为什么值得看
LaMem-VLA 将历史经验以双潜记忆组件嵌入 VLA 模型的原生潜空间,突破马尔可夫假设下的短时序限制。对做长程机器人操控任务的团队,这是首次让记忆与多模态推理真正同频流动。
媒体预览
编辑判断
现有 VLA 模型处理长程任务的主流做法是堆叠观测窗口或外挂记忆库,本质是把历史当外部检索源,推理时现查现用。LaMem-VLA 的关键在于让记忆本身成为潜空间内的原生运算对象,读写与视觉语言推理共享同一表征,避免了跨空间映射的信息损耗。
从工程角度看,这要求训练阶段就对记忆读写头做联合优化,算力开销会高于标准 VLA,但推理时不需要额外检索模块。论文提到代码将开源,做实体机器人部署的团队可以先关注其记忆压缩率——潜空间维度过高会直接拖慢控制频率。
相关内容
ReMem-VLA: Empowering Vision-Language-Action Model with Memory via Dual-Level Recurrent Queries 通过双层循环查询为VLA模型赋能记忆机制,与双记忆机制研究路线高度相关。 PI VLA模型解读系列(四):多尺度具身记忆(MEM) 分析记忆机制引入后模型性能反而下降的问题,为双记忆机制研究提供对比视角。 MemoryVLA: Temporal Sequential Decision-Making Physical Intelligence在CoRL 2024提出的记忆VLA方案,强调历史记忆与推理能力结合。