MLLM记忆能力基准测试套件发布
推荐指数 65.0 NO. 025 · 2026.06.19
upvotes36comments5
为什么值得看
RNG-Bench 首次将多模态大模型的隐藏状态重建能力与决策能力解耦评估,通过可控难度的非马尔可夫游戏和记忆间隔指标,区分模型是真的"忘了"还是"决策错了"。对部署视觉语言模型做机器人控制、自动驾驶等闭环决策的工程师有直接参考价值。
媒体预览
编辑判断
当前多数 VLM 评测要么喂全量信息回避记忆问题,要么在 episode 结束后才测回忆,导致工程上常见的"模型看着前面帧却做不对决策"场景被掩盖。RNG-Bench 的两个游戏设计很务实:难度参数可插拔,方便做消融;记忆间隔指标把"遗忘"和"决策噪声"拆开,这对调试机器人管线时定位是感知模块丢信息还是规划模块用错信息很关键。
不过 36 upvotes 说明社区关注度一般,可能跟没放代码有关。如果作者后续开源环境,这个基准很可能成为 VLM 做 embodied AI 的标配测试之一。做机器人、自动驾驶闭环系统的团队可以先 mark,等代码释放后跑自家模型看看记忆衰减曲线。