VLM具身智能评测新框架
推荐指数 63.0 NO. 024 · 2026.07.31
upvotes65comments4
为什么值得看
HumanCLAW 用安全绳悬挂真人执行 VLM 指令,将高层决策与低层运动控制解耦,首次能独立判断 VLM 的"脑子"好不好使。对做机器人/具身智能的团队,这意味着终于能定位失败根因是模型决策还是执行层问题。
媒体预览
编辑判断
之前机器人领域测 VLM 都是端到端黑盒,失败了说不清是模型蠢还是电机抖。HumanCLAW 的 trick 在于用真人身体当"完美执行器"——人自己平衡、自己补偿扰动,VLM 只负责发技能指令。这比在仿真里测更真实,比上真机器人更可控。
这个思路可以迁移:如果你在做机械臂或人形机器人,先用 HumanCLAW 类似的方法筛一遍 VLM 的决策能力,再上硬件调控制,能省大量迭代时间。论文提到会开源,但代码还没放,建议先 mark 住等 release。
相关内容
面向具身操作的视觉-语言-动作模型综述 综述VLA模型进展,提及FOREWARN利用VLM轨迹评估能力筛选候选动作规划,提升任务稳定性与成功率,适用于真实机器人部署场景。 RoboJailBench:18类具身智能风险评测框架 提出面向具身机器人Agent的越狱攻击与防御评测基准,同时评估视觉场景理解、物理动作后果及安全防御对正常任务的影响。 IS-Bench: Evaluating Interactive Safety of VLM-Driven Embodied Agents AAAI发表的VLM驱动具身智能体交互安全性评测基准,关注视觉语言模型在具身环境中的安全风险评估。 面向具身操作的视觉−语言−动作模型综述 中文综述涵盖VLA-RL、FOREWARN等方法,讨论仿真到现实的性能落差及VLM评估在真实机器人数据上的应用。