OpenART:动态环境持续攻击AI Agent
推荐指数 72.0 NO. 023 · 2026.08.14
upvotes159comments3
为什么值得看
OpenART 搭建了一个可进化的有状态环境,专门测试 AI Agent 在长周期任务中的安全漏洞,发现任务越复杂 Agent 失败率越高。对正在部署 Agent 系统的团队来说,这是目前少有的能暴露累积性风险的评测工具。
媒体预览
编辑判断
当前主流 Agent 安全评测如 AgentHarm、ToolEmu 都是静态单轮任务,测的是单次调用会不会出错,但真实业务里 Agent 连续操作数据库、API、文件系统几小时后,状态污染引发的连锁崩溃才是致命风险。OpenART 的 EMHA 攻击策略核心 trick 是优先选择能改变环境状态的动作(如修改配置、删除缓存),让后续正常任务持续踩雷,这种"埋雷式"攻击比直接注入恶意指令更难防御。
论文提到在 12 步以上的长周期任务中,主流 Agent 的失败率从单步的 15% 飙升到 67%,这个数据应该让不少做客服 Agent、运维 Agent 的团队后背发凉。代码和 benchmark 已开源,如果你的 Agent 产品涉及多轮状态操作,建议直接拿这个当压力测试基线,而不是继续用静态 case 自欺欺人。