伪造工具输出绕过AI代理护栏
推荐指数 70.0 NO. 002 · 2026.08.31
Stars266创建4 天前Forks20Issues0
为什么值得看
TrustMeBro 通过 shim 拦截 Codex、Claude Code 等编码代理调用的命令行工具,可伪造或篡改工具输出以测试模型决策漏洞。这是首个无需插件或 MCP 集成即可对 AI 代理进行红队测试的轻量方案,适合评估工具依赖型代理的安全边界。
Bypass llm guardrails by confusing it with fabricated tool output.
媒体预览
编辑判断
之前测试 AI 代理的工具依赖漏洞,要么改模型本身(如直接 prompt injection),要么在环境层做复杂 hook,TrustMeBro 的 shim 方案把门槛降到了改 PATH 变量就能跑。跟传统 LLM 红队工具如 GANDALF 或 Promptfoo 比,它不碰模型输入层,专攻工具输出层——这是代理架构的新攻击面,之前缺乏标准化测试手段。
做 AI 代理安全或 Coding Agent infra 的团队应该关注,尤其是你的管线里有自动执行 shell 命令、DNS 查询、文件操作的环节。建议先用它测一下你的 agent 对 dig、curl、ls 这类基础命令的输出校验逻辑,多数实现目前为零。
Star History
生态分析
Experimental
AI代理红队测试工具的开创者,填补无插件安全评估空白。
独特价值:首创无需插件/MCP的shim层拦截方案,轻量测试工具依赖型代理。