AMAZINGINDEX.COM 日报快照
52.2
VOL. 2026.08
2026.08.31
← 返回 2026.08.31 日报
日报快照 · Daily Snapshot
NO. 002

伪造工具输出绕过AI代理护栏

#REPO GitHub Search 2026.08.31
推荐指数 70.0 NO. 002 · 2026.08.31
Stars266创建4 天前Forks20Issues0

TrustMeBro 通过 shim 拦截 Codex、Claude Code 等编码代理调用的命令行工具,可伪造或篡改工具输出以测试模型决策漏洞。这是首个无需插件或 MCP 集成即可对 AI 代理进行红队测试的轻量方案,适合评估工具依赖型代理的安全边界。

Bypass llm guardrails by confusing it with fabricated tool output.

伪造工具输出绕过AI代理护栏

之前测试 AI 代理的工具依赖漏洞,要么改模型本身(如直接 prompt injection),要么在环境层做复杂 hook,TrustMeBro 的 shim 方案把门槛降到了改 PATH 变量就能跑。跟传统 LLM 红队工具如 GANDALF 或 Promptfoo 比,它不碰模型输入层,专攻工具输出层——这是代理架构的新攻击面,之前缺乏标准化测试手段。

做 AI 代理安全或 Coding Agent infra 的团队应该关注,尤其是你的管线里有自动执行 shell 命令、DNS 查询、文件操作的环节。建议先用它测一下你的 agent 对 dig、curl、ls 这类基础命令的输出校验逻辑,多数实现目前为零。

Star History
Experimental

AI代理红队测试工具的开创者,填补无插件安全评估空白。

独特价值:首创无需插件/MCP的shim层拦截方案,轻量测试工具依赖型代理。

查看原文 →