LLM越狱攻击防御测试工具箱
推荐指数 60.0 NO. 008 · 2026.05.29
Stars202创建今天Forks1Issues0
为什么值得看
WorpGPT 是一套用于在受控环境中模拟对抗性提示攻击的防御研究工具集,支持安全团队标准化测试模型的越狱抵抗能力。对部署 LLM 到生产环境的团队来说,这是目前少有的专门面向"红队测试"的开源基础设施。
A comprehensive Red Teaming framework for testing Large Language Model (LLM) robustness against adversarial prompt engineering and jailbreak vectors.
编辑判断
目前业界做 LLM 安全测试大多依赖内部脚本或 Garak、PyRIT 等零散工具,缺乏针对"WormGPT"类社会工程攻击的结构化测试框架。这个仓库的 value 在于把攻击模板、评估指标、合规检查做成了闭环,比微软的 PyRIT 更易上手,但生态成熟度还不如。
真正值得关注的点是它把 C# 和 Java 纳入了支持范围,这对金融、政务等传统技术栈的机构很友好。如果你的团队还在用人工构造 prompt 做安全测试,建议先跑一遍它内置的 200+ 攻击模板,至少能快速补齐测试覆盖率盲区。
Star History
生态分析
Experimental
面向LLM安全红队的对抗性越狱测试框架,处于灰色地带的防御研究工具。
独特价值:唯一将越狱攻击工具包装为标准化红队测试基础设施的开源项目。