自动解除大模型安全审查
推荐指数 65.0 NO. 006 · 2026.05.28
Stars21,955
为什么值得看
Heretic 用方向消融(abliteration)+ Optuna 参数优化,无需后训练即可自动移除 transformer 模型的安全对齐限制。对研究模型行为边界、红队测试或需要无审查基座的团队有实用价值,但需注意合规风险。
Fully automatic censorship removal for language models
媒体预览
编辑判断
之前移除模型安全限制主要靠手动找拒绝方向或微调,比如用 uncensored 数据集做 SFT/DPO,成本高且容易破坏通用能力。Heretic 把 Arditi 等人的 abliteration 方法自动化了,用 TPE 搜索最优干预参数,省去了人工调参。
跟手动 abliteration 或 GlaDOS 这类硬编码方案比,Heretic 的优势是完全自动适配新模型,不需要为每个模型手写配置。但注意它目前只支持部分架构,且绕过安全限制在某些司法管辖区有法律风险。
做模型安全研究、红队测试或需要分析模型真实知识边界的团队最适合试用,生产环境部署前务必做合规评估。
Star History
生态分析
Experimental
自动化模型安全对齐移除工具,填补红队测试与模型行为研究的基础设施空白
独特价值:首个全自动abliteration方案,免后训练即可解除审查限制