AMAZINGINDEX.COM 日报快照
54.3
VOL. 2026.05
2026.05.28
← 返回 2026.05.28 日报
日报快照 · Daily Snapshot
NO. 006

自动解除大模型安全审查

#REPO GitHub Trending 2026.05.28
推荐指数 65.0 NO. 006 · 2026.05.28
Stars21,955

Heretic 用方向消融(abliteration)+ Optuna 参数优化,无需后训练即可自动移除 transformer 模型的安全对齐限制。对研究模型行为边界、红队测试或需要无审查基座的团队有实用价值,但需注意合规风险。

Fully automatic censorship removal for language models

自动解除大模型安全审查

之前移除模型安全限制主要靠手动找拒绝方向或微调,比如用 uncensored 数据集做 SFT/DPO,成本高且容易破坏通用能力。Heretic 把 Arditi 等人的 abliteration 方法自动化了,用 TPE 搜索最优干预参数,省去了人工调参。

跟手动 abliteration 或 GlaDOS 这类硬编码方案比,Heretic 的优势是完全自动适配新模型,不需要为每个模型手写配置。但注意它目前只支持部分架构,且绕过安全限制在某些司法管辖区有法律风险。

做模型安全研究、红队测试或需要分析模型真实知识边界的团队最适合试用,生产环境部署前务必做合规评估。

Star History
Experimental

自动化模型安全对齐移除工具,填补红队测试与模型行为研究的基础设施空白

独特价值:首个全自动abliteration方案,免后训练即可解除审查限制

查看原文 →