AMAZINGINDEX.COM 日报快照
41.1
VOL. 2026.08
2026.08.30
← 返回 2026.08.30 日报
日报快照 · Daily Snapshot
NO. 002

免训练一键解除大模型安全限制

#REPO GitHub Trending 2026.08.30
推荐指数 68.0 NO. 002 · 2026.08.30
Stars28,625

Heretic 用方向消融(abliteration)+ Optuna 自动优化,无需后训练即可移除 Transformer 模型的安全对齐层。对研究模型行为边界、红队测试或需要无过滤基座的开发者有直接价值。

Fully automatic censorship removal for language models

免训练一键解除大模型安全限制

之前做模型去限制主要靠手动找拒绝方向或暴力微调,成本高且容易破坏通用能力。Heretic 把 Arditi 等人的 abliteration 方法自动化了,用 TPE 搜索最优干预参数,比手动调参更稳定,28K stars 说明社区需求很真实。

跟直接下载 uncensored 模型(如 Dolphin 系列)相比,Heretic 的优势是可以对任意已有模型即时处理,不需要重新训练或托管大文件。做 AI 安全研究、红队测试,或者需要可控基座做下游微调的团队,这个工具能省掉大量试错时间。

需要注意:Hugging Face 和多数云厂商对去限制模型有使用政策风险,生产环境部署前务必确认合规边界。

Star History
Beta

自动化方向消融工具的开创者,为LLM安全研究提供无训练去对齐基座

独特价值:首个全自动Optuna优化消融方案,零训练成本移除安全限制

查看原文 →