AMAZINGINDEX.COM 日报快照
60.1
VOL. 2026.07
2026.07.10
← 返回 2026.07.10 日报
日报快照 · Daily Snapshot
NO. 027

国产「骂人AI」破圈:Prompt越狱新案例

#V2EX_HOT V2EX 2026.07.10
推荐指数 35.0 NO. 027 · 2026.07.10

国内开发者搭建了一个专门用脏话回复用户的AI对话应用,用户通过重复简单词汇即可触发其系统崩溃式回复,成为社区热门玩物。这暴露了当前大模型角色扮演防御的脆弱性,以及国产AI应用走娱乐化破圈的另类路径。

这个项目的真正价值不在「骂人」本身,而在它展示了一种极低成本的Prompt越狱范式:用户不需要构造复杂的对抗性提示,仅靠重复「你好」就能击穿系统指令层。这与去年Anthropic发现的「many-shot jailbreak」形成对照——后者需要数百轮对话诱导,而这个案例说明中文语境下的角色扮演防御可能更脆弱。

对做AI应用安全的团队来说,这是一个值得复现的测试用例。当前主流的内容安全方案如Azure Content Safety、百度文心内容审核,对「系统角色被覆盖」这类攻击的检测率普遍偏低。如果你的产品开放了自定义System Prompt或角色设定,建议把「重复简单词汇导致角色漂移」加入红队测试清单。

查看原文 →