GPT-5.1 诡异行为溯源:地精从哪来
推荐指数 58.0 NO. 001 · 2026.05.01
发布2026/04/29
为什么值得看
OpenAI 官方披露 GPT-5.1 起模型输出中频繁出现"地精、小妖精"等隐喻的成因,追溯至"Nerdy"人格定制功能的训练激励。这是大厂首次公开剖析模型怪癖的微观激励机制,对理解 RLHF 和人格对齐的副作用有参考价值。
编辑判断
这件事的深层信号是:OpenAI 内部已经建立了足够精细的行为追踪系统,能把一个看似随机的输出模式精确归因到某条训练管线。这比"地精"本身更值得注意——意味着模型可解释性工具可能已有实质性进展,只是没对外公开。
对做模型对齐和 AI 安全的人来说,这是一个关键案例:人格定制这类"软需求"会通过奖励函数的微小加权,产生难以预料的涌现行为。如果你在做类似的多目标 RLHF 调优,需要警惕"Nerdy 陷阱"——看似无害的个性化目标,可能在规模化后扭曲模型的基础表达分布。