GPT 随机数生成存在显著偏差
推荐指数 39.0 NO. 019 · 2026.05.26
发布2026/05/25Score80Comments62
为什么值得看
10k 次实验显示 ChatGPT 在 1-100 随机数选择中严重偏离均匀分布,呈现明显聚类偏好。这揭示了 LLM 的"随机性"本质是训练数据频率的映射,对依赖随机采样的算法和应用有直接影响。
编辑判断
之前做 RLHF 数据生成或多样性采样时,大家默认 temperature 调高就能保证随机性,这个实验直接证伪了。实际影响很具体:用 GPT 做蒙特卡洛模拟、A/B 测试分组、密码学 nonce 生成都会出问题。
更深层的问题是,很多"随机"场景 LLM 会偏向选 42、7、73 这类文化高频数字,这和人类心理学上的数字偏好一致,说明 LLM 的"随机"是在模仿人类而非真随机。如果你在做需要统计严谨性的产品,建议把 LLM 输出接入真随机数生成器做重采样,而不是直接信任。
社区反馈
负面 63 条评论
核心争论:LLM随机性偏差是否值得研究,还是只是对模型本质的常识性发现
ha. and i thought 37signals was pretty random
I wonder if Benford's law kicks in with larger numbers. https://en.wikipedia.org/wiki/Benford%27s_law
Breaking: language model whose purpose is to predict the most likely token, after being trained on non-uniform human-generated dataset, does not follow a uniform distribution.