Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions
该论文通过大规模统计审计发现,当前大型语言模型在生成符合特定概率分布的随机数方面表现极差,无论是批量生成还是独立请求均存在严重缺陷,且随着分布复杂度和采样规模增加而加剧,导致其在多项下游应用中产生系统性偏差,表明其缺乏内置的有效随机采样机制,必须依赖外部工具来满足统计保证。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文就像是一份**“大型语言模型(LLM)的体检报告”**,专门检查它们是否真的懂得什么是“随机”。
简单来说,作者们发现:现在的 AI 虽然很聪明,能写诗、能写代码,但它们完全不会“掷骰子”。 如果让它们直接生成随机数字,它们就像是一个喝醉了的人,根本分不清什么是真正的随机。
为了让你更容易理解,我们可以用几个生动的比喻来拆解这篇论文的核心发现:
1. 核心问题:AI 是个“假随机”的赌徒
想象一下,你让 AI 扮演一个赌场发牌员,让它发 1000 张牌,要求每张牌出现的概率必须完全一样(比如红桃、黑桃、梅花、方块各占 25%)。
- 理想情况:AI 应该像一台精密的机器,发出来的牌分布非常均匀,没有任何规律。
- 实际情况:AI 发出来的牌有严重的**“偏好”**。它可能特别喜欢发“红桃”,或者总是把“方块”放在最后。它以为自己在随机,其实心里早就有了“小算盘”。
2. 两个实验:是“作弊”还是“真随机”?
为了搞清楚 AI 是真的懂随机,还是只是在“演戏”,作者设计了两种测试方法:
实验 A:一次发一堆(Batch Generation)
- 比喻:你让 AI 一次性写下 1000 个随机数字。
- 结果:AI 表现得**“还行”**。因为它在写第 1000 个数字时,可以回头看看前面写了什么,然后自我纠正:“哎呀,前面‘3'写多了,这次我写个‘7'吧。”
- 真相:这就像是一个**“事后诸葛亮”**。它不是真的随机,而是靠上下文在“补漏”。
实验 B:一次只发一个(Independent Requests)
- 比喻:你让 AI 发一次,然后关掉对话,再发一次,再关掉……重复 1000 次。每次它都像个失忆的人,不知道之前发过什么。
- 结果:彻底崩盘。11 个最顶尖的模型里,有 10 个连一个分布都发不对。
- 真相:一旦切断了“记忆”,AI 就暴露了它根本没有内在的随机机制。它所谓的“随机”,其实只是模仿了人类语言中“看起来像随机”的套路,而不是真的在计算概率。
3. 越复杂,越抓瞎
作者测试了 15 种不同的数学分布(从简单的均匀分布到复杂的“长尾分布”)。
- 比喻:
- 简单任务:让 AI 在 1 到 10 之间随便选个数。它还能蒙对个大概。
- 复杂任务:让 AI 模拟“地震发生的频率”或者“股票价格的波动”(这些分布很复杂,有长尾巴)。
- 结果:任务越复杂,AI 的“随机”就越离谱。它就像是一个只会背乘法口诀的小学生,突然被要求解微积分,直接就开始胡编乱造了。
4. 数量越多,错得越离谱(反直觉的发现)
通常我们认为,样本越多,结果越准。但 AI 恰恰相反。
- 比喻:如果你让 AI 写 10 个随机数,它可能还能蒙对。但如果你让它写 1000 个,它积累的“错误”就会像滚雪球一样越来越大,最后完全偏离轨道。
- 结论:AI 生成的样本越多,统计上的偏差就越明显,甚至到了“一眼假”的地步。
5. 现实世界的危害:不仅仅是数字游戏
如果 AI 连随机数字都发不准,那它在实际应用中会出什么乱子?作者举了两个例子:
例子 1:出题考试(选择题)
- 要求:让 AI 出 1000 道医学题,正确答案要在 A、B、C、D 四个选项里均匀分布(各 25%),防止学生猜答案。
- 结果:AI 根本做不到。比如 GPT-4o 出的题,正确答案有 46.8% 都在 B 选项,而 D 选项几乎没人选。学生如果发现了这个规律,就能不学知识直接“蒙对”答案,考试就废了。
例子 2:生成图片提示词(Text-to-Image)
- 要求:让 AI 生成 1000 个描述人物的提示词,要求男女比例、种族比例严格符合美国人口普查数据(比如黑人占 12.6%,亚裔占 6.5%)。
- 结果:AI 完全失控。有的模型生成的全是白人,有的模型生成的全是女性,有的模型生成的衣服颜色 96% 都是绿色的。
- 后果:如果你用这些 AI 生成的数据去训练其他 AI,或者用来做社会研究,得到的结论将是严重偏见的。
总结:AI 需要“外挂”
这篇论文告诉我们一个残酷的事实:目前的 AI 并没有真正学会“概率”和“随机”。 它们只是学会了用语言描述“随机”的样子,就像一个人背熟了“随机”的定义,却不会真的掷骰子。
这意味着什么?
如果你需要 AI 做涉及随机性、公平性、统计推断的工作(比如生成测试题、模拟社会实验、做科学采样),你不能直接信任 AI 的输出。你必须给 AI 配一个“外挂”——比如让它调用 Python 的 numpy.random 库来生成数字,然后 AI 只负责把数字变成文字。
一句话总结:
现在的 AI 是个“语言天才”,但也是个“数学白痴”。在需要真正随机的时候,别让它自己掷骰子,给它递个真正的骰子(外部工具)吧!
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。