The Illusion of Stochasticity in LLMs
该论文通过实证分析指出,尽管前沿大语言模型能够利用外部随机种子生成符合目标分布的样本,但其直接将内部概率估计转化为随机输出的能力存在根本性缺陷,无法满足智能体系统对可靠随机采样的核心需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
这篇论文揭示了一个关于大型语言模型(LLM)的有趣且重要的“幻觉”:它们并不像我们以为的那样,真的懂得如何“随机”做事。
我们可以把这篇论文的核心发现想象成这样一个故事:
1. 核心问题:聪明的“演员”却是个糟糕的“掷骰子手”
想象一下,你雇佣了一位非常聪明的演员(LLM)来扮演一个需要随机决策的角色,比如玩石头剪刀布,或者在抽奖箱里随机摸球。
- 演员的强项:他非常聪明,能完美理解游戏规则。如果你问他:“石头剪刀布里,出‘石头’的概率应该是多少?”他会毫不犹豫地回答:“三分之一,非常公平。”
- 演员的弱项:当你真的让他现场出招时,他却做不到真正的随机。如果你让他连续出 100 次,你会发现他出“石头”的次数可能高达 80 次,或者总是倾向于出“剪刀”。
论文发现:目前的顶尖大模型(如 Gemini、Qwen3 等)虽然知道概率分布(比如知道均匀分布应该是每个数字出现几率一样),但在执行随机采样时,却完全失败了。它们生成的数字或选择,充满了奇怪的偏见。
2. 具体的“翻车”现场
研究人员让模型做了一些简单的测试,结果令人啼笑皆非:
选择题的“C 位”诅咒:
如果你让模型生成一道选择题,并随机把正确答案放在 A、B、C、D 四个位置。按理说,正确答案出现在每个位置的概率应该是 25%。
现实是:模型疯狂地喜欢把正确答案放在 C 的位置!就像它潜意识里觉得"C"是主角位一样。这就像让一个裁判抛硬币,结果抛了 100 次,90 次都是正面。数字的“执念”:
如果你让模型从 0 到 9 里随机选一个数字,它不会均匀地选。它总是偏爱某些数字,比如 7 或者 42(可能是因为训练数据里这些数字出现得太多了)。这就好比让一个人闭眼在 1 到 100 之间随便指一个数,结果他每次都指在中间那个数上。连续数字的“舒适区”:
如果你让它生成一个 0 到 1 之间的小数,它生成的数字往往集中在 0.5 附近,而不是均匀地散布在整个区间。
3. 为什么“思考”也没用?
你可能会想:“那让它多思考一下(Chain-of-Thought),或者换个温度参数(Temperature)行不行?”
- 思考也没用:研究发现,即使模型在“思考”过程中大声嚷嚷着“我要随机!我要公平!”,它最后输出的结果依然充满了偏见。它就像是一个知道怎么游泳但一下水就抽筋的人——理论满分,实践零分。
- 参数调整无效:无论怎么调整生成的“随机性”参数,这种偏见依然存在。
4. 唯一的“救命稻草”:借别人的手
既然模型自己不会掷骰子,那怎么办?
方法一:给模型一把“现成的骰子”(工具调用)
如果让模型写一段 Python 代码,调用电脑自带的随机函数(random.randint),并且明确告诉它:“每次运行都要用当前时间作为种子,确保结果不同”,那么模型就能生成完美的随机数。- 比喻:这就像让演员自己扔骰子(失败),但让他去摇动一个别人准备好的、经过校准的摇奖机(成功)。
方法二:让模型“模拟”骰子(模拟算法)
如果你给模型一个具体的随机数生成算法代码(比如线性同余发生器)和一个种子,让它一步步算出结果。- 结果:对于简单的数字(均匀分布),大模型算得挺准(90% 以上正确)。
- 失败点:一旦涉及复杂的数学运算(比如生成正态分布需要算大数乘法),模型就会算错。就像让一个心算天才去算两个 20 位数的乘法,他很容易算错。
方法三:最神奇的能力——“转换”而非“生成”
这是论文最有趣的发现:如果你给模型一个已经随机生成好的数字(比如从 0 到 1 的随机数),然后让它把这个数字“转换”成另一个分布(比如转换成 0-9 的整数,或者正态分布)。
结果:模型做得非常好!- 比喻:模型自己造不出面粉(随机数),但它是个顶级面包师。如果你给它面粉(随机种子),它能完美地烤出各种形状的面包(目标分布)。它擅长转换,但不擅长创造随机性。
5. 这对我们意味着什么?
这篇论文给正在开发 AI 智能体(Agents)的开发者敲响了警钟:
- 不要指望 AI 自己“随机”:如果你需要 AI 进行探索、随机测试或模拟随机事件(比如在游戏中随机移动),绝对不能直接让 AI 自己输出结果。它生成的“随机”其实是“伪随机”,充满了可预测的偏见。
- 必须引入外部随机源:在构建 AI 系统时,必须引入外部的、真正的随机数生成器(RNG),然后把结果喂给 AI,让 AI 基于这些结果做决策。
- AI 是逻辑大师,不是随机大师:AI 擅长理解概率、执行转换算法,但它的“直觉”里充满了训练数据的偏见,无法产生真正的熵(混乱度/随机性)。
总结一句话:
现在的 AI 就像一个懂概率理论的数学家,但他自己掷骰子时却总是作弊(或者无意识地偏向某一面)。如果你需要真正的随机,请把骰子交给计算机,让 AI 只负责根据骰子的点数做决定。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。