← 最新论文
🤖 AI

Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

本文揭示了经过指令微调的语言模型无法真正从响应分布中进行采样,而是由于对齐训练而坍缩为确定性输出,但它们可以在单次调用中准确描述这些分布,这种“知晓/执行”(KNOWS/DOES)差距使得通过分布描述或提示词扰动来更准确地模拟人类调查数据成为可能。

原作者: Chaemin Jang, Dongman Lee, Jihee Kim

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Chaemin Jang, Dongman Lee, Jihee Kim

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过向一个水晶球提出一百万个问题来预测未来。在人工智能的世界里,科学家们开始将“大语言模型”(LLMs)作为那个水晶球。研究人员不再询问真实的人对政治、电影或经济的看法,而是要求人工智能扮演不同类型的人——比如“来自俄亥俄州的青少年”或“来自佛罗里达州的退休教师”。这被称为“硅采样”(silicon sampling)。其原理很简单:如果你要求人工智能扮演一千种不同的人,它就应该给出一千个不同的答案,就像真实的群体一样。通过统计所有这些答案,你可以推测出整个群体的想法。这就像是通过品尝每一位顾客的一口冰淇淋,来猜测一家巨大的冰淇淋店的味道。

但问题在于:为了让这套方法奏效,人工智能必须能够在你每次提问时都能“掷骰子”。如果你问一个真实的青少年:“你喜欢披萨吗?”他们今天可能会说“喜欢”,明天可能会说“不喜欢”,或者他们可能只是在脑海中抛一枚硬币。人工智能也应该这样做,在你每次点击“发送”时生成一个新鲜的、随机的答案。如果人工智能无法真正进行“掷骰子”——如果无论你问多少次,它都卡在同一个答案上——那么整个实验就会失效。如果你第一个询问的顾客说“巧克力”,而人工智能强迫接下来的 999 个顾客也都说“巧克力”,你就无法通过这种方式猜出冰淇淋店的味道。

这正是 KAIST 的一个研究团队发现的问题。他们发现我们今天使用的 AI 模型存在一个奇怪的故障:它们非常擅长“描述”随机分布的样子,但却极其不擅长真正“执行”随机采样。这就像一个魔术师可以完美地描述一副扑克牌是如何洗牌的,但当被要求实际抽出一张随机牌时,却总是抽到了黑桃 A。

研究人员将此称为“知行分裂”(KNOWS/DOES split)。模型知道(KNOWS)答案。如果你问它:“百分之多少的人更喜欢选项 A 而不是选项 B?”,它可以给出完美的、准确的数学计算。但模型并不做到(DOES)这一点。如果你要求它扮演一个人并给出一个答案,它就会崩溃。它不会给出多样化的反应,而是会陷入单一、重复的答案中。

为了证明这一点,科学家们进行了一系列测试。他们要求 AI 在 1 到 100 之间随机选一个数字。你本以为答案会千变万化,结果 AI 在 78% 的尝试中都选了数字 42!当他们要求它在两个具有 70/30 分布比例的选项中做出选择时,AI 并没有给出混合结果,而是每次都选择了那占 70% 的选项。就好像 AI 内部有一个坏掉的骰子投掷器,被粘在了其中一面。

该团队还弄清楚了为什么会发生这种情况。他们对比了“聪明版”的 AI 模型(经过指令遵循和对话训练以变得有用)与“原始版”模型(尚未进行对话训练)。原始模型在掷骰子方面表现得好得多。而那些“聪明”的模型,由于经过了旨在使其保持一致性和有用性的训练,反而失去了随机性的能力。这是试图把 AI 变成一个“好学生”所带来的副作用:它学会了总是给出“正确”的答案,即使任务是要求它保持随机。

那么,如果我们需要在调查中使用这些 AI 模型该怎么办呢?研究人员发现了两个聪明的技巧。

首先,如果你只想了解大众的普遍观点(即“总体估计”),不要要求 AI 扮演 100 个不同的人。相反,只需问 AI 一个问题:“如果你问 100 个人这个问题,结果会是什么样子?”AI 非常擅长描述这种分布。当他们尝试使用这种“描述路径”(Describe Pathway)时,预测误差比使用传统的“让 AI 扮演许多人”的方法降低了一半以上。

其次,如果你确实需要 AI 提供 100 个不同的个体答案(比如在每个角色都需要独特个性的视频游戏中),你不能只是重复问同一个问题 100 次。AI 会不断重复自己。相反,研究人员发明了一种叫做“扰动提示词 Argyle”(Prompt-Perturbed Argyle, PPA)的方法。这包括每次都稍微改变提问的方式——比如改变答案选项的顺序、改变问题的措辞,或者移动“角色”描述的位置。这些微小的变化足以“摇动” AI 那坏掉的骰子投掷器,迫使它每次都给出不同的答案。这个简单的技巧在没有增加额外成本或时间的情况下,将误差降低了 21%。

简而言之,这篇论文告诉我们,虽然 AI 在描述世界运作方式方面非常出色,但它目前在模仿现实世界中的随机个体方面表现得很糟糕。但通过理解这一特性,我们仍然可以使用这些强大的工具来获得好的答案,只是我们必须用正确的方式去提问。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →