← 最新论文
💬 NLP

Sampling More, Getting Less: Calibration is the Diversity Bottleneck in LLMs

本文指出,大语言模型中的多样性崩溃主要源于解码过程中其概率分布的顺序和形状校准失当,而非采样启发式方法的局限性,从而导致输出有效性与多样性之间的权衡。

原作者: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Amin Banayeeanzade, Qingchuan Yang, Dhruv Tarsadiya, Fatemeh Bahrani, Leonardo Blas, Alfy Samuel, Robin Jia, Meisam Razaviyayn, Sai Praneeth Karimireddy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你让一个大语言模型(LLM)讲一个故事、写一首诗,或者推荐一个随机城市。你期待得到各种各样富有创意的回答。然而,模型却往往陷入死胡同,反复给出那几句陈词滥调(比如“很久很久以前……"或者“智利瓦尔帕莱索”)。

本文探讨了为什么会发生这种情况。作者认为,问题不仅仅在于模型“无聊”,也不在于我们当前选词工具(采样方法)的缺陷。相反,问题根植于模型组织其内部概率图的方式。他们将此称为“校准瓶颈”。

为了解释这一点,想象模型是一位站在巨大书墙(所有可能的下一个词)前的图书管理员。管理员必须挑选下一个词来延续故事。

两个主要问题

该论文指出了这位管理员“校准失调”(与现实不符)的两种具体方式,正是这些方式导致了多样性的崩塌。

1. 顺序校准:管理员无法整理书籍

类比:
想象你让管理员挑选一本“好”书。你期望管理员把所有“好”书放在书架的最顶层,把所有“坏”书放在最底层。

  • 模型的做法: 管理员把一些好书放在顶层,但在中间混入了一堆坏书。然后,在书架更靠下的位置,又藏着更多夹杂在坏书中的好书。
  • 后果: 如果你告诉管理员“只给我前 10 本书”,你可能会得到 5 本好书和 5 本坏书。如果你说“为了保险起见,给我前 100 本”,你会得到 90 本坏书。
  • 论文的观点: 模型在顺序校准上失败了。它无法可靠地将“有效”(正确/有意义)的词的排名置于“无效”(无意义)的词之上。由于有效和无效的词汇在排名中混杂在一起,任何试图过滤列表的工具(如"Top-K"或"Top-P")都被迫做出糟糕的选择:要么为了避开坏点子而切断好点子,要么为了保留好点子而包含太多坏点子。

2. 形状校准:管理员痴迷于一本书

类比:
现在想象管理员确实成功地将好书与坏书分开了。但在查看“好”书堆时,管理员却痴迷于某一本特定的书。

  • 模型的做法: 管理员将 90% 的注意力集中在某一本特定的“好”书(例如“很久很久以前”)上。其余 99 本“好”书只得到了极小极小的一丝关注。与此同时,“坏”书则散落在最底部的漫长而细薄的尾巴中。
  • 后果: 即使你试图通过“温度”(Temperature,就像告诉管理员要更随机一些)来搅动局面,管理员也只是稍微转移了他们的痴迷对象。他们可能不再痴迷于“很久很久以前”,转而痴迷于“在一个……的世界里”,但他们仍然忽略了其他 98 个好的选项。更糟糕的是,让管理员变得更随机,往往只是让他们从长尾巴中挑选一本“坏”书,而不是罕见的“好”书。
  • 论文的观点: 模型在形状校准上失败了。概率过于集中在少数几个特定的有效选项上,导致其余有效选项得不到足够的关注。

多米诺效应:为何一个小错误会变成灾难

论文解释说,随着故事变长,这些问题会愈发严重。

类比:
想象你正在穿过一个迷宫。

  • 第 1 步: 在第一个转弯处,你有 90% 的概率选对路,10% 的概率选到死胡同。这看起来还不错。
  • 第 2 步: 在下一个转弯处,你再次有 90% 的概率选对。
  • 结果: 如果你需要转 20 个弯,那么在不踏入任何死胡同的情况下走对整条路径的概率将降至几乎为零。

论文从数学上证明,由于模型在每一步都犯下小错误(选错了词汇组合或过度关注某一个词),这些错误会累积。等到模型完成一个句子或一段落时,它探索出真正多样化且有效路径的概率已呈指数级地微乎其微。

他们做了什么?

研究人员并非凭空猜测,而是构建了一套“诊断工具包”:

  1. 受控测试: 他们给模型布置了简单的任务,在这些任务中,他们确切知道正确答案的列表(例如生成随机数字或列举美国各州名称)。
  2. “神谕”测试: 他们创建了一个完美的过滤器,确切知道哪些词是有效的。即使有了这个完美过滤器,模型仍然难以实现多样性,因为存在“形状”问题(对某一个词的痴迷)。
  3. 结论: 他们测试了 14 个不同的模型(从微小到巨大)。他们发现,更大的模型并没有解决这个问题。即使是最聪明的模型,仍然存在这些排序和集中度的问题。

核心结论

论文得出结论,AI 缺乏多样性不仅仅是“挑选”工具(如温度或 Top-K 采样)中的漏洞。这是模型分配其置信度方式中的一个根本性缺陷。

  • 它无法可靠地将有效词汇的排名置于无效词汇之上。
  • 它无法在所有有效词汇之间均匀地分配注意力。

在模型学会以不同的方式组织其内部图书馆之前,仅仅调整设置无法解锁真正的创造力或多样性。“瓶颈”在于模型自身的分布,而非我们用来读取它的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →