← 最新论文
🤖 machine learning

Language models suffer from a curse of ambiguity

本文识别并从理论上分析了大语言模型中的一种“歧义诅咒”,证明了由于容量需求、嵌入维度、训练步数以及采样噪声的放大,具有歧义的下一标记分布在本质上更难被准确学习,这一发现已通过合成实验和真实世界实验得到了验证。

原作者: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicolas Zucchet, Hyun Dong Lee, Scott Linderman

原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

现代计算机能够书写和说话,其基础在于一个简单而强大的理念:通过观察前文出现的词汇,来预测句子中的下一个词。这个过程是一个词接一个词进行的,就像一个人在构思故事时,根据已经说过的话来选择最可能的下一步。多年来,工程师们一直致力于让这些机器更擅长寻找那个单一且显而易见的答案。但随着这些系统变得日益先进,它们越来越多地被要求处理那些没有单一标准答案的情况。当一个句子可以有许多种不同且同样合理的结尾时,机器必须学会将它的信心分布到所有这些可能性之中,而不仅仅是挑选出排名第一的那个。这种理解不确定性的能力正变得至关重要,尤其是当这些机器开始为它们未来的版本编写训练数据时。如果它们无法捕捉到可能性的全貌,就有可能创造出一个狭窄、重复的循环,从而降低自身学习的质量。

斯坦福大学的一个研究小组发现了一个基本障碍,使得这项任务变得异常困难。他们发现,情况越模糊——即更有可能出现的后续词汇越多——机器就越难学习正确的概率分布。他们称之为“歧义之咒”(curse of ambiguity)。这不仅仅是机器反应变慢或需要更多数据的问题;这种困难已经植根于驱动这些模型的神经网络架构之中。研究人员表明,随着正确答案数量的增加,机器需要显著更多的内部存储空间、更大的词汇内部表示,以及更多的训练步骤才能把数学逻辑理顺。即使机器最终学会了,从众多可能性中挑选单个词的过程也会引入一种噪声,使其永远无法完美匹配语言的真实分布。

为了理解为什么会发生这种情况,该团队将问题分解到了最微小的部分。他们将机器的最终决策层视为一个简单的分类器,将上下文映射到一组可能的结果。在实验中,他们创建了合成任务,其中他们掌握着确切的基准真相:给定一个短语后,有特定数量的词汇是等概率出现的。他们发现,存储一个具有十个可能结果的模式,所需的容量大约是存储只有一个结果的模式的十倍。这就像是机器必须为它必须记住的每一个选项都建立一条独立的、独特的路径。此外,他们还发现,机器用来承载这些上下文的内部“词汇量”必须随之扩大。如果机器试图用过小的表示来表达一个具有多种有效结尾的情况,它就无法区分这些选项,无论经过多少训练都无济一劳。

这种困难不仅限于存储。研究人员还分析了机器如何随时间进行学习。他们发现,当一个情况有许多可能的结果时,学习过程起步要慢得多。因为当正确词汇很多时,机器看到的每个特定正确词汇的频率就会降低,因此它用来调整内部设置的信号也会变弱。这意味着需要更长的时间才能开始取得进展。更糟糕的是,在处理真实数据时的训练行为——即机器每次只能看到一个随机的正确词汇示例——引入了一种持续性的误差。当目标是一个确定的词时,机器最终可以完美学习;但当目标是许多词的分布时,每次只看到一个随机示例的随机性产生了一个误差底线,机器无法逾越。无论训练多久,它始终会存在偏差,无法完美复制真实的概率分布。

该团队不仅在受控的合成测试中,也在使用真实文本训练的大型语言模型中证实了这些发现。通过分析这些模型在实际数据上的表现,他们观察到了相同的特征:随着上下文歧义程度的增加,模型的预测准确度下降,并且倾向于向那些不应存在的词汇泄露概率质量。这表明歧als之咒是这些系统的一个普遍属性,影响着从小型实验模型到如今使用的万亿参数级庞大系统的方方面面。研究人员认为,这种局限性并不是可以通过简单的软件更新来修复的漏洞,而是这些网络表示不确定性的一种基本约束。

这一发现改变了我们看待人工智能能力的方式。它表明,虽然扩大模型的规模有所帮助,但这并不能解决歧义的核心问题。即使是规模最大的模型,也始终难以完美地模拟具有许多合理结果的情况,从而留下无法被学习到的残余真相。这对我们在涉及精准度的领域(如医疗诊断或法律推理)中如何信任这些系统具有实际意义,我们必须意识到,当答案并非非黑即白时,模型的置信度分布本质上可能是带有噪声的。这项工作提供了一个新的框架,让我们了解何时该信任机器的输出,以及何时其不确定性是深层结构性限制而非缺乏数据的体现。最终,这篇论文揭示了:正是使人类语言变得丰富且灵活的特质——即能够以多种方式表达许多不同的事物——也正是让机器学习起来最困难的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →