想象一下,将一个大语言模型(LLM)视为一个非常聪明、但有时过于自信的学生,正在参加数学或逻辑考试。这位学生不仅给出最终答案,还会一步步展示解题过程。问题在于,有时他们在解题中途犯了错,却依旧自信地继续下去,直到得出错误的答案。
你询问的这篇论文,就像一种新的“抽查”工具,旨在捕捉学生开始踉跄的那些特定时刻,而不是等到最后才看答案是否正确。
以下是用简单类比对论文核心思想的拆解:
1. 问题所在:“自信却错误”的学生
目前检查 AI 是否不确定的方法,通常只关注最终答案,或者尝试让 AI 回答同一问题 100 次,看它每次是否给出相同的答案。
- 缺陷:这就像只根据最终分数来评分。如果学生在第 3 步犯了错,但在第 10 步修正了(或者运气好蒙对了),你可能会认为他们全程都没问题。或者,如果他们偶然答对了,你可能会误以为他们真正理解了内容。
- 目标:作者希望找到一种方法,在学生解题过程中倾听他们的“内心独白”,以确切地看到他们是从哪里开始犹豫或困惑的。
2. 解决方案:“推搡”测试(嵌入扰动)
作者提出了一个巧妙的技巧。与其仅仅阅读学生的答案,不如在学生写下下一个词之前,轻轻“戳”一下他们的大脑。
- 类比:想象学生正在走钢丝。
- 传统方法:只看他们走得多快(概率)。如果他们走得快,看起来就很自信。
- 新方法:研究人员在学生迈出下一步之前,给他们一个极小、几乎看不见的推力(即“扰动”),以干扰他们的平衡。
- 反应:
- 如果学生站在坚实的地面上(正确且简单的步骤),微小的推力不会打扰他们。他们会继续直走。
- 如果学生已经在摇晃(不确定或错误的步骤),那个微小的推力会让他们踉跄或剧烈摇摆。他们甚至可能改变主意,不知道下一步该迈哪只脚。
论文将这种方法称为**“嵌入扰动”**。他们通过数学方式衡量,当学生受到那个微小推力时,其“想法”(即下一个词的概率)发生了多大变化。如果想法发生了巨大变化,就意味着学生实际上非常不确定,即使他们听起来很自信。
3. 为何优于旧方法
论文将他们的“推力”方法与其他不确定性检查方法进行了比较:
- 概率分数:这就像检查学生说话的声音有多大。有时他们大声说出错误的东西,仅仅是因为他们习惯了说这些词(就像句子中的常见词),而不是因为他们对逻辑有信心。
- 多次采样:这就像让学生参加 50 次考试。虽然准确,但耗时极长且成本高昂。
- “推力”方法:论文发现,他们的方法更快(不需要尝试 50 次),并且更能精准定位逻辑崩溃的确切时刻。它捕捉到了其他方法漏掉的数学和逻辑谜题中的错误。
4. 发现了什么(结果)
- 成功:当 AI 在数学问题(例如计算 $216,000$)中犯错时,“推力”方法标记出了错误发生的具体数字。这就像在学生写错数字的那一刻,一面红旗立刻升起。
- 局限性:该方法并非万能。
- 它在推理(数学、逻辑)方面效果极佳。
- 它在处理幻觉(编造事实)方面效果较差。论文解释说,编造事实就像学生自信地复述一个他们编造的故事。微小的推力不会让他们摇晃,因为他们的“故事”在内部是自洽的,即使它是假的。
- 有时,AI 天生就“话多”,或者有多种方式表达同一件事。推力可能会让它犹豫,但这并不意味着它错了——只是说明它有多种选择。
5. 核心结论
这篇论文提出了一种实时“压力测试”AI 推理过程的方法。通过观察 AI 的大脑在被轻轻“戳”一下时摇晃的程度,你可以找到其逻辑开始崩塌的确切位置。
- 效率:速度快,不需要巨大的计算能力。
- 精准度:它能发现第一个错误,而不仅仅是最终的错误答案。
- 注意事项:它是检查推理步骤的工具,而非用于捕捉编造的事实(幻觉)。
简而言之:如果你想知道 AI 是否在数学问题上撒谎,不要只等待最终答案。轻轻敲击它的思维过程,看看它是否会踉跄。如果它踉跄了,那就是麻烦开始的地方。
技术摘要:LLM 推理中中间步骤不确定性的嵌入扰动
问题陈述
大型语言模型(LLM)在推理任务中取得了显著突破,但仍容易产生不可靠或误导性的输出。虽然不确定性量化(UQ)技术可用于估计模型对其最终答案的置信度,但它们通常不足以应对推理链中的中间步骤不确定性。现有方法面临若干局限性:
- 基于采样的方法(如自一致性)需要生成多个响应以检查一致性。虽然这对最终答案有效,但其计算成本高昂,且难以 pinpoint 错误产生的具体中间步骤。
- 基于概率的指标(如 token 概率、熵、边际)往往无法区分那些语言上罕见但正确的低概率 token,与那些代表真正推理错误的 token。它们也难以捕捉审计推理错误所需的长期上下文依赖关系。
- 基于贝叶斯的方法(如权重扰动)计算负担沉重,尤其对于大型模型而言。
核心问题在于缺乏能够高效、细粒度地识别推理链中模型不确定性最高(从而指示潜在错误)的具体 token 或步骤的指标。
方法论
作者提出嵌入扰动作为一种量化中间不确定性的新方法。其核心假设是:错误的推理步骤包含那些对前序 token 嵌入的微小扰动高度敏感的 token。这种敏感性反映了模型内部在多个竞争延续之间的犹豫(即模型“不确定”是继续当前 token 还是选择另一个竞争 token)。
该方法基于 LLM 是自回归的这一前提;token xt 的生成仅依赖于前序 token x1:t−1。作者将 token 生成概率定义为前序 token 嵌入 H1:t−1 的函数。他们使用两个具体指标来衡量模型对这些嵌入扰动的敏感性:
随机扰动(Rand. Pert.):
- 向输入和响应中所有 token 的嵌入添加随机高斯噪声 Δ∼N(0,σ2I)。
- 该指标定义为在多个噪声样本上,目标 token xt 的对数概率的方差:
Pert.(xt)=VarΔ[logPr(xt∣H~1:t−1)]
- 这捕捉了 token 选择在轻微上下文变化下的不稳定性。
对抗扰动(Adv. Pert.):
- 不同于随机采样,嵌入是沿着使生成响应的总对数概率最大化的方向进行修改的(使用符号梯度)。
- 该指标是扰动前后的对数概率之差:
Pert.(xt)=logPr(xt∣H1:t−1)−logPr(xt∣H^1:t−1)
- 这识别出受对抗性偏移影响最大的 token,表明其位于所选 token 与“竞争 token"之间的决策边界附近。
理论洞察:
该论文提供了理论分析,表明这些扰动敏感性以逆近似的方式反映了当前嵌入到所选 token 与竞争 token 之间决策边界的几何距离。高敏感性分数意味着嵌入靠近一个边界,在该边界处会选择一个不同的 token(可能导致不同的推理路径),从而发出高不确定性的信号。至关重要的是,作者认为与原始基于概率的指标相比,该指标受自然语言 token 频率的偏差较小。
主要贡献
- 新颖的 UQ 指标: 引入了专门设计用于捕捉 LLM 推理中中间步骤不确定性的基于扰动的指标(随机扰动和对抗扰动),区别于最终答案的置信度。
- 理论依据: 形式化证明了扰动敏感性近似于梯度范数,而梯度范数又以逆近似的方式反映了竞争推理路径之间决策边界的距离。
- 效率: 所提出的方法被证明具有计算效率。对抗扰动仅需一次反向和一次前向传播,而随机扰动可以重用同一组扰动来处理整个序列,避免了多次采样试验的巨大开销。
- 实证验证: 广泛的实验表明,这些指标在识别推理链中第一个错误步骤方面优于现有的基线方法。
实验结果
作者在四种模型(Llama-3.1、OpenMath、Qwen、Mistral)上,针对数学推理(MATH 数据集)和逻辑推理(BIG-Bench Hard)任务评估了他们的方法。
- 性能: 随机扰动和对抗扰动指标均一致优于基线方法,包括:
- Token 级: 负对数似然(NLL)、熵、概率边际以及基于贝叶斯的 TokUR。
- 句子级: CCP、TokenSAR 和图不确定性(多次采样)。
- 在 MATH 数据集中,对抗扰动在 Llama 上的前 3 检测率达到0.65(TokUR 为 0.55),在 Qwen 上达到0.61(TokUR 为 0.56)。
- 效率: 在单块 NVIDIA GH200 GPU 上,对抗扰动每次生成仅增加0.28 秒,随机扰动(20 次迭代)增加0.90 秒。这显著快于多次采样方法。
- 幻觉检测: 当在 FactScore 数据集上测试事实性幻觉检测时,基于扰动的方法表现不如多次采样方法。作者将此归因于根本性的错误模式差异:幻觉通常源于在扰动下保持稳定的虚假相关性或弱 grounding,而推理错误则涉及路径选择中的真正不稳定性。
意义与主张
该论文声称,与现有方法相比,嵌入扰动提供了一种更有效且更高效的方式来审计 LLM 的推理过程。通过识别对嵌入扰动具有高敏感性的 token,从业者可以:
- 精确定位模型开始偏离正确推理路径的确切位置。
- 实现细粒度的干预,例如在特定不确定步骤触发基于反思的机制或自我修正。
- 通过提供源自生成过程本身的、可解释的不确定性信号,促进验证模型的开发。
作者谦逊地承认了局限性:该方法可能无法检测由虚假相关性驱动的幻觉,并且并不总能完美地将关于正确性的不确定性与源于在多个有效推理路径中选择的不确定性区分开来。然而,该研究确立了基于扰动的指标是检测程序性推理错误的优于基于概率或基于采样的基线方法的工具。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。