← 最新论文
🤖 machine learning

Embedding Perturbation may Better Reflect Intermediate-Step Uncertainty in LLM Reasoning

本文提出了一种基于扰动的不确定性量化指标,通过测量令牌对嵌入扰动的敏感性来识别大语言模型中不可靠的中间推理步骤,其表现出的性能与效率均优于现有的概率、采样及贝叶斯方法。

原作者: Qihao Wen, Jiahao Wang, Yang Nan, Pengfei He, Ravi Tandon, Han Xu

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Qihao Wen, Jiahao Wang, Yang Nan, Pengfei He, Ravi Tandon, Han Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,将一个大语言模型(LLM)视为一个非常聪明、但有时过于自信的学生,正在参加数学或逻辑考试。这位学生不仅给出最终答案,还会一步步展示解题过程。问题在于,有时他们在解题中途犯了错,却依旧自信地继续下去,直到得出错误的答案。

你询问的这篇论文,就像一种新的“抽查”工具,旨在捕捉学生开始踉跄的那些特定时刻,而不是等到最后才看答案是否正确。

以下是用简单类比对论文核心思想的拆解:

1. 问题所在:“自信却错误”的学生

目前检查 AI 是否不确定的方法,通常只关注最终答案,或者尝试让 AI 回答同一问题 100 次,看它每次是否给出相同的答案。

  • 缺陷:这就像只根据最终分数来评分。如果学生在第 3 步犯了错,但在第 10 步修正了(或者运气好蒙对了),你可能会认为他们全程都没问题。或者,如果他们偶然答对了,你可能会误以为他们真正理解了内容。
  • 目标:作者希望找到一种方法,在学生解题过程中倾听他们的“内心独白”,以确切地看到他们是从哪里开始犹豫或困惑的。

2. 解决方案:“推搡”测试(嵌入扰动)

作者提出了一个巧妙的技巧。与其仅仅阅读学生的答案,不如在学生写下下一个词之前,轻轻“戳”一下他们的大脑。

  • 类比:想象学生正在走钢丝。
    • 传统方法:只看他们走得多快(概率)。如果他们走得快,看起来就很自信。
    • 新方法:研究人员在学生迈出下一步之前,给他们一个极小、几乎看不见的推力(即“扰动”),以干扰他们的平衡。
    • 反应
      • 如果学生站在坚实的地面上(正确且简单的步骤),微小的推力不会打扰他们。他们会继续直走。
      • 如果学生已经在摇晃(不确定或错误的步骤),那个微小的推力会让他们踉跄或剧烈摇摆。他们甚至可能改变主意,不知道下一步该迈哪只脚。

论文将这种方法称为**“嵌入扰动”**。他们通过数学方式衡量,当学生受到那个微小推力时,其“想法”(即下一个词的概率)发生了多大变化。如果想法发生了巨大变化,就意味着学生实际上非常不确定,即使他们听起来很自信。

3. 为何优于旧方法

论文将他们的“推力”方法与其他不确定性检查方法进行了比较:

  • 概率分数:这就像检查学生说话的声音有多大。有时他们大声说出错误的东西,仅仅是因为他们习惯了说这些词(就像句子中的常见词),而不是因为他们对逻辑有信心。
  • 多次采样:这就像让学生参加 50 次考试。虽然准确,但耗时极长且成本高昂。
  • “推力”方法:论文发现,他们的方法更快(不需要尝试 50 次),并且更能精准定位逻辑崩溃的确切时刻。它捕捉到了其他方法漏掉的数学和逻辑谜题中的错误。

4. 发现了什么(结果)

  • 成功:当 AI 在数学问题(例如计算 $216,000$)中犯错时,“推力”方法标记出了错误发生的具体数字。这就像在学生写错数字的那一刻,一面红旗立刻升起。
  • 局限性:该方法并非万能。
    • 它在推理(数学、逻辑)方面效果极佳。
    • 它在处理幻觉(编造事实)方面效果较差。论文解释说,编造事实就像学生自信地复述一个他们编造的故事。微小的推力不会让他们摇晃,因为他们的“故事”在内部是自洽的,即使它是假的。
    • 有时,AI 天生就“话多”,或者有多种方式表达同一件事。推力可能会让它犹豫,但这并不意味着它错了——只是说明它有多种选择。

5. 核心结论

这篇论文提出了一种实时“压力测试”AI 推理过程的方法。通过观察 AI 的大脑在被轻轻“戳”一下时摇晃的程度,你可以找到其逻辑开始崩塌的确切位置。

  • 效率:速度快,不需要巨大的计算能力。
  • 精准度:它能发现第一个错误,而不仅仅是最终的错误答案。
  • 注意事项:它是检查推理步骤的工具,而非用于捕捉编造的事实(幻觉)。

简而言之:如果你想知道 AI 是否在数学问题上撒谎,不要只等待最终答案。轻轻敲击它的思维过程,看看它是否会踉跄。如果它踉跄了,那就是麻烦开始的地方。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →