← 最新论文
💬 NLP

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

本文介绍了逐步置信度归因(SCA),这是一个通过应用信息瓶颈原理、基于共识结构为各步骤分配置信度分数,从而诊断黑盒大语言模型多步推理故障的框架,进而实现比传统答案级反馈更有效的自我修正。

原作者: Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你请一位非常聪明但略显散漫的朋友解决一道复杂的数学题或回答一个棘手的问题。他们不会只给你一个最终答案,而是像侦探破案一样,一步步写下整个思考过程。

问题所在:
有时,你的朋友会碰巧得出正确答案,或者因为逻辑中间出现了一个微小失误而得出错误答案。问题在于,当他们把最终结果交给你时,你很难轻易判断哪里出了问题。是第一步就错了?还是最后一步?或者他们只是运气好?

当前的方法就像问你的朋友:“你答对了吗?”他们只能就最终答案回答“是”或“否”。他们无法指出笔记本中哪一句具体的话导致了逻辑崩溃。

解决方案:逐步置信度归因(SCA)
本文作者开发了一种名为**逐步置信度归因(SCA)**的新工具。你可以把它想象成一个“逻辑探测器”,它会阅读你朋友一步步写下的笔记,并在每一句话旁边标注一个置信度分数。

  • 高置信度(绿色对勾): “这一步看起来很扎实。它符合其他聪明人解决此类问题通常采用的方法。”
  • 低置信度(红色警示): “等一下。这一步看起来很奇怪。它不符合正确解答的模式。错误很可能就发生在这里。”

它是如何工作的?(“共识”类比)
其中的秘诀在于共识。想象你请 20 位不同的聪明朋友解决同一个问题。

  • 尽管他们可能会以不同的顺序写下步骤或使用不同的措辞,但正确的解答都会共享几个关键的“路标”或“锚点”。例如,在数学题中,在计算总价之前,每个人都必须先计算铅笔的成本。
  • 本文的系统会审视所有 20 份解答。它会找出“共同点”——即所有答对者都认同的那些步骤。
  • 如果你朋友的解答遵循了这些共同路标,系统就会给这些步骤打上高置信度分数。
  • 如果你朋友走了奇怪的弯路或跳过了必要的路标,系统就会将其标记为低置信度。

他们构建的两个工具
本文介绍了两种实现这种“探测”的方法:

  1. NIBS(“词语匹配器”): 这是一个简单、快速的工具。它只查看每一步的词语和含义。如果某一步听起来像“正确”组中的步骤,它就会获得高分。这就像检查食谱中的一句话是否与成千上万份成功食谱中的步骤相匹配。
  2. GIBS(“地图阅读器”): 这是一个更高级、更复杂的工具。它不仅查看词语,还查看逻辑的结构。它将推理过程转化为一张地图(图),其中步骤由箭头连接,显示一步如何引导至下一步。然后,它会找出所有正确解答共有的“通用地图”。如果你朋友的地图上有一座在通用地图中不存在的桥梁,GIBS 就会将其标记出来。这对于步骤顺序至关重要的复杂问题更为有效。

这为何重要?(“自我修正”的魔力)
本文表明,这不仅仅是为了发现错误,更是为了修正它们。

  • 旧方法: 你告诉你的朋友:“你的最终答案是错的。再试一次。”他们往往只是换个方式猜测,或者再次犯同样的错误,因为他们不知道为什么失败了。
  • 新方法: 你告诉你的朋友:“你的最终答案是错的。另外,看看第 3 步和第 5 步;我们的系统认为这些步骤不太可靠。”
  • 结果: 当本文进行测试时,当 AI 模型被指出具体的薄弱步骤,而不仅仅是被告知最终答案错误时,它们修正自身错误的能力显著提高(成功率最高提升了 13.5%)。

简而言之
本文提供了一种方法,让我们无需打开盒子就能窥探 AI 思维这个“黑箱”的内部。通过将 AI 的推理步骤与正确解答的“共识”进行比较,系统可以精确定位逻辑崩溃的确切位置。这将模糊的“你错了”转变为有帮助的“你在这里偏离了轨道”,从而使 AI 能够从具体错误中学习并进行自我修正。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →