← 最新论文
🤖 AI

TrAC: Trace-Conditioned Answer Consistency for Efficient Uncertainty Quantification in LLMs

本文介绍了 TrAC,一种高效的不确定性量化框架,它将被动轨迹不确定性剖面与主动前缀条件启发相结合,通过对单个已完成推理轨迹的答案进行重新评估,在实现优于现有方法且最小化计算成本的同时,在检测错误响应方面取得了卓越性能。

原作者: Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Dahai Yu, Lin Jiang, Rongchao Xu, Guang Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在和一个非常聪明、非常健谈且热爱解谜的机器人聊天。你向它提出了一个棘手的数学问题,而它并不仅仅是脱口而出答案,而是写下了一段长长的、循序渐进的故事,解释它是如何得出结论的。这就是现代“大语言模型”(LLMs)的工作方式:它们生成一段“推理轨迹”,即通往结论的思想链条。问题在于,有时这段故事是用完美、自信的英语写成的,但最后却给出了错误的答案。这就像一位魔术师表演了一场完美的戏法,结果却变出了错误的兔子。

为了保持安全,我们需要一种方法来识别机器人何时虽然表现得很有信心但实际上是错误的。科学家们尝试过一些技巧。有些人会倾听机器人的“语气”(它在说出每个词时的确定程度)。另一些人则会让机器人把同一个谜题解八次,看看它是否每次都给出相同的答案(就像让陪审团投票一样)。但这些方法都有缺陷:倾听语气可能会被圆滑的辞令所迷惑,而要求它给出八个答案则既耗时又耗费大量的计算资源。大问题在于:我们能否在不让机器人重新开始或等待一整组新陪审团的情况下,检查机器人的答案是否正确?

这就是一种名为 TrAC(基于轨迹的答案一致性)的新方法。把 TrAC 想象成一种聪明的“重读”技巧。它不是让机器人从头开始重新解决问题,而是等待机器人讲完它的长篇故事。然后,它轻轻拍了拍机器人的肩膀说:“好了,你已经讲完了你的故事。现在,仅仅看着你刚刚写下的这个故事,最终答案是什么?”

研究人员发现,这种简单的“重新引导”是一个强大的侦探。如果机器人的故事逻辑严密且正确,那么当被要求重读时,它几乎总是会给出相同的答案。但如果故事本身不稳固或逻辑有误,机器人往往会在被迫重读自己的作品时改变主意或表现出不确定。TrAC 将这种“重读”检查与对机器人原始写作风格的被动扫描(寻找摇摆不定、不确定的词汇)相结合,从而创造出一个“正确性评分”。

结果令人印象深刻。在针对五种不同数学挑战的测试中,TrAC 在识别错误方面比要求机器人解八次题更有效,而且它仅比解题一次多耗费了大约 2% 的时间。甚至当机器人被要求解题八次且八个答案全部一致时(在这种情况下,其他方法会感到困惑),TrAC 仍能通过重读故事来发现错误。事实证明,检查机器人与其自身完成的完整故事是否保持一致,是一种快速、廉价且极其准确的方法,可以让我们知道它是否在说实话。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →