← 最新论文
🤖 AI

When Agents Disagree With Themselves: Behavioral Consistency as an Uncertainty Signal for LLM Agents

本文证明了大型语言模型(LLM)智能体动作序列中的行为方差可以作为一种无需训练的不确定性信号,从而实现选择性分类和无分布校准,在不需要留出校准数据的情况下,显著提高准确率和模型的排序可靠性。

原作者: Aman Mehta

发布于 2026-07-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Aman Mehta

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

数字双重检查:为什么询问 AI 两次可能比询问一次更好

想象一下,你正在尝试解开一个棘手的谜题,比如一个复杂的谜语或一道数学题。如果你问一位朋友答案,他们可能会答对,也可能会瞎猜然后答错。但如果你能连续问这位朋友同一个问题十次呢?如果他们每一次都给出相同的答案,你可能会觉得他们很有把握是对的。然而,如果他们给了你十个不同的答案,你就知道出问题了——他们很困惑、在瞎猜,或者这个问题对他们来说太难了。

这就是**大语言模型(LLMs)**的核心理念,这些模型是驱动当今 AI 智能体(AI agents)的超智能计算机程序。这些智能体就像数字侦探,可以利用工具(如搜索网络或编写代码)来解决多步骤的问题。但就像人类一样,它们并不完美。有时它们会产生幻觉(编造事实)或者陷入循环。科学家们长期以来一直在思考:我们如何能在不直接问它“你确定吗?”的情况下,判断一个 AI 是否对自己感到不确定?(因为 AI 可能会在表达“我很确定”这件事上撒谎)。这篇论文探讨了一个聪明的技巧:与其信任单个答案,不如观察 AI 在多次尝试同一任务时的表现。如果 AI 的行为变幻莫测,那这就是一个巨大的红旗信号,预示着答案可能是错误的。

当 AI 智能体无法自行决定时

这项研究背后的研究人员决定测试一个简单而强大的想法:行为一致性(Behavioral Consistency)。他们把 AI 智能体当作一名正在考试的学生。他们不仅对最终答案进行评分,还观察学生是如何解决问题的。他们在完全相同的问题上运行了同一个 AI 智能体 10 次,并使用了不同的“随机种子”(这就像是洗牌,通过改变 AI 决策时抽取的“牌组”来制造变化)。

以下是他们的发现,结果有点令人惊讶:

1. AI 是一个反复无常的思想者
即使你给 AI 完全相同的指令和相同的起点,它并不总是以同样的方式思考。在他们的测试中,运行同一个智能体 10 次会产生 2.3 到 4.2 条不同的解决路径。有时 AI 会走捷径;有时它会在漫长且混乱的小巷里徘徊。这种“徘徊”不仅仅是一个小故障,它是一种信号。AI 对解决问题的方法改变得越多,它得到正确答案的可能性就越低。

2. 一致性是准确性的水晶球
团队发现 AI 的一致性与其正确性之间存在强关联。

  • “稳定型”组: 当 AI 坚持使用同一条路径(2 条或更少的唯一路径)时,它的正确率在 82% 到 87% 之间。
  • “徘徊型”组: 当 AI 走向许多不同的方向(4 条或更多的唯一路径)时,其准确率下降到了 41% 到 65% 之间。

这个差距非常巨大。这意味着,如果你看到一个 AI 在你每次询问同一个问题时都采取截然不同的路线,那么你可能应该降低对其答案的信任。

3. “第二步”的意外发现
研究人员仔细观察了 AI 何时 开始感到困惑。他们发现,对于某些模型(如 Llama),问题几乎是立即开始的。大约有 50.5% 的情况下,AI 在第一步或第二步就会采取与其他尝试不同的行动。这就像 AI 站在一个岔路口,还没开始就无法决定该往哪边走。而对于其他模型(如 Claude),它们在偏离路径之前能保持较长时间的相同路径。

4. “过滤器” vs. “投票者”
关于如何使用这些信息,研究结果中最有趣的一个发现是:

  • “投票者”方法: 你可能会想,“如果我问 AI 3 次并采取多数票,我是否能得到更好的答案?”论文指出,这种方法确实有效,但效果很有限(准确率仅提升了 0–2%)。为什么呢?因为 AI 有时会“自信地犯错”。如果它在早期阶段犯了错,它可能会在每一次尝试中都犯下同样的错误,因此“投票”只是确认了那个错误。
  • “过滤器”方法: 研究人员尝试了一种不同的策略:只有当 AI 与自己达成一致时才回答。 他们设定:“如果 AI 运行任务 3 次,且 3 次运行都给出完全相同的答案,那么我们就接受它。如果它们意见不一,我们就说‘我不知道’并跳过这个问题。”
    • 这种“过滤器”的效果惊人。通过跳过不确定的问题,AI 在所回答问题上的准确率跃升至 87–88%。这比仅仅进行单次猜测提高了 6–14 个百分点

5. 优于“询问”AI
团队还将这种“行为一致性”技巧与询问 AI“你的信心程度如何?”(这被称为“言语化信心”)进行了比较。结果很明确:AI 的行为是比它的言语更优秀的测谎仪。即使 AI 在原地打转,它也经常声称自己很有信心。行为信号(观察它是否改变主意)是识别错误时更可靠的方式。

6. 它在任何地方都适用
为了确保这不仅仅是针对某一类问题的巧合,他们将 AI 置于完全不同类型的任务中进行测试:修复计算机代码中的漏洞(使用名为 SWE-bench 的基准测试)。尽管编程与回答常识问题完全不同,但同样的规则依然适用。在行为上最一致的 AI,也是最准确的。这种“一致性等级制度”(哪些模型稳定,哪些模型摇摆不定)在两个测试中保持完全一致。

为什么这很重要

这篇论文表明,我们不需要改变 AI 的大脑或教它新知识来提高其可靠性。我们只需要观察它。通过运行几次任务并检查 AI 的“故事”是否保持一致,我们可以扮演一名聪明的编辑。我们可以选择信任那些一致的答案,并忽略那些 AI 显得困惑的答案。

这是一种“无需训练(training-free)”的方法,意味着它可以开箱即用地应用于任何 AI 模型。它将 AI 自身的确定性转化为了一个有用的信号。与其盲目信任单个答案,我们可以利用这种“一致性检查”来判断何时该说:“我对这个不太确定”,这是让 AI 智能体在现实世界中变得更安全、更可靠的重要一步。

简而言之:如果一个 AI 无法为自己制定一个计划,那么现在可能不是信任其答案的最佳时机。但如果它每次都能坚持同一个计划,那么你可以相信它正走在正确的轨道上。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →