← 最新论文
🤖 machine learning

Reported Confidence in LLMs Tracks Commitment More Than Correctness

本文表明,大语言模型中的口头置信度报告主要反映的是驱动回答决策的内部“提交就绪”状态,而非回答的实际正确性,这使其在本质上区别于追踪答案证据的对数概率。

原作者: Dharshan Kumaran

发布于 2026-06-30
📖 1 分钟阅读☕ 轻松阅读

原作者: Dharshan Kumaran

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在向一个非常聪明但又带点神秘感的机器人助手请教一个谜题。你问它:“法国的首都是哪里?”它思考了一会儿,回答道:“巴黎。”接着,你问它:“你有多少把握?”

机器人回答:“我百分之百确定。”

在人工智能(AI)的世界里,我们通常假设当机器人说“百分之百确定”时,它的意思是:“我已经检查了我的内部数据库,从统计学上来说,我对这个答案是正确的很有把握。”

然而,来自 Google DeepMind 的一项新研究表明,我们可能误解了机器人的信心。研究人员发现,当 AI 说它很“自信”时,它并不一定是在说,“我的答案是正确的”。相反,它通常是在说,“我已经准备好坚持这个答案了,即便它可能是错的。”

以下是他们研究结果的拆解,使用了简单的类比。

两种类型的“信心”

该研究比较了机器人衡量自身确定性的两种不同方式:

  1. “数学信心”(对数概率/Log-Probability): 这就像一个计算器。它观察原始数字和各种选项的概率。如果数学计算显示“巴黎”是 99% 可能的答案,那么这个计算器就是有信心的。

    • 研究发现: 这种类型的信心是真理的良好判断标准。如果数学显示它很有信心,那么答案通常是正确的。如果数学显示它不确定,那么答案通常是错误的。
  2. “言语信心”(机器人的话语): 这是当你直接问机器人“你有多大把握?”时,它用文字或数字量表(如“非常确定”)给出的回答。

    • 研究发现: 这种类型的信心不是真理的良好判断标准,但却是承诺的极佳判断标准。当机器人说“我非常确定”时,并不意味着答案一定是正确的。它意味着机器人已经下定了决心,并愿意向用户承诺这个答案。

“承诺还是放弃”的游戏

为了弄清这一点,研究人员设置了一个两阶段的游戏,灵感来源于科学家研究动物决策的方法:

  • 第一阶段: 机器人给出一个问题的答案,并给出一个信心评分(例如,“我有 90% 的把握”)。
  • 第二阶段: 机器人被展示自己的答案,并被问到:“你想要承诺(把这个答案展示给人类)还是放弃(说‘我不知道’)?”

令人惊讶的结果:
机器人在第一阶段的言语信心,比起它是否能预测答案是否正确,更能预测它在第二阶段会如何行动。

  • 如果机器人在第一阶段说“我超级自信”,那么在第二阶段它几乎总是选择承诺,即便它的答案实际上是错误的。
  • 如果机器人说“我不确定”,它几乎总是选择放弃

类比:
想象一个在赌场里的赌徒。

  • 数学信心就像赌徒查看纸上的赔率。如果赔率很好,赌徒知道自己很可能会赢。
  • 言语信心就像赌徒大喊:“我要全押了!”研究发现,赌徒大喊“我要全押了!”往往只是一个信号,表明他们准备好下注了,而不是保证他们手里拿的是赢牌。他们可能在虚张声势,或者只是觉得很大胆。只有“数学信心”(赔率)才能真正告诉你他们是否会赢。

“承诺就绪”开关

研究人员进一步深入研究了机器人的“大脑”(其内部代码),以观察发生了什么。他们发现,就在机器人给出答案之后、但在被要求决定是否承诺之前的那个精确时刻。

在这一刻,机器人的内部状态是围绕着一个问题组织的:“我准备好坚持这个立场了吗?”

  • 机器人的大脑中有一个“承诺/放弃”开关,这个开关的声音非常响亮且清晰。
  • 机器人的大脑中有一个“正确/错误”开关,这个开关则要安静得多,也模糊得多。

当机器人生成言语信心报告时,它本质上是在读取那个响亮的“承诺”开关,而不是那个安静的“正确/错误”开关。这就像一个人有一种强烈的表达欲望;即使他们所说的话在事实上是错误的,他们也会觉得表达起来非常有信心。

为什么这很重要

长期以来,人们一直将 AI 的言语信心(“我有 95% 的把握”)视为准确性的直接衡量标准。我们假设如果 AI 说它很有把握,我们就可以信任这个答案。

这篇论文认为,这是一个错误。

  • 言语信心是一种行为信号。它告诉你:“我愿意向人类展示这个答案。”
  • 数学信心是一种真理信号。它告诉你:“这个答案很可能是正确的。”

如果你依赖机器人的话语来判断一个答案是否正确,你可能会被误导。机器人的内部“承诺开关”被拨动了,即使它的“真理开关”还在闪烁,它也可能非常渴望去承诺一个错误的答案。

总结

研究结论认为,我们不应再将 AI 的言语信心视为一个简单的“真理计”。相反,我们应该将其理解为一个“承诺计”。它告诉我们 AI 何时准备好采取立场,但它并不一定告诉我们这个立场是否站得住脚。要了解答案是否真的正确,我们需要观察底层的数学逻辑(对数概率),而不仅仅是听机器人那热情的言辞。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →