← 最新论文
🤖 AI

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

本文在受控的德州扑克模拟器中研究了大语言模型(LLM)智能体中的忠实度差距,揭示了尽管智能体经常无法使其陈述的推理与结论保持一致,但即便在这些结论与其自身推理相矛盾时,它们也会矛盾地表现出与其结论一致的行为。

原作者: Yufeng Wang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yufeng Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一群 AI 智能体进行一场高风险的扑克游戏。你要求它们在行动之前解释自己的思考过程。它们告诉你:“我的牌很好,胜率对我有利,所以我应该加注。”然后,它们却选择了弃牌。

这篇论文提出了一个简单但棘手的问题:这些 AI 智能体真的在做它们声称要做的事吗?还是说它们只是在事后编造借口?

研究人员建立了一个受控的扑克模拟器来寻找答案。他们没有靠猜测,而是将 AI 的决策过程分解为两个截然不同的步骤,就像两级火箭发射一样。

AI 决策的两个步骤

  1. 第一步:“大脑”(推理 \rightarrow 结论)
    这是 AI 查看卡牌、计算赔率并决定它“认为”应该做什么的地方。
    • 类比: 想象一位气象预报员观察数据。他们看到风暴即将来临,并得出结论:“将会下雨。”
  2. 第二步:“手”(结论 \rightarrow 行动)
    这是 AI 实际按下“弃牌”、“跟注”或“加注”按钮的地方。
    • 类比: 预报员随后告诉新闻主播:“将会下雨”,随后主播向世界宣布这一消息。

大惊喜:“手”是诚实的,但“大脑”在撒谎

研究人员发现,这两个步骤的表现完全相反:

  • 第二步(“手”)极其可靠。
    一旦 AI 决定了要做什么,它几乎总是会严格执行。如果它说“我会加注”,它就会加注。这里的失误率极低(不到 2%)。

    • 隐喻: 这个 AI 就像一个非常听话的机器人。如果你告诉它拿起杯子,它就会拿起杯子。它不会掉落杯子,也不会去拿起一把勺子。
  • 第一步(“大脑”)才是真正问题所在。
    AI 经常能正确计算数字并正确陈述规则,但随后却得出了一个与这些数字完全不符的结论。

    • 隐喻: 想象气象预报员观察了数据,看到了巨大的风暴,然后说:“数据表明将会下雨。”但出于某种毫无逻辑的原因,他们又得出结论:“因此,天气将会晴朗,”随后新闻主播也播报了“晴天”。
    • 研究结果: 在大约 65% 的错误中,AI 的数学计算是正确的,但它却在逻辑上否定了自己。它会说:“赔率很高,但也许我不应该过于激进,”然后选择一个更保守、更弱的动作。这就像一个人明知数学逻辑是“前进”,但直觉却在说“等等”,于是它忽略了数学。

“测量陷阱”

论文还指出了一些在以往研究中出现的有趣现象。一些研究人员试图仅通过阅读 AI 冗长且杂乱的解释(自由文本)来推测其决策。

  • 问题所在: AI 的解释非常混乱。它可能会说:“我可以跟注,但加注更好,不过弃牌也很稳妥。”试图从这一堆乱麻中猜测最终决策的计算机程序往往会选错。
  • 结果: 这使得 AI 看起来似乎有 22–26% 的时间在撒谎或改变主意。
  • 解决方法: 当研究人员强制要求 AI 在结尾写下一个清晰、具体的标签,如 DECISION: RAISE 时,这种“撒谎”率几乎降到了零。AI 并不是在撒谎,而是测量工具无法读懂它那凌乱的“笔迹”。

为什么这很重要?

研究人员尝试通过明确告知 AI 规则(例如:“如果赔率高,你必须加注”)来修复“大脑”问题。令人惊讶的是,这并没有起作用。 AI 仍然会忽略它被告知要遵守的规则。

这表明问题不在于 AI 不知道规则或找不到规则,而在于它无法一致地应用这些规则。它知道规则,但它用自己的“定性”感受(比如过于谨慎)覆盖了规则。

总结

如果你正在构建用于社会模拟(例如虚拟人物进行谈判或交易)的 AI 智能体,不要仅仅检查它们是否做了它们说要做的事。要检查它们所说的话是否真的遵循了自身的逻辑。

  • 好消息: 如果一个 AI 说它要做某事,它很可能会去做。
  • 坏消息: 它给出的理由可能是完全编造的或逻辑破碎的,即使其中的数学计算看起来是正确的。

论文最后总结道,为了真正理解 AI 的行为,我们不能仅仅观察最终的动作,而应该开始审计决策背后的数学逻辑,因为真正的“忠实度差距(faithfulness gap)”就隐藏在那里。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →