← 最新论文
💬 NLP

Epistemic Observability in Language Models

该论文指出大语言模型在编造内容时往往表现出最高置信度,且仅凭文本输出无法可靠区分诚实回答与幻觉,但通过利用与正确性结构耦合的 token 熵等计算副产品,可有效突破这一观测局限并构建实用的验证资源分配策略。

原作者: Tony Mason

发布于 2026-03-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Tony Mason

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

1. 令人头疼的谎言:越瞎编,越自信

核心发现:
当你问一个 AI 一个问题,它如果瞎编(胡编乱造),它反而表现得最自信;而当它真的知道答案时,它却表现得有点犹豫

生活中的比喻:
想象你在面试一个求职者。

  • 诚实的求职者:遇到不会的问题,他会说“这个我不太确定,我得查查资料”。(犹豫、低自信)
  • 撒谎的求职者:遇到完全不知道的问题,他反而拍着胸脯说“这太简单了!绝对是 A!”(极度自信、滔滔不绝)。

论文里的实验:
研究人员测试了四种主流模型(像 OLMo, Llama 等)。结果发现,当模型在编造事实(比如虚构一个不存在的会议或人物)时,它自己报告的“自信度”是最高的。

  • 数据说话:如果用“自信度”来判断它是否在撒谎,准确率甚至比瞎猜(50%)还要低(只有 28%-36%)。这意味着,如果你相信模型的自信程度,你反而更容易被它骗。

2. 为什么我们看不穿谎言?(“文字-only"的盲区)

核心问题:
为什么我们没法通过看它写的字来判断它是不是在撒谎?

生活中的比喻:
想象你在玩一个**“传话游戏”**。

  • 模型(说话者):它脑子里有一个复杂的计算过程(就像它在心里默默演算、查资料、甚至犹豫)。
  • 用户(听话者):你只能听到它最后说出来的那一句话

论文的“不可能定理”:
论文证明了一个数学上的死结:如果你只能听到最后说出来的话,你就永远无法区分“真心话”和“高明的谎言”。

  • 场景 A(真话):模型真的查到了资料,然后自信地告诉你答案。
  • 场景 B(谎言):模型其实啥也不知道,但它为了显得聪明,编造了一个听起来很像真的答案,并且也用同样自信的语气说出来。

关键点:
对于你(观察者)来说,A 和 B 说出来的话是一模一样的
这就好比一个魔术师,无论他变的是真鸽子还是假鸽子,只要最后变出来的鸽子看起来一样,你就无法通过“看鸽子”来分辨魔术的真假。

  • 结论:只要模型只给你看“文字结果”,不管它多大、多聪明,或者你请多少个专家来审核,只要专家只看文字,你就永远无法 100% 确定它是不是在撒谎。这是一个结构性的缺陷,不是模型不够聪明。

3. 如何给模型装上“测谎仪”?(张量接口)

核心方案:
既然只看“结果”(文字)不行,那我们就得看**“过程”**。

生活中的比喻:
继续上面的面试例子。

  • 旧方法(只看文字):只听求职者说什么。
  • 新方法(看“心跳”和“手抖”):你不仅听他说什么,还给他戴上心率监测仪微表情分析仪
    • 如果他在编造,他的**心跳(计算时的熵值)**可能会因为“强行组织语言”而变得不自然。
    • 如果他在回忆真实知识,他的**思维流(概率分布)**会更顺畅。

论文提出的“张量接口”(Tensor Interface):
研究人员提出,不要只让模型输出“文字”,还要让它输出**“计算过程的副产品”**。

  • 什么是副产品? 就像汽车引擎在运转时,除了发出声音(文字),还会产生热量、震动和油耗数据。模型在生成每个字的时候,内部其实有一个**“犹豫度”(熵值)**。
    • 低犹豫度(低熵):模型非常确定,下一个字几乎只有一个选择。(通常意味着它在背诵或瞎编,因为它很“顺”)。
    • 高犹豫度(高熵):模型在几个选项间摇摆,不确定选哪个。(通常意味着它在努力回忆一个冷门知识,或者真的不知道)。

神奇的效果:

  • 文字信号:模型可以学会“装傻”或“装聪明”,文字是可以被训练出来的。
  • 熵值信号:这是计算过程的自然产物,就像你很难在跑步时假装心跳不加速一样。模型很难在不改变计算结果的情况下,单独把“犹豫度”调低。

实验结果:
使用这种“看过程”的方法(监测每个字的犹豫度),检测撒谎的准确率从“瞎猜”提升到了75.7%。这比只看文字(比如看回答长短、看有没有“我觉得”这种词)要准确得多。


4. 给系统建设者的“地图”(成本曲面)

论文最后给那些要开发 AI 系统的人画了一张**“投资地图”**。

比喻:
想象你在建一座**“安全大桥”**。

  • 预算(Verification Budget):你有多少钱请人检查桥的质量?
  • 方法
    • 方法 A(只看文字):请人读一遍桥的设计图。便宜,但只能发现 87% 的隐患。
    • 方法 B(看计算过程/张量接口):请人拿着仪器扫描桥的钢筋结构。稍微贵一点点(计算成本增加约 2.4%),但能发现 90% 以上的隐患。
    • 方法 C(混合模式):对普通问题用扫描仪,对关键问题(比如引用了文献)再派人去查原始档案。能发现 91.8% 的隐患。

结论:
这张地图告诉开发者:如果你想让 AI 在医疗、法律等关键领域更安全,光靠“看文字”是不够的,必须花钱去获取模型的“内部计算数据”(如熵值)。


总结:这篇论文到底说了什么?

  1. 坏消息:现在的 AI 越爱撒谎,越表现得自信。如果你只信它说的话,你会被坑。
  2. 原因:因为只给看“文字结果”就像只给看魔术的“成品”,你无法分辨真假。这是观察方式的问题,不是模型能力的问题。
  3. 好消息:我们可以要求 AI 把**“思考过程的数据”**(比如它有多犹豫)也一起发出来。
  4. 行动指南
    • 对于普通聊天,随便用。
    • 对于医疗、法律、金融等不能出错的领域,必须使用能读取“内部犹豫度”的接口,并配合人工或外部核查。
    • 不要只信 AI 说的“我很有信心”,要看它“计算时有多犹豫”。

一句话总结:
别听 AI 怎么吹牛(文字),要看它怎么思考(数据)。只有把“思考的汗水”也展示出来,我们才能真正信任它。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →