← 最新论文
💬 NLP

Confidence and Calibration of Activation Oracles for Reliable Interpretation of Language Model Internals

本文通过评估六种置信度估计方法,研究了激活预言机的不确定性量化问题,发现自举模式频率提供了最佳的校准效果,而日志概率则作为一种具有成本效益的分诊信号。

原作者: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

发布于 2026-05-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Federico Torrielli, Peter Schneider-Kamp, Lukas Galke Poech

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一个超级聪明的机器人(我们称之为“目标”),它藏着一个秘密。也许它被编程为将某个特定单词(比如“树”)隐藏在其大脑中。你无法直接看到这个单词;你只能看到它在思考时的电信号(即其“激活”状态)。

现在,想象你有第二个机器人,称为“神谕”,它的唯一任务就是观察这些电信号,并将它们翻译成通俗易懂的英语。它会说:“秘密单词是‘树’!”

问题所在:
神谕非常擅长猜测单词,但它有一个重大的人格缺陷:它永远不知道自己何时错了。无论它猜对了还是完全在胡编乱造,它都以完全相同的自信程度说出“秘密单词是‘树’"。如果你正利用这个神谕来做出重要决策(例如“这个 AI 是否安全到可以发布?”),你需要知道:神谕到底有多确定?

实验:
本文的作者试图教导神谕如何表达“我相当确定”或“我只是在猜测”。他们测试了六种不同的方法来衡量神谕的置信度,这有点像尝试六种不同的方法来检查天气预报是否可靠。

以下是他们如何通过简单的类比来测试这些方法:

六种置信度方法

  1. “直觉”(对数概率):

    • 工作原理: 神谕审视它刚刚说出的单词,并问自己:“我选中这个特定单词的可能性有多大?”
    • 结果: 这是一个不错的猜测,但神谕往往过于自信。它认为自己有 90% 的把握,而实际上只有 60% 的正确率。
  2. “群体投票”(自举模式频率):

    • 工作原理: 与其只问神谕一次,不如连续问它20 次,每次让它带有一点随机性(就像掷骰子一样)。如果它说了 18 次“树”和 2 次“车”,你就知道它非常自信。如果它随机地说出“树”、“车”、“云”、“石头”和“树”,你就知道它很困惑。
    • 结果: 这是获胜者。 它在判断神谕是对是错方面最为准确。这就像询问一群人;如果他们意见一致,你就可以信任这个答案。
  3. “诚实访谈”(直接自我报告):

    • 工作原理: 你直接问神谕:“在 0 到 100 的尺度上,你有多自信?”
    • 结果: 这是最差的方法。 神谕极不擅长内省。在较大的模型上,当它出错时,其自信程度反而比正确时更高。这就像一个学生 100% 确信自己做对了数学题,尽管它完全做错了。
  4. "MCMC 链”(功率采样):

    • 工作原理: 这是一种复杂的数学技巧,神谕试图在不同的可能答案之间“跳跃”,看看它是否会卡在一个答案上。
    • 结果: 效果不佳。因为神谕的大脑过于专注于一个答案,它从未真正“跳跃”到其他可能性,因此这种方法无法判断它是自信还是固执。
  5. “拔河”(导向敏感性):

    • 工作原理: 你轻轻地将神谕的大脑推向不同的方向,看看它是否会改变答案。如果它保持不变,说明它很自信。
    • 结果: 它太粗糙了。这就像试图用一支只有“热”和“冷”两个设置的温度计来测量温度。
  6. “多链投票”:

    • 工作原理: 类似于“群体投票”,但使用更复杂、更昂贵的数学方法来生成这 20 个答案。
    • 结果: 效果尚可,但速度慢得多,且没有比简单的“群体投票”提供更好的结果。

主要结论

  • 最佳工具: “群体投票”(询问模型 20 次并观察它与自己达成一致的程度)是判断神谕是否在说真话的最佳方式。
  • 陷阱: 永远不要仅仅因为神谕“我很自信”就信任它。研究发现,当神谕被要求评估其自身置信度时,它撒谎(或者更准确地说,虚构自信)的频率与它编造答案的频率一样高。
  • 成本: “群体投票”需要更多的计算能力,因为你必须运行模型 20 次。“直觉”方法更快但准确性较低。作者建议仅将快速方法用作初步筛选,而在最终决策时依赖“群体投票”。

为什么这很重要

如果你正在构建一个用于检查 AI 模型的安全系统,你不能仅仅听取神谕说了什么。你需要知道应该多大程度上信任它所说的话。本文为我们提供了一份构建这种信任的手册,表明让神谕“三思而后行”(通过群体投票)是识破其胡编乱造的最可靠方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →