← 最新论文
💬 NLP

Diagnosing Correctness Probes under Self-Judgement Confounding

本文表明,语言模型中的隐藏状态读出往往捕捉的是模型的自我判断而非客观正确性,这一点从与自我判断相关的方向比与实际正确性相关的方向具有更优越的跨领域迁移能力中得到了证实。

原作者: Yi-Long Lu

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yi-Long Lu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图弄清楚一个机器人是否在说实话。你问它一个问题,它给出了答案,然后你必须做出决定:这个答案实际上是正确的,还是机器人只是自信地认为它是正确的?这就是一个名为“机械解释性”(mechanistic interpretability)的新兴科学领域的核心,研究人员试图窥探大型语言模型(LLMs)的“大脑”内部,看看它们究竟在想什么。这些模型就像巨大的数字神谕,可以写诗、解数学题以及聊历史,但它们有时会编造事实(这个问题被称为“幻觉”)。科学家们发现,如果你在模型完成回答的那一瞬间观察其内部的电信号(称为“隐藏状态”),你通常可以预测该答案是正确还是错误。这就像是在机器人的大脑中内置了一个测谎仪。但棘手之处在于,通常当机器人给出错误答案时,它也认为自己错了;而当它给出正确答案时,它通常也认为自己是对的。因为机器人的内部“真相信号”和它的“自我信心信号”通常是一致的,所以很难判断机器人到底是在检测真理,还是仅仅在检测它自己的观点。

这篇题为《诊断自我判断混淆下的正确性探测器》(Diagnosing Correctness Probes under Self-Judgement Confounding)的论文正是针对这一困惑展开研究的。由陆毅龙(Yi-Long Lu)领导的研究团队决定构建一个特殊的测试,让机器人的“真相”与“自我信心”发生冲突。他们创造了一些场景:机器人给出了一个数学上正确的答案,却接着说“不,那是错的”;以及机器人给出了一个错误的答案,却说“是的,那是对的”。通过迫使这两个信号相互博弈,他们终于能够看清内部的“测谎仪”捕捉到的究竟是哪种信号。

该团队在四个参数规模从 70 亿到 140 亿(可以把这理解为机器人大脑中的连接数量)的大型语言模型上进行了测试。他们使用了一种巧妙的方法,称为“因子对比”(factorial contrasts),这就像是将混合在一起的奶昔重新分离成原始的水果和牛奶,以辨别每种成分的味道。他们发现,虽然内部信号同时包含了关于真相和信心的信息,但最可靠的可迁移组件是保留机器人自我判断极性的那个部分,而非客观正确性

这里有一个令人惊讶的转折:当研究人员观察一个给出了错误答案但认为自己是对的机器人的内部信号时,“测谎仪”给了它一个高分,就像对待正确答案那样。相反,当机器人给出了正确答案但认为自己是错的时候,探测器给了它一个低分。事实上,在他们进行的包括数学题、电影知识竞赛和常识问答在内的所有模型和测试中,在不同类型的题目之间传输效果最好的内部信号,是追踪机器人信心的信号,而非实际的真相。

论文明确指出,尽管我们在这些模型中看到的“真相”信号可能是纯粹的客观事实度量,但证据表明,仅凭可迁移性并不能确立客观正确性的语义。甚至当研究人员试图仅利用“正确/错误”标签构建探测器并完全忽略机器人的自我判断时,该探测器最终仍然追踪了机器人的信心。这表明,我们在这些模型中看到的“真相”可能更多地关乎模型对其自身输出的感觉,而非实际的事实。作者得出结论:仅仅因为一个信号可以从一种任务迁移到另一种任务,并不意味着它代表了真理;它可能仅仅代表了模型自身的观点。因此,虽然我们可以窥视机器人的大脑以查看它是否充满信心,但我们还不能确定这种信心是否意味着它正在说实话。这项研究表明,我们从这些模型中能读到的最可靠的东西是它们的自我评估,而不是客观的现实检查。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →