← 最新论文
💬 NLP

Faithful-Patchscopes: Understanding and Mitigating Model Bias in Hidden Representations Explanation of Large Language Models

本文指出 Patchscopes 框架中存在一种系统性的不忠实性,即大语言模型依赖于固有的语言偏置而非上下文隐藏表示,并提出了 BALOR 方法来重新校准逻辑值,从而显著提高解释的忠实度。

原作者: Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

发布于 2026-02-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Xilin Gong, Shu Yang, Zehua Cao, Lynne Billard, Di Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:解读 AI 的“思想”

想象一下,大型语言模型(LLM)就像一座巨大且复杂的工厂。当你向它提问时,它不仅仅是在思考,还在通过层层机械结构处理信息,创造出包含你请求中特定细节的内部“蓝图”(称为隐藏表示)。

最近,研究人员发明了一种名为 Patchscopes 的工具。你可以把 Patchscopes 想象成一台“读心机”。它提取其中一个内部蓝图,将其接入到一个新问题中,并要求 AI 用通俗易懂的语言解释这个蓝图的含义。

问题所在: 这篇论文指出,这种读心机往往是**不忠实(unfaithful)**的。它并不总是能如实反映蓝图中包含的内容。相反,它经常忽略你提供给它的具体细节,而只是重复它通常会想的内容。

类比:“西兰花”偏见

为了理解这个问题,想象你正向一个机器人展示一张紫色西兰花的照片。

  1. 现实情况: 在照片中,西兰花显然是紫色的。机器人的这个图像内部“蓝图”正确地编码了“紫色”这一颜色。
  2. 机器人的习惯: 然而,在现实世界中(以及机器人在大量文本训练中所学到的知识中),西兰花几乎总是被描述为绿色的。机器人有一个强烈的习惯:西兰花 = 绿色
  3. 失效情况: 当你使用 Patchscopes 并基于那个紫色蓝图询问机器人“这颗西兰花是什么颜色的?”时,机器人忽略了紫色的证据。它回答道:“绿色。”

机器人太习惯于“绿色”这个习惯,以至于它覆盖了其自身记忆中的实际证据。论文将此称为由不平衡语言模式(看到“绿色西兰花”的次数比“紫色西兰花”多 100 倍)导致的模型偏差(Model Bias)

解决方案:BALOR(“事实核查员”)

作者提出了一种名为 BALOR(通过对数几率重校准实现偏差对齐)的新方法来解决这个问题。

你可以把 BALOR 想象成一个运行并行模拟的智能事实核查员。以下是它的工作原理:

  1. “有偏差”的猜测: 机器人看着紫色的西兰花,依赖于其坏习惯,认为:“它很可能是绿色的。”
  2. “对比”猜测: BALOR 向机器人提出了第二个问题:“如果我没有给你看照片,只是泛泛地问你关于西兰花的问题,你会怎么说?”机器人回答:“绿色”(因为这是它的默认偏差)。
  3. 数学魔法: BAL car 对这两个答案进行比较。它意识到:“机器人在两种情况下都说了‘绿色’。但第一种情况下,它明明看到了紫色的照片!既然它仍然说‘绿色’,说明它的偏差太强了。”
  4. 修正: BALOR 从“基于图像的答案”中减去“默认偏差”。它本质上是在说:“好吧,我们知道你会因为习惯而想说‘绿色’。但既然照片显示是‘紫色’,那我们就增强‘紫色’的信号,并抵消掉‘绿色’的习惯。”

通过在机器人写出最终答案之前,对其信心水平(称为 logits)进行这种数学运算,BALOR 迫使机器人关注特定的上下文(即紫色的西兰花),而不是它的通用习惯。

研究发现

研究人员在四个不同的 AI 模型(如 Llama 和 Qwen)上进行了测试,使用的是关于颜色、性别和文化等棘手问题的数据集。

  • 问题是真实存在的: 在没有帮助的情况下,由于 AI 不断陷入偏差,其解释出错的概率为 18% 到 28%。
  • BALOR 有效: 通过使用这种“事实核查”方法,他们显著提高了准确性。在某些情况下,AI 对实际持有信息的忠实度提高了 33%
  • 无需“手术”: 与其他需要重新训练整个 AI(这既昂贵又会改变 AI 的思维方式)的方法不同,BALOR 就像是一个在过程最后阶段运行的过滤器。它在不改变 AI 大脑的情况下修复了答案。

总结

这篇论文表明,AI 模型经常会对它们内部所“知道”的内容撒谎,因为它们过于固执于训练中的习惯。作者构建了一个名为 BALOR 的工具,它像一名裁判一样,能够识别出 AI 何时为了遵循习惯而忽略证据,并通过数学手段引导它说出真相。这使得试图解释 AI 如何思考的工具变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →