← 最新论文
💻 computer science

Evaluation Framework for Highlight Explanations of Context Utilisation in Language Models

本文介绍了首个用于评估语言模型中上下文利用高光解释的黄金标准评估框架,揭示出尽管改进后的机械可解释性方法 MechLight 优于现有技术,但所有方法在处理更长上下文时均表现困难,并呈现出位置偏差。

原作者: Jingyi Sun, Pepa Atanasova, Sagnik Ray Choudhury, Sekh Mainul Islam, Isabelle Augenstein

发布于 2026-04-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Jingyi Sun, Pepa Atanasova, Sagnik Ray Choudhury, Sekh Mainul Islam, Isabelle Augenstein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你有一个非常聪明的机器人助手(一个语言模型),它从自己的记忆中知晓大量事实,就像在它的大脑里建了一座图书馆。有时,你给这个机器人一张带有信息的新纸,并向它提问。机器人可能会利用它已知的知识来回答,也可能会查看你的新纸。

问题在于,机器人不会告诉你它究竟使用了哪个来源。它是读了你的纸,还是仅仅从记忆中猜测的?

本文介绍了一种测试“高亮解释”的新方法。将这些解释想象成机器人用来标记你纸上它为了给出答案而阅读的确切单词的荧光笔。目标是看看这支荧光笔是否真的指向了正确的单词,还是仅仅在随机乱画。

以下是研究人员所做工作和发现的一个简单分解:

1. 问题:“黑盒”

目前,我们无法轻易判断机器人是在阅读你的纸,还是仅仅依赖其记忆。现有的试图向我们展示“机器人在想什么”的工具(称为高亮解释)从未被恰当地测试过以验证其准确性。这就像拥有一个声称向你显示路线的 GPS,但从未有人检查过它是否真的指向了正确的街道。

2. 解决方案:“黄金标准”测试

研究人员建立了一个特殊的测试实验室来检查这些高亮工具。他们创建了四个具体场景,就像一场侦探游戏:

  • 冲突:纸上写着“首都是安卡拉”,但机器人的记忆说是“首都是伦敦”。如果机器人回答“安卡拉”,它必须是读了纸。高亮应该指向“安卡拉”。
  • 干扰:纸上有很多胡言乱语或不相关的信息。高亮不应指向这些胡言乱语。
  • 双重麻烦:你给机器人两张不同的纸,它们都与机器人的记忆相矛盾。高亮需要指向机器人选择的特定那张纸。

他们为这些测试创建了“黄金标准”(正确答案键),以便能够客观地给高亮工具评分。

3. 参赛者

他们测试了四种不同类型的高亮工具:

  • “阻断器”(特征消融):这种方法试图一次隐藏一个单词,看看答案是否会改变。就像用手指遮住一个单词,看看句子是否仍然通顺。
  • “数学巫师”(积分梯度):这使用复杂的数学来计算每个单词对答案的贡献程度。
  • “视线追踪器”(注意力机制):这观察机器人在说话时内部“眼睛”看向哪里。
  • “机械师”(MechLight):这是作者创建的一种新方法。与其猜测,他们深入机器人的大脑(其内部机制),找到决定使用纸张的特定齿轮或开关,然后将其追溯回相应的单词。

4. 结果:谁赢了?

  • 获胜者“机械师”(MechLight) 在指向正确单词方面表现最佳。它是最可靠的侦探。
  • 亚军:“阻断器”方法还可以,但非常不一致。有时它表现很好;其他时候它会感到困惑。
  • 失败者:令人惊讶的是,“数学巫师”和“视线追踪器”——这两种方法非常流行,并被用于许多其他工具——在这个特定任务上表现极差。它们经常指向错误的单词,或者无法分辨机器人使用了哪张纸。

5. 重大缺陷(“陷阱”)

即使是最好的高亮工具也有两个主要弱点:

  • “长文”问题:随着文本变长,所有高亮工具的表现都会变差。这就像试图在干草堆里找到一根特定的针;干草堆越大,高亮工具找到那根针就越难。
  • “位置偏差”:高亮工具有一种奇怪的倾向,即根据单词的位置而非其含义来偏爱某些单词。
    • 有些方法总是喜欢文本末尾的单词(“近因”偏差)。
    • 其他方法总是喜欢开头的单词(“首因”偏差)。
    • 这意味着,如果你将一句话从开头移到结尾,高亮工具可能会改变它对该句子是否重要的看法,即使含义完全相同。

6. 结论

该论文得出结论,虽然我们有工具来解释机器人如何使用上下文,但目前大多数工具对于这一特定任务都不可靠。它们经常无法向我们展示机器人究竟使用了文本的哪一部分,特别是在文本很长或存在多份文档时。

作者的新框架(测试实验室)现已可供他人使用,以便在未来构建更好、更准确的高亮工具。他们还发布了代码和数据,以便其他科学家可以尝试解决这些问题。

简而言之:我们拥有一种新的、严格的方法来测试 AI 解释器是否在说真话。测试表明,目前的解释器经常撒谎(或者至少非常困惑),但我们现在有了构建能说真话的解释器的蓝图。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →