← 最新论文
💬 NLP

Faithfulness Evaluation for Decoder-only LLM Attributions with Controlled Retained Information

本文引入了π\pi-Soft-NC 和π\pi-Soft-NS 评估框架,以在评估仅解码器大型语言模型的归因忠实度时控制保留词数,并提出了 Grad-ELLM 方法,该方法有效结合梯度与注意力信号,实现了面向全面性的卓越性能。

原作者: Xin Huang, Antoni B. Chan

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Xin Huang, Antoni B. Chan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是用简单语言和日常类比对该论文的解读。

核心难题:拿苹果和橙子做比较

想象你是一位法官,试图判断哪位侦探更擅长破解谜案。你有两位侦探:侦探 A侦探 B

  • 侦探 A找到了 5 条线索,但每一条都非常重要。
  • 侦探 B找到了 50 条线索,但只有 5 条真正有用;其余的都是噪音。

过去,研究人员试图通过观察“移除侦探指出的线索后,AI 的回答发生了多大变化”来衡量“忠实度”(即 AI 解释自身思维的程度)。

缺陷所在: 旧有的衡量方式是这样的:如果侦探 B 给了你 50 条线索,你移除了其中的 45 条,AI 的回答可能会发生巨大变化,但这仅仅是因为你移除了那么多文字,而不是因为这些线索本身质量差。如果侦探 A 只给了你一份简短的 5 条线索列表,移除它们可能只会让回答发生较小的变化,仅仅因为原本的文字就比较少。

旧的评估指标是不公平的。它们将一位保留了大量信息的侦探与一位保留极少信息的侦探进行比较,使得那位保留更多信息的侦探看起来在解释事物方面“更出色”,即使他们的逻辑其实很混乱。

解决方案:“等量保留”规则

本文作者为这场游戏提出了一条新规则:每个人都必须保留完全相同数量的信息。

他们引入了一种名为π\pi-Soft-NCπ\pi-Soft-NS的新方法。你可以将π\pi(派)想象成信息的“音量旋钮”。

  • 如果你将旋钮设为 0.5,那么侦探 A 和侦探 B 都必须保留句子中 exactly 50% 的单词。
  • 如果你将其设为 0.1,两人都只能保留 10%。

通过强制两种方法“保留”相同数量的信息,你终于可以看出谁真正挑选了正确的单词来解释 AI 的决策,而不是谁仅仅挑选了最多的单词。

新侦探:Grad-ELLM

作者还构建了一种名为Grad-ELLM的新侦探方法来测试这条新规则。

  • 工作原理: 想象 AI 正在像连锁反应一样逐个单词地编写故事。为了理解 AI 为何选择下一个单词,Grad-ELLM 同时观察两件事:
    1. “注意力”图: AI 关注了哪些单词?(就像 AI 在房间里盯着谁看)。
    2. “梯度”图: 改变这些单词在多大程度上实际改变了结果?(就像移动某个特定加热器时,房间温度会发生多大变化)。

Grad-ELLM 结合了这两种视角。它不仅仅挑选单个“最重要”的单词;而是创建了一个贯穿整个句子的平滑、连续的重要性图谱。这就像一张热力图,精确显示“热度”(重要性)在哪里,而不仅仅是指向某一个点。

他们的发现

作者使用诸如以下任务,在著名的 AI 模型(Llama 和 Mistral)上测试了他们的新规则和新侦探:

  • 情感分析: 判断电影评论是正面还是负面。
  • 开放式生成: 回答问题或续写故事。

结果:

  1. 旧规则存在偏差: 当他们使用旧指标时,那些保留大量单词的方法看起来人为地表现良好。
  2. 新规则揭示真相: 在“等量保留”新规则下,Grad-ELLM 被证明在寻找广泛证据方面表现出色。它表明 AI 的决策得到了大量单词协同工作的支持(就像一群人的合唱)。
  3. 没有唯一的赢家: 有趣的是,没有任何一种方法在所有方面都是最好的。
    • 有些方法擅长找出一两个最关键单词(就像找到“确凿证据”)。
    • Grad-ELLM 擅长展示全貌,即有多少单词共同促成了答案。

核心启示

这篇论文就像是为面包店配备的一套新秤。以前,如果你用重盘子称蛋糕,用轻盘子称饼干,你就无法判断哪种甜点实际上更重。作者在两边都加上了标准盘子。

他们还烘焙了一种新蛋糕(Grad-ELLM),其风味均匀分布在整个蛋糕中,而不是只有几个甜蜜点。他们的新秤显示,虽然有些方法擅长寻找“甜蜜点”,但他们的新蛋糕更能展示整个甜点是如何组合在一起的。

简而言之: 他们修正了我们测试 AI 解释的方式,使我们不再被单词的数量所迷惑,并引入了一种新方法,能更完整、更诚实地展现 AI 的思维方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →