← 最新论文
🤖 machine learning

The Attribution Contract: Feature Attribution for Generative Language Models

本文提出了“归因契约”这一概念框架,通过明确定义输出、合格特征、生成过程、固定条件及模型得分,解决了生成式语言模型特征归因中的歧义问题,从而将归因分歧重新框架化为解释性契约的差异,而非算法缺陷。

原作者: Giang Nguyen

发布于 2026-05-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Giang Nguyen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你试图弄清楚一位厨师为什么会做某道特定的菜。你想知道哪些食材对最终的味道最为重要。

在过去(使用简单的“分类器”模型时),这很容易。你给厨师一份食材清单(输入),他们做出一道菜(输出),然后你可以指着盐或胡椒说:“啊,是盐让它有了咸味。”食材是静态的,菜肴已经完成。

但对于生成式语言模型(如正在撰写本文的 AI)来说,烹饪过程要复杂得多。厨师不仅仅做一道菜;他们是一口一口地烹饪整场盛宴。而棘手之处在于:他们烹饪的第一口,会成为第二口的食材。

如果厨师先烹饪出"Le"(法语中的“定冠词”),那么这个"Le"现在就放在台面上,等待作为下一个词"chien"(狗)的食材被使用。

问题:“谁做了什么?”的混淆

该论文认为,当我们试图解释 AI 为何写下某个特定单词时,我们常常感到困惑,因为我们不清楚自己究竟在问什么问题

作者将这种混淆称为**“自我归因谬误”**。

这里有一个简单的类比:
想象你正在观看一场接力赛。

  • 选手 A 将接力棒传给 选手 B
  • 选手 B 跑得飞快并赢得了比赛。

如果你问:“是谁导致了选手 B 跑得快?”

  1. 问题 A:“是什么帮助选手 B 此刻跑得快?”
    • 答案:来自选手 A 的接力棒!(前一个词是最关键的因素)。
  2. 问题 B:"原始计划中的哪一部分导致了团队获胜?”
    • 答案:教练对选手 A 的指示!(原始提示词是最关键的因素)。

该论文指出,许多 AI 研究人员使用同一种工具来回答这两个问题,结果却混淆了。他们看到“选手 A"(前一个词)对“选手 B"的速度负有责任,便得出结论:“教练的指示无关紧要!”但这错了。他们只是问错了问题。

解决方案:“归因契约”

为了解决这个问题,作者提出了一套新规则,称为归因契约。你可以将其想象成一份工作单食谱卡,必须在开始分析 AI 之前填写完毕。

在你问 AI“你为什么写下这个?”之前,你必须签署一份合同,明确定义五件事(即 SCOPE):

  1. S (Score,评分):我们要测量什么?(是下一个词的概率?还是整个句子?)
  2. C (Conditioning,条件):我们要固定什么?(我们是忽略 AI 已经写下的词,还是将它们视为食材?)
  3. O (Output,输出):我们要解释什么?(仅仅是下一个词?还是整个段落?)
  4. P (Process,过程):AI 是如何生成它的?(它是从左到右书写的吗?还是像扩散模型那样先擦除再重写?)
  5. E (Eligible Features,合格特征):我们允许归咎或赞扬什么?(仅限于用户的原始提示词?还是也包括 AI 自己之前的词?)

为何这很重要:“魔法眼镜”类比

想象 AI 戴着一副魔法眼镜

  • 如果你用契约 A(局部下一个词)让 AI 解释某个词,眼镜会向你显示前一个词发出明亮的红光。它在说:“这个词之所以在这里,是因为前一个词让它变得可能!”
  • 如果你用契约 B(提示词条件化)让 AI 解释同一个词,眼镜会熄灭前一个词的光芒,转而让原始提示词发出明亮的红光。它在说:“这个词之所以在这里,是因为在提示词中要求了它!”

该论文的核心观点是: 你不能仅凭眼镜就说 AI 是“错”还是“对”。你必须承认,契约 A 和契约 B 问的是两个不同的问题

如果一位研究人员说"AI 产生了幻觉,因为它忽略了源文档”,但实际上他们使用的是契约 A(关注前一个词),那么他们就是在误读结果。他们需要切换到契约 B(固定前一个词,仅查看源文档),才能确认源文档是否真的是原因。

结论

这篇论文并没有发明一种计算数值的新方法。相反,它发明了一种谈论数值的新方式

它告诉我们,在生成式 AI 的世界里,关于哪个输入最重要,并不存在单一的“真相”。只有相对于契约的真相

  • 如果你想知道 AI 是如何一步步思考的,请使用“局部”契约。
  • 如果你想知道你的指令如何塑造了最终的故事,请使用“提示词条件化”契约。

在我们停止将这些视为同一件事之前,我们将继续在 AI 解释问题上争论不休,而实际上我们只是在问不同的问题。“归因契约”只是一个工具,确保我们在开始寻找答案之前,都在问同一个问题。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →