Latent Attribution Regularization: Cross-Domain Attribution-Consistency Training for Stable NLP Explanations
本文介绍了潜在归因正则化(Latent Attribution Regularization, LAR),这是一种在训练阶段强制要求在语义保持不变的同义词替换下实现归因一致性的方法,证明了该方法在不损害模型准确性的情况下,显著提高了微调 Transformer 模型中基于梯度的解释的稳定性,同时也确立了适当的标记对齐对于准确衡量此类稳定性至关重要。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,理解计算机如何做出决策的一种常用方法是观察它对输入内容的哪些部分给予了最多的关注。想象一下,一台机器正在阅读一个句子并判断它是快乐还是悲伤;研究人员可以生成一张图谱,显示模型认为哪些词对于该判断最为重要。这些被称为“特征归因”(feature attributions)的图谱正越来越多地被用于向人类解释 AI 的决策。然而,出现了一个令人不安的模式:如果你通过将一个词替换为意思相同的同义词来轻微改变句子,图谱往往会发生彻底的变化。计算机可能会突然指向另一个词作为其决策的原因,尽管句子的含义和最终答案都没有改变。这使得解释显得不可信,仿佛 AI 是不可靠或混乱的,但实际上,这种变化可能只是由计算机读取文本的方式所产生的幻觉。
独立研究员 Junaid Hassan 的一项新研究调查了这一问题,揭示了这种表面的不稳定性实际上是由于计算机拆解单词的方式所导致的测量误差。现代语言模型并不像人类那样阅读整个单词,而是将文本切分成更小的碎片,称为“子词标记”(subword tokens)。当一个单词被替换为同义词时,这些小碎片的数量可能会发生变化,从而改变其后每一个标记的位置。如果研究人员根据位置在列表中比较重要性得分,他们往往是在比较完全错误的对象,就像是将一本书的第一页与另一本书的第二页进行匹配一样。研究人员开发了一种通过基于单词的实际身份而非其位置来进行匹配的方法来修复这个问题,并发现这些解释的稳定性比之前认为的要好得多。
基于这种修正后的测量方式,该研究引入了一种名为“潜在归因正则化”(Latent Attribution Regularization)的新训练技术。这种方法教导 AI 模型即使在输入文本因同义词而发生轻微改变时,也要保持其解释图谱的一致性。在训练过程中,模型会被展示一个句子及其略微改变的版本,如果不变词汇的重要性得分在两个版本中保持相似,模型就会获得奖励。这是在学习正确分类文本情感的标准任务之外进行的。目标不仅是得到正确的答案,还要确保背后的推理逻辑在措辞变化时保持稳定。
研究人员使用一个名为 DistilBERT 的模型在一个电影评论数据集上测试了这种方法。实验在两个不同规模下运行:一个包含 1,500 个样本的小型测试,以及一个包含 20,000 个样本的更大、更真实的测试。在两种情况下,模型都分别在使用了和未使用这种一致性技术的情况下进行了训练。结果显示,使用一致性技术训练的模型产生了显著更稳定的解释。当文本通过轻度、中度或重度的同义词替换进行改变时,经过一致性技术训练的模型比未经过该技术训练的模型更频繁地保持解释的一致性。例如,在较大的测试中,随着文本变化的难度增加,稳定性的提升也随之增长,显示出在更困难的条件下具有明显的优势。
至关重要的是,这种稳定性的提升并没有以牺牲模型理解文本的能力为代价。使用新技术的模型在分类电影评论方面达到了与未使用该技术模型同样高的准确率。在较大的实验中,两组模型都达到了约 82% 的准确率,证明了模型可以在不忘记其主要任务的情况下学会更加一致。研究还证实,最初发现的极端不稳定性确实是测量方法造成的人为现象;一旦进行了对齐修正,基准稳定性本身就已经很高,而新的训练方法则将其推向了更高水平。
研究结果表明,对于构建向用户解释其决策的 AI 系统的开发者来说,有一种使这些解释更可靠的实际方法。通过在训练阶段加入这种一致性检查,AI 可以学会忽略由细微措辞变化引起的噪声,并专注于真正的含义。研究人员指出,虽然这项工作是在特定类型的模型和单一任务上完成的,但该方法提供了一种低风险的常规训练补充方案,可以使 AI 的解释在现实应用中更加值得信赖。研究总结道,经常被归咎于 AI 模型本身的不稳定性,可能只是测量方法的一个陷阱;通过正确的工具和训练,我们可以构建出能够以更高稳定性解释自身的系统。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。