Latent Attribution Regularization: Cross-Domain Attribution-Consistency Training for Stable NLP Explanations
本文介绍了潜在归因正则化(Latent Attribution Regularization, LAR),这是一种在训练阶段强制要求在语义保持不变的同义词替换下实现归因一致性的方法,证明了该方法在不损害模型准确性的情况下,显著提高了微调 Transformer 模型中基于梯度的解释的稳定性,同时也确立了适当的标记对齐对于准确衡量此类稳定性至关重要。