Latent Attribution Regularization: Cross-Domain Attribution-Consistency Training for Stable NLP Explanations
이 논문은 의미를 보존하는 유의어 치환 하에서 기여도 일관성을 강제하는 훈련 단계 방법론인 잠재 기여도 정규화(Latent Attribution Regularization, LAR)를 소개하며, 이 방법이 모델의 정확도를 저해하지 않으면서 미세 조정된 트랜스포머의 그래디언트 기반 설명의 안정성을 유의미하게 향상시킨다는 것을 입증하는 동시에, 이러한 안정성을 정확하게 측정하기 위해서는 적절한 토큰 정렬이 필수적임을 확립한다.