Latent Attribution Regularization: Cross-Domain Attribution-Consistency Training for Stable NLP Explanations
Dieses Paper führt die Latent Attribution Regularization (LAR) ein, eine Methode während der Trainingszeit, die die Konsistenz der Attribution unter semantisch erhaltenden Synonym-Substitutionen erzwingt, und zeigt auf, dass sie die Stabilität gradientenbasierter Erklärungen in feinabgestimmten Transformern signifikant verbessert, ohne die Modellgenauigkeit zu beeinträchtigen, während sie gleichzeitig etabliert, dass eine korrekte Token-Ausrichtung essenziell ist, um eine solche Stabilität präzise zu messen.