Latent Attribution Regularization: Cross-Domain Attribution-Consistency Training for Stable NLP Explanations
Dit artikel introduceert Latent Attribution Regularization (LAR), een methode tijdens de training die attributieconsistentie afdwingt onder semantisch behoudende synoniemsubstituties, waarmee wordt aangetoond dat het de stabiliteit van gradiëntgebaseerde verklaringen in gefinetunede Transformers aanzienlijk verbetert zonder de nauwkeurigheid van het model te compromitteren, terwijl het ook vaststelt dat een juiste tokenuitlijning essentieel is voor het accuraat meten van dergelijke stabiliteit.