Latent Attribution Regularization: Cross-Domain Attribution-Consistency Training for Stable NLP Explanations
Questo articolo introduce la Latent Attribution Regularization (LAR), un metodo in fase di addestramento che impone la coerenza dell'attribuzione sotto sostituzioni di sinonimi semanticamente preservanti, dimostrando che migliora significativamente la stabilità delle spiegazioni basate sul gradiente nei Transformer sottoposti a fine-tuning senza compromettere l'accuratezza del modello, stabilendo al contempo che un corretto allineamento dei token è essenziale per misurare accuratamente tale stabilità.