Latent Attribution Regularization: Cross-Domain Attribution-Consistency Training for Stable NLP Explanations
Este artículo presenta la Regularización de Atribución Latente (LAR), un método durante el tiempo de entrenamiento que impone la consistencia de atribución bajo sustituciones de sinónimos que preservan el significado, demostrando que mejora significativamente la estabilidad de las explicaciones basadas en gradientes en Transformers ajustados sin comprometer la precisión del modelo, al tiempo que establece que la alineación adecuada de los tokens es esencial para medir con precisión dicha estabilidad.