Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs
Este artículo demuestra que el entrenamiento de adaptadores ligeros y congelados sobre artefactos de interpretabilidad permite que los modelos de lenguaje de gran tamaño generen autointerpretaciones fiables y de alta calidad a través de diversas tareas y escalas sin modificar el modelo subyacente.