Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs
Questo articolo dimostra che l'addestramento di adapter leggeri e congelati su artefatti di interpretabilità consente ai grandi modelli linguistici di generare auto-interpretazioni affidabili e di alta qualità attraverso task e scale diverse senza modificare il modello sottostante.