Learning Self-Interpretation from Interpretability Artifacts: Training Lightweight Adapters on Vector-Label Pairs
Dit artikel toont aan dat het trainen van lichtgewicht, bevroren adapters op interpreteerbaarheidsartefacten grote taalmodellen in staat stelt om betrouwbare, hoogwaardige zelfinterpretaties te genereren over taken en schalen heen zonder het onderliggende model te wijzigen.