Sparse Feature Coactivation Reveals Causal Semantic Modules in Large Language Models
यह शोध पत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में स्पार्स ऑटोएन्कोडर फीचर्स के सह-सक्रियण (coactivation) का विश्लेषण करने से अवधारणाओं और संबंधों के लिए अर्थपूर्ण रूप से सुसंगत, संदर्भ-संगत कारण मॉड्यूल (causal modules) प्रकट होते हैं, जो घटक एब्लेशन (ablation) और प्रवर्धन (amplification) के माध्यम से मॉडल आउटपुट के पूर्वानुमानित और लक्षित हेरफेर को सक्षम करते हैं।