Automated Interpretability and Feature Discovery in Language Models with Agents
यह शोध पत्र एक स्वायत्त मल्टी-एजेंट फ्रेमवर्क प्रस्तुत करता है जो परिकल्पनाओं को पुनरावर्ती रूप से परिष्कृत करके और लार्ज लैंग्वेज मॉडल्स में आंतरिक विशेषताओं की खोज करके मैकेनिस्टिक इंटरप्रिटेबिलिटी (mechanistic interpretability) को स्वचालित करता है, जो अधिक स्पष्ट, असत्य सिद्ध करने योग्य और ऑडिट योग्य स्पष्टीकरण उत्पन्न करने में वन-शॉट विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।