Can Language Model Agents be Helpful Circuit Explainers in Mechanistic Interpretability?
यह शोध पत्र AgenticInterpBench और HyVE फ्रेमवर्क प्रस्तुत करता है ताकि यह प्रदर्शित किया जा सके कि भाषा मॉडल एजेंट एक पुनरावृत्ति परिकल्पना-सत्यापन लूप (iterative hypothesis-validation loop) के माध्यम से पहचाने गए न्यूरल सर्किटों के लिए घटक-स्तरीय और कार्य-स्तरीय स्पष्टीकरण प्रभावी ढंग से उत्पन्न कर सकते हैं, हालांकि उनकी विश्वसनीयता वर्तमान में सत्यापन चरण में चुनौतियों के कारण सीमित है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक विशाल, जटिल मशीन की कल्पना करें (जैसे कि एक विशाल भाषा मॉडल) जो कहानियाँ लिख सकती है, गणित की समस्याओं को हल कर सकती है, या सवालों के जवाब दे सकती है। वैज्ञानिकों ने इस मशीन के अंदर उन विशिष्ट "गियर्स और लीवर्स" (पहियों और लीवर) को खोजने का तरीका ढूंढ लिया है जो एक विशिष्ट कार्य करने के लिए जिम्मेदार हैं। इसे सर्किट को लोकलाइज़ करना (localizing the circuit) कहा जाता है।
हालाँकि, केवल गियर्स को ढूंढ लेना ही काफी नहीं है। हमें अभी भी यह नहीं पता है कि प्रत्येक गियर वास्तव में क्या करता है या वे एक साथ कैसे काम करते हैं। आमतौर पर, एक मानव विशेषज्ञ को मशीन के एक हिस्से का अनुमान लगाने, अपने अनुमान का परीक्षण करने और फिर से प्रयास करने के लिए घंटों तक उसे घूरते हुए बिताना पड़ता है। यह धीमा, उबाऊ और बड़े पैमाने पर करना कठिन है।
यह शोध पत्र पूछता है: क्या हम इस जासूसी काम को हमारे लिए करने के लिए एक रोबोट जासूस (एक लैंग्वेज मॉडल एजेंट) को काम पर रख सकते हैं?
यहाँ उनके प्रयोग का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:
1. समस्या: "ब्लैक बॉक्स" का रहस्य
भाषा मॉडल को एक विशाल, बंद तिजोरी की तरह समझें। वैज्ञानिक पहले ही उन विशिष्ट टंबलर्स (circuit) को खोजने के लिए विशेष उपकरणों का उपयोग कर चुके हैं जो तिजोरी खोलते हैं। लेकिन वे नहीं जानते कि प्रत्येक टम्बलर क्या करता है।
- पुराना तरीका: एक मानव जासूस अनुमान लगाता है, "शायद यह टम्बलर ताले को घुमाता है?" वह इसका परीक्षण करता है। यदि यह विफल हो जाता है, तो वह फिर से अनुमान लगाता है। इसमें बहुत समय लगता है।
- नया विचार: क्या हम यह काम एक AI जासूस को दे सकते हैं जो सोच सके, अपनी थ्योरी को टेस्ट करने के लिए कोड लिख सके, और अपनी गलतियों को सुधार सके?
2. प्रशिक्षण मैदान: एक "खिलौना" तिजोरी
अपने AI जासूस को परखने के लिए, शोधकर्ता एक असली, उलझी हुई तिजोरी (एक वास्तविक दुनिया का भाषा मॉडल) का उपयोग नहीं कर सके क्योंकि उन्हें सही उत्तर पता नहीं होता जिससे वे मिलान कर सकें।
इसके बजाय, उन्होंने 84 "खिलौना तिजोरियाँ" (जिसे AGENTICINTERPBENCH कहा जाता है) बनाईं।
- ये शून्य से बनाई गई छोटी, कृत्रिम मशीनें हैं।
- शोधकर्ता जानते हैं कि ये बिल्कुल कैसे काम करती हैं क्योंकि इन्हें सरल निर्देशों (जैसे कि एक रेसिपी) के एक सेट से बनाया गया है।
- वे जानते हैं कि हर एक गियर को वास्तव में क्या करना चाहिए। यह AI जासूस को ग्रेड देने की अनुमति देता है: "क्या आपने सही अनुमान लगाया?"
3. जासूस: HYVE (परिकल्पना, सत्यापन, स्पष्टीकरण लूप)
शोधकर्ताओं ने HYVE नामक एक AI एजेंट बनाया। HYVE केवल अनुमान नहीं लगाता; वह मशीन के हर एक गियर के लिए एक सख्त जासूसी दिनचर्या का पालन करता है:
- अवलोकन (Observe): HYVE गियर को देखता है। "हम्म, जब इनपुट 'x' होता है, तो यह गियर चमकीला लाल हो जाता है। जब यह 'y' होता है, तो यह काला रहता है।"
- परिकल्पना (Hypothesize): HYVE एक अनुमान लगाता है। "मुझे लगता है कि यह एक 'रेड लाइट डिटेक्टर' है जो केवल 'x' के लिए चालू होता है।"
- सत्यापन (Validate - परीक्षण): यह सबसे महत्वपूर्ण हिस्सा है। HYVE अपने अनुमान का परीक्षण करने के लिए एक कंप्यूटर प्रोग्राम लिखता है। वह कह सकता है, "आइए देखते हैं कि अगर हम इस गियर को 'x' होने पर भी काला रहने के लिए मजबूर करें, तो क्या मशीन खराब होती है।"
- यदि मशीन ठीक उसी तरह खराब होती है जैसा अनुमान था, तो अनुमान पुष्ट (confirmed) हो जाता है।
- यदि मशीन काम करती रहती है, तो अनुमान गलत है। HYVE को वापस चरण 2 पर जाना होगा और एक नया अनुमान लगाना होगा।
- स्पष्टीकरण (Explain): एक बार जब सभी गियर्स का परीक्षण हो जाता है, तो HYVE एक सारांश लिखता है: "यह मशीन एक 'फ्रैक्शन कैलकुलेटर' है जो वाक्य में कितने 'x' आते हैं, उन्हें गिनती है।"
4. परिणाम: जासूस अच्छा है, लेकिन पूर्ण नहीं
शोधकर्ताओं ने यह देखने के लिए कि कौन सा बड़ा भाषा मॉडल (LLM) सबसे अच्छा जासूस बनाता है, HYVE का परीक्षण चार अलग-अलग "मस्तिष्कों" (विभिन्न LLMs) का उपयोग करके किया।
- सफलता: AI एजेंट आश्चर्यजनक रूप से अच्छे थे! वे लगभग 79% समय सही ढंग से पहचान सके कि गियर्स क्या करते हैं और लगभग 83% समय पूरे कार्य का वर्णन कर सके।
- बाधा (The Bottleneck): AI प्रारंभिक अनुमान (परिकल्पना) लगाने में बहुत अच्छा था। समस्या परीक्षण चरण (testing phase) में हुई।
- कभी-कभी AI ने बहुत अस्पष्ट परीक्षण योजना लिखी।
- कभी-कभी AI ने परीक्षण चलाने के लिए कोड लिखा, लेकिन कोड में बग (गलतियाँ) थे (जैसे कि एक जासूस जिसने परीक्षण योजना तो लिखी, लेकिन टॉर्च ले जाना भूल गया)।
- उपमा: यह एक ऐसे जासूस की तरह है जिसके पास हत्यारे के बारे में एक शानदार थ्योरी है, लेकिन जब वह सबूत देखने के लिए अपराध स्थल पर जाने की कोशिश करता है, तो वह रास्ता भटक जाता है या खुद को इमारत के बाहर लॉक कर लेता है।
सबसे अच्छा कौन था?
- Claude-Sonnet बिना क्रैश हुए परीक्षण चलाने में (बग-मुक्त कोड लिखने में) सबसे अच्छा था।
- Gemini अंतिम, समझने में आसान स्पष्टीकरण लिखने में सबसे अच्छा था।
- GPT-5.4 परीक्षणों की योजना बनाने में बहुत अच्छा था, लेकिन इसका कोड अक्सर चलने में विफल रहा।
5. वास्तविक दुनिया का परीक्षण: "Llama" केस स्टडी
यह देखने के लिए कि क्या यह उनके "खिलौना तिजोरियों" के बाहर भी काम करता है, उन्होंने एक वास्तविक, स्वाभाविक रूप से प्रशिक्षित भाषा मॉडल (Llama-3-8B) पर HYVE का परीक्षण किया जो गणित करता है।
- उन्होंने AI को एक सर्किट दिया जिसे अन्य मनुष्यों द्वारा पाया गया था जो मॉडल को तीन संख्याओं को जोड़ने में मदद करता है।
- परिणाम: AI जासूस सफलतापूर्वक यह पता लगा सका कि कुछ गियर्स "ट्रांसफर हेड्स" (संख्याओं को इधर-उधर ले जाने वाले) थे और उसने सही ढंग से पहचाना कि अन्य गियर्स केवल "रिडंडेंट" (अनावश्यक) थे (वे महत्वपूर्ण दिखते थे लेकिन वास्तव में उनकी आवश्यकता नहीं थी)।
- इसने साबित किया कि यह तरीका न केवल साफ-सुथरी खिलौना मशीनों पर, बल्कि वास्तविक, जटिल मशीनों पर भी काम करता है।
निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि AI एजेंट, AI के काम करने के तरीके को समझाने के लिए आशाजनक नए उपकरण हैं। वे अनुमान लगाने और परीक्षण करने का भारी काम कर सकते हैं। हालाँकि, वे अभी भी पूर्ण नहीं हैं। मुख्य बाधा विश्वसनीयता (reliability) है: AI को अपनी थ्योरी का परीक्षण करने के लिए वास्तव में कोड लिखने में बेहतर होना होगा ताकि गलतियाँ न हों।
जब तक AI "प्रयोग करने" (सत्यापन लूप) में बेहतर नहीं हो जाता, तब तक मानव विशेषज्ञों को अभी भी उनके काम की दोबारा जाँच करनी होगी। लेकिन यह जटिल AI मस्तिष्क को स्वचालित रूप से समझने की दिशा में एक बड़ा कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।