← नवीनतम पेपर
🤖 AI

Data-driven Circuit Discovery for Interpretability of Language Models

यह शोध पत्र डेटासेट-विशिष्ट सर्किट उत्पन्न करने वाली मौजूदा परिकल्पना-संचालित सर्किट खोज विधियों की आलोचना करता है जो भाषा मॉडलों की वास्तविक यांत्रिक विविधता को पकड़ने में विफल रहती हैं, और डेटा-संचालित सर्किट डिस्कवरी (DCD) का प्रस्ताव करता है, जो एक नया ढांचा है जो प्रसंस्करण समानता द्वारा उदाहरणों को क्लस्टर करता है ताकि एक ही कार्य के लिए कई विशिष्ट, उच्च-सटीक सर्किटों को प्रकट किया जा सके।

मूल लेखक: Daking Rai, Mor Geva, Ziyu Yao

प्रकाशित 2026-05-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Daking Rai, Mor Geva, Ziyu Yao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अत्यंत बुद्धिमान रोबोट (एक लैंग्वेज मॉडल) है जो कहानियाँ लिख सकता है, गणित कर सकता है और पहेलियाँ सुलझा सकता है। वैज्ञानिक यह समझना चाहते हैं कि यह रोबोट कैसे सोचता है। वे इसे "मैकेनिस्टिक इंटरप्रिटेबिलिटी" (Mechanistic Interpretability) कहते हैं।

पारंपरिक तरीका जिससे वैज्ञानिकों ने इस पर काम करने की कोशिश की है, वह एक कार के "इंजन" को केवल एक विशिष्ट यात्रा को देखकर खोजने जैसा है। वे कहते हैं, "ठीक है, रोबोट ने अभी पॉइंट A से पॉइंट B तक की यात्रा की। आइए मैप करें कि उस यात्रा को पूरा करने के लिए कौन से गियर घूमे।" वे उस मैप किए गए पथ को एक सर्किट (Circuit) कहते हैं।

समस्या: "एक-आकार-सभी-के-लिए" वाला जाल (The "One-Size-Fits-All" Trap)
यह लेख तर्क देता है कि पुराना तरीका त्रुटिपूर्ण है क्योंकि यह दो गलत अनुमान लगाता है:

  1. डेटासेट का अनुमान: यह मान लेता है कि वैज्ञानिकों द्वारा उपयोग किए गए विशिष्ट उदाहरण (जैसे कि एक विशिष्ट वाक्य संरचना) उन सभी तरीकों का प्रतिनिधित्व करते हैं जिनसे रोबोट एक कार्य कर सकता है।
  2. एकल-इंजन का अनुमान: यह मान लेता है कि रोबोट किसी कार्य को करने के लिए केवल एक ही विशिष्ट सेट गियर्स (सर्किट) का उपयोग करता है, चाहे सवाल कैसे भी पूछा जाए।

खोज: रोबोट के पास कई इंजन हैं
शोधकर्ताओं ने यह परीक्षण करने के लिए कि यह कैसे काम करता है, रोबोट को एक ही कार्य दिया लेकिन उसमें थोड़े बदलाव किए (जैसे कि कहानी में नाम बदलना, या गणित के सवाल को अंकों के बजाय शब्दों में लिखना)।

उन्होंने पाया कि:

  • जब उन्होंने "जॉन और मैरी" जैसे नामों वाली कहानी के लिए रोबोट के "इंजन" को मैप किया, तो वह पूरी तरह से अलग था, जो "व्यक्ति X और व्यक्ति Y" जैसे नामों वाली कहानी के लिए उपयोग किए गए इंजन से भिन्न था।
  • इससे भी बुरा यह कि यदि वे दो पूरी तरह से अलग कार्यों (जैसे "वस्तु खोजें" और "गणित करें") को एक बड़े ढेर में मिला देते, तो पुराना तरीका अभी भी एक एकल मैप थोपने की कोशिश करता। इसने एक भ्रामक, उलझा हुआ सर्किट बना दिया जो दोनों कार्यों का एक "फ्रेंकेंस्टीन" मिश्रण था, बजाय इसके कि यह समझ पाता कि इनपुट के आधार पर रोबोट वास्तव में दो अलग-अलग इंजन के बीच स्विच कर रहा है।

समाधान: डेटा-संचालित सर्किट डिस्कवरी (DCD)
इसे ठीक करने के लिए, लेखक एक नया तरीका प्रस्तावित करते हैं जिसे डेटा-ड्रिवन सर्किट डिस्कवरी (DCD) कहा जाता है।

इसे इस तरह समझें:

  • पुराना तरीका: आप लोगों के एक समूह से एक पहेली सुलझाने के लिए कहते हैं। आप सभी के समाधान देखते हैं और एक एक मास्टर ब्लूप्रिंट बनाने की कोशिश करते हैं जो यह समझा सके कि हर किसी ने उसे कैसे सुलझाया। यदि कुछ लोगों ने हथौड़े का उपयोग किया और अन्य ने पेचकस का, तो आपका ब्लूप्रिंट दोनों उपकरणों का एक भ्रमित करने वाला मिश्रण बन जाएगा।
  • नया तरीका (DCD): पहले आप लोगों को देखते हैं और उन्हें इस आधार पर समूहों में बांटते हैं कि वे समस्या को कैसे हल कर रहे हैं। आप सभी "हथौड़ा-उपयोगकर्ताओं" को एक कमरे में और सभी "पेचकस-उपयोगकर्ताओं" को दूसरे कमरे में रखते हैं। फिर, आप हथौड़ा समूह के लिए एक अलग, स्पष्ट ब्लूप्रिंट और पेचकस समूह के लिए एक अलग, स्पष्ट ब्लूप्रिंट बनाते हैं।

DCD कैसे काम करता है (रूपक)

  1. डेटा को छाँटना: रोबोट को एक ही पथ का उपयोग करने के लिए मजबूर करने के बजाय, DCD हर उस उदाहरण को देखता है जिसे रोबोट प्रोसेस करता है। यह पूछता है, "क्या यह उदाहरण रोबोट के आंतरिक गियर्स को उस दूसरे उदाहरण की तरह ही घुमाता है?"
  2. समूह बनाना: यह उदाहरणों को उनके प्रसंस्करण के तरीके के आधार पर "क्लस्टर्स" (clusters) में वर्गीकृत करता है।
  3. विशिष्ट सर्किट खोजना: इसके बाद यह प्रत्येक समूह के लिए एक विशिष्ट, स्पष्ट "इंजन मैप" खोजता है।

परिणाम
जब उन्होंने इस नए तरीके का उपयोग किया:

  • उन्होंने पाया कि रोबोट वास्तव में कई विशिष्ट तंत्रों (इंजनों) का उपयोग करता है जिसे मनुष्य केवल "एक कार्य" समझते हैं।
  • नए मैप (सर्किट) पुराने उलझे हुए मैप की तुलना में बहुत अधिक सटीक (faithful) और सरल (sparse) थे।
  • महत्वपूर्ण बात यह है कि रोबोट का आंतरिक संगठन "गणित" या "कहानी" जैसे मानवीय लेबल की परवाह नहीं करता था। इसने खुद को इनपुट की संरचना के आधार पर व्यवस्थित किया। DCD मानव श्रेणियों को थोपने के बजाय रोबोट के आंतरिक तर्क का सम्मान करता है।

सारांश में
यह लेख कहता है: "एक कार्य के लिए एक सार्वभौमिक इंजन खोजने की कोशिश करना बंद करें। रोबोट उससे कहीं अधिक स्मार्ट और लचीला है। उसके पास अलग-अलग स्थितियों के लिए अलग-अलग इंजन हैं। हमारा नया तरीका, DCD, डेटा को यह बताने देता है कि सीमाएँ कहाँ हैं, ताकि हम हर चीज़ पर एक एकल, भ्रमित इंजन मैप थोपने के बजाय, सही काम के लिए सही इंजन खोज सकें।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →