← नवीनतम पेपर
💬 NLP

CIRCUS: Circuit Consensus under Uncertainty via Stability Ensembles

CIRCUS एक पोस्ट-हॉक फ्रेमवर्क है जो स्थिरता एन्सेम्बल्स (stability ensembles) का निर्माण करके तंत्रिका सर्किट खोज (mechanistic circuit discovery) की विश्लेषक के मनमाने विकल्पों के प्रति संवेदनशीलता को संबोधित करता है, ताकि एक सुदृढ़, अनिश्चितता-जागरूक सर्वसम्मत सर्किट निकाला जा सके जो संक्षिप्तता और कारण संबंधी प्रासंगिकता दोनों में पारंपरिक बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Swapnil Parekh

प्रकाशित 2026-03-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Swapnil Parekh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ CIRCUS पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके किया गया स्पष्टीकरण दिया गया है।

बड़ी समस्या: "वन-शॉट" अनुमान (The "One-Shot" Guess)

कल्पना कीजिए कि आप यह समझने की कोशिश कर रहे हैं कि एक जटिल मशीन (जैसे कि एक आधुनिक AI) कैसे काम करती है। आप इसके अंदर उन विशिष्ट गियरों और लीवरों को खोजना चाहते हैं जो इसे कोई विशिष्ट कार्य करने में मदद करते हैं, जैसे कि गणित का प्रश्न हल करना।

वर्तमान में, वैज्ञानिक यह करने के लिए एक परीक्षण चलाते हैं और फिर परिणामों को "प्रूनिंग" (छंटाई) करते हैं। इसे एक माली की तरह समझें जो मुख्य शाखाओं को खोजने के लिए एक विशाल, अनियंत्रित झाड़ी की छंटाई करता है।

  • समस्या: माली को यह तय करना होता है कि कितनी छंटाई करनी है। यदि वे थोड़ी सी छंटाई करते हैं, तो उन्हें एक विशाल, बिखरी हुई झाड़ी मिलती है। यदि वे बहुत अधिक काट देते हैं, तो वे गलती से एक महत्वपूर्ण शाखा भी काट सकते हैं।
  • मुद्दा: काटने की कोई "परफेक्ट" मात्रा नहीं है। यदि वैज्ञानिक अपने निर्णय में थोड़ा सा भी बदलाव करता है (जैसे, "मैं 89% के बजाय 90% काटूँगा"), तो उसे पूरी तरह से अलग सेट की शाखाएं मिल सकती हैं। यह व्याख्या को भंगुर (brittle) और अविश्वसनीय बना देता है। यह ऐसा है जैसे हर बार रास्ता पूछने पर आपको एक अलग नक्शा मिले, जो इस बात पर निर्भर करता है कि नक्शा बनाने वाले ने किस दिशा-सूचक यंत्र (compass) का उपयोग किया था।

समाधान: CIRCUS (विशेषज्ञों की समिति - The "Committee of Experts")

इस पेपर के लेखक, स्वप्निल पारेख, CIRCUS (Stability Ensembles के माध्यम से अनिश्चितता में सर्किट कंसेंसस) नामक एक विधि प्रस्तावित करते हैं।

एक अकेले माली से झाड़ी को एक बार काटने और सबसे अच्छे परिणाम की उम्मीद करने के बजाय, CIRCUS मालियों की एक पूरी समिति से एक ही झाड़ी को काटने के लिए कहता है, लेकिन प्रत्येक माली थोड़े अलग नियमों का उपयोग करता है।

  1. एन्सेम्बल (समिति): कंप्यूटर थोड़े अलग सेटिंग्स (विभिन्न "प्रूनिंग थ्रेशोल्ड") के साथ विश्लेषण को कई बार चलाता है।
  2. मतदान (The Vote): सभी माली अपना काम पूरा करने के बाद, सिस्टम शाखाओं को देखता है।
    • यदि हर एक माली ने एक विशिष्ट शाखा को रखा, तो वह शाखा 100% स्थिर (stable) है। यह एक "कोर" (Core) शाखा है।
    • यदि केवल आधे मालियों ने एक शाखा को रखा, तो वह आकस्मिक (contingent) है (यह महत्वपूर्ण हो सकती है, लेकिन यह अस्थिर है)।
    • यदि केवल एक माली ने इसे रखा, तो यह संभवतः शोर (noise) है (केवल एक रैंडम आर्टिफैक्ट)।
  3. सर्वसम्मति (The Consensus): अंतिम "सर्किट" केवल उन्हीं शाखाओं से बनाया जाता है जिन पर सभी सहमत थे।

जादुई परिणाम

इस पेपर ने दो लोकप्रिय AI मॉडलों (Gemma और Llama) पर परीक्षण किया और कुछ आश्चर्यजनक चीजें पाईं:

  • छोटा लेकिन शक्तिशाली: "कोर" सर्किट (वह शाखाएं जिन पर सभी सहमत थे) कुल बिखराव की तुलना में 40 गुना छोटा था, जो तब मिलता जब आप सभी मालियों के काम को मिला देते। फिर भी, इसने लगभग उतना ही समझाया जितना कि AI के सोचने के तरीके को।
  • रैंडम से बेहतर: यदि आप उस बिखराव को लेते और केवल "सबसे मुखर" (loudest) शाखाओं को चुनकर उसे उसी छोटे आकार तक काटने की कोशिश करते, तो वह 'कंसेंसस' पद्धति की तुलना में कम समझा पाता। "सहमति" वाली विधि केवल बड़े टुकड़ों को चुनने से कहीं अधिक स्मार्ट है।
  • वास्तविक कार्य-कारण संबंध (Real Causality): यह साबित करने के लिए कि ये शाखाएं वास्तव में काम करती हैं, शोधकर्ताओं ने एक "सर्जरी" (जिसे एक्टिवेशन पैचिंग कहा जाता है) की। उन्होंने AI के मस्तिष्क के हिस्सों को कंसेंसस द्वारा पहचाने गए हिस्सों के साथ बदल दिया। AI बिल्कुल सही ढंग से काम करता रहा। जब उन्होंने इसमें रैंडम हिस्से डाले, तो वह विफल हो गया। इससे सिद्ध हुआ कि कंसेंसस सर्किट वास्तविक रूप से कार्यशील (causally real) है, न कि केवल एक भाग्यशाली अनुमान।

"कोर, कॉन्टिनजेंट, नॉइज़" वर्गीकरण (The "Core, Contingent, Noise" Taxonomy)

CIRCUS आपको केवल एक उत्तर नहीं देता; यह आपको तीन श्रेणियों के साथ एक रिपोर्ट कार्ड देता है:

  1. कोर (The Rock - चट्टान): ये वे किनारे (कनेक्शन) हैं जो हर दृश्य में दिखाई दिए। ये भरोसेमंद, ऑडिट योग्य तथ्य हैं। आप इन पर दांव लगा सकते हैं।
  2. कॉन्टिनजेंट (The Maybe - शायद): ये कुछ दृश्यों में दिखाई दिए लेकिन अन्य में नहीं। ये "वैकल्पिक मार्ग" हैं। यदि 'कोर' मुख्य राजमार्ग है, तो ये सुंदर ग्रामीण रास्ते हैं जो काम कर सकते हैं, लेकिन केवल कुछ विशेष परिस्थितियों में।
  3. नॉइज़ (The Static - शोर): ये शायद ही कभी दिखाई दिए। ये संभवतः विशिष्ट सेटिंग्स के कारण उत्पन्न ग्लिच या आर्टिफैक्ट हैं। आप इन्हें सुरक्षित रूप से अनदेखा कर सकते हैं।

यह क्यों महत्वपूर्ण है?

इसे एक जूरी ट्रायल की तरह समझें।

  • पुराना तरीका: एक जज सबूतों को देखता है और फैसला सुनाता है। यदि जज का दिन खराब था या उसमें थोड़ा पूर्वाग्रह था, तो फैसला गलत हो सकता है।
  • CIRCUS तरीका: आपके पास 25 लोगों की एक जूरी है। यदि 25/25 लोग सहमत हैं कि प्रतिवादी दोषी है, तो वह एक मजबूत, स्थिर फैसला है। यदि केवल 13/25 सहमत हैं, तो आप जानते हैं कि वहां अनिश्चितता है, और आपको इसे एक तथ्य के रूप में नहीं मानना चाहिए।

सारांश

CIRCUS एक ऐसा टूल है जो वैज्ञानिकों को इस बात पर भरोसा करने से रोकता है कि AI कैसे काम करता है, इसकी केवल एक नाजुक व्याख्या कितनी सही है। इसके बजाय, यह विश्लेषण को कई बार चलाता है, उस "साझा आधार" को खोजता है जहाँ सभी सहमत होते हैं, और आपको AI के मस्तिष्क का एक छोटा, अत्यंत विश्वसनीय और भरोसेमंद नक्शा देता है, जबकि उन हिस्सों को स्पष्ट रूप से चिह्नित करता है जो अभी भी अनिश्चित हैं।

यह कहने के बीच का अंतर है, "मुझे लगता है कि यह रास्ता है," और यह कहने का कि, "हमें 100% यकीन है कि यह रास्ता है, और यहाँ वे अन्य रास्ते भी हैं जिनके बारे में हम अभी निश्चित नहीं हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →