← नवीनतम पेपर
🤖 machine learning

Architecture Determines Observability in Transformers

यह शोध पत्र प्रदर्शित करता है कि एक ट्रांसफार्मर की अपने स्वयं के निर्णय की गुणवत्ता के बारे में संकेतों को आंतरिक रूप से संरक्षित करने की क्षमता (अवलोकनीयता) एक सामान्य गुण नहीं है, बल्कि विशिष्ट वास्तुशिल्प विकल्पों और प्रशिक्षण विधियों द्वारा निर्धारित एक उभरत् विशेषता है, जो अक्सर उन मॉडलों में भी समाप्त हो जाती है जो अन्यथा कम लॉस (loss) प्राप्त करते हैं।

मूल लेखक: Thomas Carmichael

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Thomas Carmichael

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी समस्या: "आत्मविश्वासी झूठा" (The Confident Liar)

कल्पना कीजिए कि आप एक AI छात्र के साथ परीक्षा दे रहे हैं। कभी-कभी, यह छात्र गलत उत्तर देता है, लेकिन उसे पूरा विश्वास होता है कि वह सही है। वह कहता है, "मुझे पूरा भरोसा है कि यह फ्रांस की राजधानी है!" जबकि वह लिख रहा होता है "बर्लिन।"

वर्तमान सुरक्षा उपकरण (जिन्हें "कॉन्फिडेंस मॉनिटर्स" कहा जाता है) इस बात पर नज़र रखते हैं कि AI कितनी निश्चितता से बोल रहा है। यदि AI आत्मविश्वास से भरा लगता है, तो वह उपकरण मान लेता है कि वह सही है। लेकिन जैसा कि यह शोध पत्र दिखाता है, ये उपकरण उन गलतियों को पकड़ने में विफल रहते हैं जहाँ AI आत्मविश्वास के साथ गलत होता है।

समाधान: "फुसफुसाहट" को सुनना (Listening to the "Whispers")

शोधकर्ताओं ने पाया कि भले ही AI कह रहा हो कि वह आश्वस्त है, उसका आंतरिक मस्तिष्क (यानी "हिडन लेयर्स") एक अलग कहानी फुसफुसा सकता है। यह बिल्कुल वैसा ही है जैसे कोई व्यक्ति कह रहा हो "मैं ठीक हूँ!" जबकि उसके हाथ कांप रहे हों।

यदि आप उन आंतरिक फुसफुसाहटों (यानी "एक्टिवेशन्स") को सुन सकते हैं, तो आप उन गलतियों को पकड़ सकते हैं जिन्हें कॉन्फिडेंस मॉनिटर मिस कर देता है। शोध पत्र इस क्षमता को ऑब्जर्वेबिलिटी (Observability) कहता है: यानी AI की मध्य परतों (middle layers) से उसके आंतरिक "सच" को पढ़ने की क्षमता।

ट्विस्ट: यह बुद्धिमत्ता के बारे में नहीं, ब्लूप्रिंट के बारे में है

सबसे चौंकाने वाली खोज यह है कि सभी AI मॉडल में ये "फुसफुसाहटें" नहीं होतीं।

AI मॉडल्स को घरों की तरह समझें।

  • "स्वस्थ" घर (The "Healthy" House): कुछ ब्लूप्रिंट्स (नक्शे) ऐसे बनाए जाते हैं जिनमें घर के बीच में एक विशेष, शांत गलियारा होता है। भले ही सामने का दरवाजा (आउटपुट) कहे कि "सब कुछ ठीक है," आप उस गलियारे में जाकर फर्श की चरचराहट (त्रुटि संकेत/error signal) सुन सकते हैं जो बताती है कि कुछ गलत है।
  • "धंसा हुआ" घर (The "Collapsed" House): अन्य ब्लूप्रिंट्स अलग तरह से बनाए जाते हैं। इन घरों में, गलियारा या तो सील कर दिया जाता है या कंक्रीट से भर दिया जाता है। भले ही घर ढह रहा हो, मध्य परतें शांत रहती हैं। आप त्रुटि संकेत को नहीं सुन सकते, चाहे आप कितनी भी कोशिश क्यों न कर लें।

यह पेपर साबित करता है कि क्या किसी घर में यह "फुसफुसाने वाला गलियारा" है, यह पूरी तरह से ब्लूप्रिंट (आर्किटेक्चर) और निर्माण टीम (ट्रेनिंग रेसिपी) पर निर्भर करता है, न कि इस पर कि घर कितना बड़ा या स्मार्ट है।

प्रमाण: "पाइथिया" प्रयोग (The "Pythia" Experiment)

शोधकर्ताओं ने इसे Pythia नामक मॉडल्स के एक नियंत्रित सेट का उपयोग करके परखा। उन्होंने बिल्कुल समान सामग्री और निर्माण नियमों का उपयोग करके कई घर बनाए, लेकिन ब्लूप्रिंट में थोड़ा बदलाव किया।

  • परिणाम: उन्होंने पाया कि एक विशिष्ट ब्लूप्रिंट (24 लेयर्स, 16 हेड्स) हमेशा एक "धंसा हुआ" (Collapsed) घर ही बनाता था। चाहे उन्होंने घर का आकार कितना भी बदला हो (छोटा से विशाल) या ईंटों के प्रकार (अलग-अलग डेटा सेट्स) को कितना भी बदला हो, वह विशिष्ट ब्लूप्रिंट हमेशा गलियारे को बंद कर देता था।
  • विपरीत स्थिति: अन्य ब्लूप्रिंट्स (जैसे 16 लेयर्स या 32 हेड्स) गलियारे को खुला और "स्वस्थ" रखते थे, जिससे त्रुटि संकेत को सुना जा सकता था।

इसका अर्थ है कि आपके पास एक छोटा मॉडल हो सकता है जिसे त्रुटियों के लिए मॉनिटर किया जा सकता है, और एक विशाल मॉडल हो सकता जिसे नहीं किया जा सकता, और यह सब केवल ब्लूप्रिंट के कारण होता है।

"ट्रेनिंग" का रहस्य: गलियारा कब सील हुआ?

शोधकर्ताओं ने निर्माण प्रक्रिया को वास्तविक समय में देखा (ट्रेनिंग के दौरान चेकपॉइंट्स देखते हुए)।

  • शुरुआत में: दोनों "स्वस्थ" और "धंसे हुए" ब्लूप्रिंट्स के साथ गलियारा खुला था। संकेत मौजूद था।
  • निर्माण के दौरान: जैसे-जैसे ट्रेनिंग जारी रही, "धंसे हुए" ब्लूपिंट ने सक्रिय रूप से संकेत को मिटा (erase) दिया। निर्माण टीम (ट्रेनिंग प्रक्रिया) ने गलियारे को कंक्रीट से भर दिया।
  • परिणाम: जब तक घर बनकर तैयार हुआ, संकेत गायब हो चुका था। मॉडल अभी भी पूरी तरह से बोलना सीख रहा था (अपने काम में बेहतर हो रहा था), लेकिन उसने यह "जानने" की क्षमता खो दी थी कि वह कब गलती कर रहा है।

क्या यह वास्तविक दुनिया में काम करता है?

शोधकर्ताओं ने एक "सुनने वाले" (प्रोब) को प्रशिक्षित किया जो सामान्य टेक्स्ट (विकिपीडिया) पर आधारित था, और फिर इसका परीक्षण चिकित्सा संबंधी प्रश्नों और रीडिंग कॉम्प्रिहेन्शन जैसे विशिष्ट कार्यों पर किया।

  • कैच (Catch): "स्वस्थ" ब्लूप्रिंट वाले मॉडल्स में, इस सुनने वाले ने उन गलतियों में से लगभग 10-13% को पकड़ा जिन्हें कॉन्फिडेंस मॉनिटर मिस कर गया था। ये वे त्रुटियाँ थीं जहाँ AI आत्मविश्वास के साथ गलत था।
  • सीमा (Limit): "धंसे हुए" ब्लूप्रिंट वाले मॉडल्स में, सुनने वाले को कुछ सुनाई नहीं दिया। यह एक साउंडप्रूफ कमरे में फुसफुसाहट सुनने की कोशिश करने जैसा था।

निचोड़ (The Bottom Line)

AI मॉडल चुनना एक सुरक्षा संबंधी निर्णय है।

यदि आप AI को आत्मविश्वास भरी गलतियों के लिए मॉनिटर करना चाहते हैं, तो आप केवल सबसे बड़े या सबसे स्मार्ट मॉडल को नहीं चुन सकते। आपको वह मॉडल चुनना होगा जिसमें सही ब्लूप्रिंट हो।

  • यदि ब्लूप्रिंट "धंसा हुआ" (collapsed) है, तो कोई भी बेहतर मॉनिटरिंग सॉफ्टवेयर काम नहीं आएगा। संकेत वहां है ही नहीं जिसे ढूंढा जा सके।
  • यदि ब्लूप्रिंट "स्वस्थ" (healthy) है, तो आप ऐसे मॉनिटर बना सकते हैं जो उन गलतियों को पकड़ सकें जिन्हें AI छिपाने की कोशिश करता है।

संक्षेप में: आप एक बेहतर माइक्रोफ़ोन खरीदकर खराब मॉनिटर को ठीक नहीं कर सकते यदि कमरा खुद साउंडप्रूफ है। आपको कमरे को शुरू से ही अलग तरह से बनाना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →