← नवीनतम पेपर
💬 NLP

Why Linear Interpretability Works: Invariant Subspaces as a Result of Architectural Constraints

यह शोध पत्र यह प्रस्तावित करता है कि रैखिक व्याख्यात्मकता (linear interpretability) विधियाँ इसलिए सफल होती हैं क्योंकि ट्रांसफार्मर आर्किटेक्चर अपने रैखिक संचार इंटरफेस के माध्यम से अर्थ संबंधी जानकारी को संदर्भ-अपरिवर्तनीय रैखिक उप-स्थानों (context-invariant linear subspaces) में संकुचित करने के लिए बाध्य करते हैं, एक ऐसी घटना जिसे वे "इनवेरिएंट सबस्पेस नेसेसिटी" (Invariant Subspace Necessity) प्रमेय के रूप में औपचारिक रूप देते हैं।

मूल लेखक: Andres Saurez, Yousung Lee, Dongsoo Har

प्रकाशित 2026-02-11
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Andres Saurez, Yousung Lee, Dongsoo Har

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप समझने की कोशिश कर रहे हैं कि एक विशाल, जटिल शहर कैसे काम करता है। आप लाखों लोगों को चलते हुए, कारों को ड्राइव करते हुए और लाइटों को चमकते हुए देखते हैं। यह पूरी तरह से अराजकता—एक "नॉनलीनियर" (nonlinear) गड़बड़ी जैसा दिखता है। लेकिन फिर, आप कुछ नोटिस करते हैं: हर बार जब कोई हवाई अड्डे जाना चाहता है, तो वह एक विशिष्ट राजमार्ग (highway) का अनुसरण करता है। हर बार जब कोई भोजन खरीदना चाहता है, तो वह किराने की दुकान की ओर बढ़ता है।

भले ही शहर अराजक है, लेकिन बुनियादी ढांचा (सड़कें और संकेत) लोगों को वहां पहुंचने के लिए मजबूर करता है जहां उन्हें जाना है, जिससे वे अनुमानित, सीधी रेखाओं में चलते हैं।

यह पेपर समझाता है कि लार्ज लैंग्वेज मॉडल्स (जैसे ChatGPT) बिल्कुल इसी तरह काम करते हैं।

बड़ी मिस्ट्री: "अराजकता" इतनी व्यवस्थित क्यों है?

AI मॉडल्स अविश्वसनीय रूप से जटिल होते हैं। वे अरबों गणितीय कनेक्शनों से बने होते हैं जो "नॉनलीनियर" हैं—यानी वे घुमावदार, टेढ़े-मेढ़े और अविश्वसनीय रूप से जटिल हैं।

लंबे समय से, शोधकर्ताओं ने कुछ अजीब देखा है: भले ही AI का "मस्तिष्क" एक घुमावदार गड़बड़ी है, यदि आप इसे एक साधारण "सीधी रूलर" (जिसे लिनियर प्रोब/Linear Probe कहा जाता है) के साथ देखते हैं, तो आप आसानी से चीजों को ढूंढ सकते हैं। आप न्यूरॉन्स के एक समूह की ओर एक सीधी रेखा खींचकर कह सकते हैं, "आहा! यह दिशा 'फ्रांस' का प्रतिनिधित्व करती है।"

बड़ा सवाल यह था: क्यों? क्यों एक घुमावदार, जटिल मस्तिष्क हमें अर्थ खोजने के लिए एक साधारण, सीधी रूलर का उपयोग करने की अनुमति देता है?

खोज: "हाईवे" का प्रतिबंध

इस पेपर के लेखक तर्क देते हैं कि यह कोई संयोग नहीं है। यह AI के आर्किटेक्चर (संरचना) के कारण है।

AI को एक विशाल संचार नेटवर्क के रूप में सोचें। AI को अपने आप से "बात" करने और एक परत से दूसरी परत तक जानकारी भेजने के लिए, उसे कुछ "इंटरफेस" (जैसे अटेंशन मैकेनिज्म) का उपयोग करना होगा। ये इंटरफेस सीधे राजमार्गों की तरह काम करते हैं।

लेखक एक गणितीय नियम सिद्ध करते हैं: यदि आप सूचना का एक विशिष्ट हिस्सा (जैसे "फ्रांस" की अवधारणा) एक सीधे राजमार्ग के माध्यम से भेजना चाहते हैं, तो उस सूचना को अनिवार्य रूप से एक सीधी रेखा में ही यात्रा करनी होगी।

यदि सूचना घुमावदार, अप्रत्याशित तरीके से चलती, तो वह "हाईवे" इंटरफेस से टकराने पर खो जाती या बिगड़ जाती। इसलिए, कुशल होने के लिए, AI को अपने "विचारों/अवधारणाओं" को सीधी, अनुमानित दिशाओं में व्यवस्थित करने के लिए मजबूर किया जाता है।

"सेल्फ-रेफरेंस" ट्रिक: नाम ही मानचित्र है

यह एक अद्भुत खोज की ओर ले जाता है जिसे लेखक सेल्फ-रेफरेंस प्रॉपर्टी (Self-Reference Property) कहते हैं।

कल्पना कीजिए कि आप एक विशाल, अंधेरे पुस्तकालय में हैं। आप "सेब" (Apples) की अवधारणा की तलाश कर रहे हैं। बिना किसी उद्देश्य के भटकने के बजाय, आपको "Apple" शीर्षक वाली एक अकेली किताब मिलती है। लेखकों ने पाया कि AI में, "Apple" शब्द स्वयं एक कम्पास की सुई की तरह कार्य करता है।

यदि आप "Apple" शब्द की गणितीय "दिशा" को देखते हैं, तो वह दिशा ठीक उसी दिशा की ओर इशारा करती है जहाँ सेब से जुड़ी अन्य सभी चीजें हैं—जैसे "फल", "लाल", "कुरकुरा", या "न्यूटन"। शब्द केवल अवधारणा का प्रतिनिधित्व नहीं करता; बल्कि यह अवधारणा को खोजने के लिए मानचित्र (Map) भी प्रदान करता है।

यह क्यों महत्वपूर्ण है (इसका महत्व क्या है?)

यह पेपर तीन कारणों से बहुत बड़ी बात है:

  1. यह बताता है कि हमारे उपकरण क्यों काम करते हैं: अब हम जानते हैं कि "लिनियर प्रोब्स" (साधारण रूलर) इसलिए काम करते हैं क्योंकि AI के "रास्ते" उसे व्यवस्थित होने के लिए मजबूर करते हैं, न कि इसलिए कि AI सरल है।
  2. जीरो-शॉट अंडरस्टैंडिंग (Zero-Shot Understanding): इसका मतलब है कि हम AI को "सिखाए" बिना नए कॉन्सेप्ट्स को ढूंढ सकते हैं। हम बस एक शब्द पकड़ सकते हैं, उसे कम्पास की तरह उपयोग कर सकते हैं, और देख सकते हैं कि AI उस दिशा में और क्या सोचता है।
  3. विज्ञान का एकीकरण: यह AI को देखने के दो अलग-अलग तरीकों (स्पार्स ऑटोएनकोडर्स और लिनियर प्रोब्स) को जोड़ता है, यह सिद्ध करते हुए कि दोनों एक ही "हाईवे" को देख रहे हैं।

संक्षेप में: AI का मस्तिष्क एक जंगली, घूमता हुआ तूफान है, लेकिन क्योंकि इसे सीधे रास्तों के माध्यम से संवाद करना पड़ता है, यह अर्थ के संगठित "हाईवे" बनाता है जिन्हें हम अंततः मैप कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →