← नवीनतम पेपर
💻 computer science

Transformer Geometry Observatory TGO-I: Spectral Geometry Observatory

यह शोध पत्र विजन ट्रांसफॉर्मर के स्पेक्ट्रल ज्योमेट्री का विश्लेषण करने के लिए ट्रांसफॉर्मर ज्योमेट्री ऑब्जर्वेटरी (TGO) फ्रेमवर्क, विशेष रूप से TGO-I को प्रस्तुत करता है और यह प्रकट करता है कि प्रशिक्षण प्रगतिशील रूप से प्रतिनिधित्व संबंधी आयामों (representational dimensions) में वेरिएंस को पुनर्वितरित करता है, जिससे सूचना संकेंद्रण (information concentration) की अंतर्ज्ञान के विपरीत प्रभावी आयामशीलता में वृद्धि और एनिसोट्रॉपी (anisotropy) में कमी आती है।

मूल लेखक: Kaustubh Kapil, Kishor P. Upla

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kaustubh Kapil, Kishor P. Upla

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, जटिल मशीन है जिसे विज़न ट्रांसफॉर्मर (ViT) कहा जाता है। यह मशीन चित्रों को देखने और उनमें क्या है, इसे समझने के लिए बनाई गई है। लंबे समय से, वैज्ञानिक इस बात को लेकर जुनूनी रहे हैं कि मशीन क्या निर्णय लेती है (जैसे, "वह एक बिल्ली है!") या वह कैसे ध्यान केंद्रित करती है (जैसे, "यह कानों की ओर देख रही है")।

लेकिन यह शोध पत्र, TGO-I, एक अलग सवाल पूछता है: "सीखते समय मशीन का आंतरिक 'मस्तिष्क' वास्तव में कैसा दिखता है?"

इस मशीन के मस्तिष्क को तथ्यों की एक सूची के रूप में नहीं, बल्कि एक विशाल, बहु-आयामी कमरे के रूप में सोचें जहाँ जानकारी रहती है। लेखकों ने एक विशेष "ऑब्जर्वेटरी" (उपकरणों का एक सेट) बनाया है ताकि वे देख सकें कि प्रशिक्षण के दौरान इस कमरे का आकार कैसे बदलता है।

यहाँ उन्होंने जो पाया, उसकी कहानी सरल रूप में दी गई है:

1. सेटअप: कमरे के विकास को देखना

शोधकर्ताओं ने 100 प्रकार के चित्रों (इंटरनेट के एक छोटे संस्करण की तरह) के डेटासेट पर एक विज़न ट्रांसफॉर्मर को प्रशिक्षित किया। उन्होंने केवल अंतिम उत्तर ही नहीं देखा; बल्कि उन्होंने प्रशिक्षण के हर चरण में (पहले दिन से सौवें दिन तक) मशीन के भीतर झाँककर देखा।

उन्होंने डेटा की "ज्यामिति" (geometry) को मापा। कल्पना कीजिए कि डेटा एक कमरे में बिंदुओं के बादल की तरह है।

  • शुरुआत में: बादल एक दीवार के साथ बहुत सपाट हो सकता है (बहुत संकीर्ण)।
  • बाद में: क्या यह सपाट रहता है? क्या यह फैलता है? क्या यह पूरे कमरे को भर देता है?

2. बड़ी आश्चर्यजनक बात: "फैलने का प्रभाव" (The "Spreading Out" Effect)

सामान्य समझ यह सुझाव दे सकती है कि जैसे-जैसे एक मशीन स्मार्ट होती है, उसे अधिक केंद्रित होना चाहिए। आप सोच सकते हैं, "इसे सबसे महत्वपूर्ण चीजों को सीखना चाहिए और बाकी को अनदेखा करना चाहिए, अपनी सारी जानकारी को कुछ चुनिकी, शक्तिशाली दिशाओं में समेट लेना चाहिए।"

शोध पत्र में इसके ठीक विपरीत पाया गया।

एक तंग कोने में सिमटने के बजाय, मशीन का आंतरिक प्रतिनिधित्व (representation) पूरे कमरे को भरने के लिए फैल गया

  • उपमा: कल्पना कीजिए कि एक अंधेरे कमरे में लोगों का एक समूह है। शुरुआत में, हर कोई एक तंग घेरे में सिमटा हुआ है, एक ही चीज़ चिल्ला रहा है। जैसे-जैसे "प्रशिक्षण" होता है, वे और अधिक सिमटते नहीं हैं। इसके बजाय, वे धीरे-धीरे एक-दूसरे से दूर जाते हैं, पूरे कमरे को भरने के लिए फैल जाते हैं, और प्रत्येक व्यक्ति जानकारी का एक अनूठा हिस्सा रखता है।
  • परिणाम: "प्रभावी रैंक" (Effective Rank - एक फैंसी तरीका यह कहने का कि "कितनी अलग-अलग दिशाओं का उपयोग किया जा रहा है") बढ़ गई। "एनिसोट्रॉपी" (Anisotropy - यह मापने का तरीका कि आकार कितना टेढ़ा-मेढ़ा या दबा हुआ है) कम हो गई

3. "CLS टोकन": परम संगठक

इन मशीनों में, एक विशेष टोकन होता है जिसे CLS टोकन कहा जाता है। इसे "क्लास प्रेसिडेंट" या "टीम कैप्टन" के रूप में सोचें जो अंतिम निर्णय लेने के लिए बाकी समूह से सारी जानकारी एकत्र करता है।

शोध पत्र में पाया गया कि यह "कैप्टन" इस कमरे का सबसे दिलचस्प हिस्सा बन गया।

  • प्रशिक्षण के अंत तक, CLS टोकन का आंतरिक स्थान सबसे अधिक फैला हुआ था।
  • इसका आकार सबसे कम दबा हुआ (सबसे कम एनिसोट्रॉपी) था।
  • यह जानकारी रखने के लिए सबसे अधिक आयामों (dimensions) का उपयोग कर रहा था।

यह ऐसा है जैसे टीम कैप्टन ने केवल कुछ प्रमुख तथ्यों को याद नहीं किया; बल्कि उन्होंने पूरी टीम को व्यवस्थित किया ताकि प्रत्येक सदस्य का अनूठा दृष्टिकोण संरक्षित और उपयोग किया जा सके।

4. "विकर्ण" पैटर्न (The "Diagonal" Pattern)

शोधकर्ताओं ने यह भी देखा कि मशीन के मस्तिष्क के विभिन्न हिस्से एक-दूसरे से कैसे बात करते हैं (सहसंबंध/correlations)।

  • शुरुआत में: हिस्से बहुत उलझे हुए और एक-दूसरे पर निर्भर थे (जैसे हेडफ़ोन की एक गांठ)।
  • बाद में: "गांठ" सुलझ गई। हिस्से अधिक स्वतंत्र हो गए।
  • दृश्य: यदि आप इन कनेक्शनों का मानचित्र बनाते, तो यह एक साफ विकर्ण रेखा (diagonal line - जहाँ चीजें केवल स्वयं से बात करती हैं) की तरह दिखने लगता, न कि क्रॉस-कनेक्शन के एक उलझे हुए जाल की तरह। इसका मतलब है कि मशीन ने अपने विभिन्न फीचर्स को अलग और गैर-दोहराव वाला (non-redundant) बनाए रखना सीख लिया।

5. यह क्यों हुआ? (सिद्धांत)

शोध पत्र यह नहीं कहता कि ऐसा ठीक क्यों हुआ, लेकिन वे तीन अनुमान (परिकल्पनाएं) देते हैं:

  1. टोकन विविधीकरण (Token Diversification): मशीन ने चित्र के हर हिस्से (हर "टोकन") को अनूठा और विशिष्ट बनाना सीखा, ताकि उन्हें अपना अलग स्थान मिल सके।
  2. सिमेंटिक विस्तार (Semantic Expansion): मशीन ने अधिक से अधिक अलग "अर्थों" या फीचर्स की खोज की, इसलिए उसे उन सभी को संग्रहीत करने के लिए अधिक स्थान की आवश्यकता थी।
  3. अतिरेक में कमी (Redundancy Reduction): मशीन ने खुद को दोहराना बंद कर दिया। तीन फीचर्स जो एक ही बात कहते हैं, रखने के बजाय, उन्होंने उन्हें इस तरह पुनर्गठित किया कि प्रत्येक फीचर कुछ नया और उपयोगी कहे।

मुख्य निष्कर्ष

TGO-I का मुख्य बिंदु यह है कि हमारे पास अब AI सीखने को "देखने" का एक नया तरीका है। हम सोचते थे कि सीखने का अर्थ अधिक केंद्रित और संकीर्ण होना है। यह शोध पत्र दिखाता है कि, कम से कम विज़न ट्रांसफॉर्मर्स के लिए, सीखना सूचना को एक विस्तृत, सपाट और कुशल परिदृश्य में विस्तारित करने और वितरित करने जैसा है।

लेखक इसे "ट्रांसफॉर्मर ज्योमेट्री ऑब्जर्वेटरी" कहते हैं। वे अभी शुरुआत कर रहे हैं; यह पहला "भाग" (TGO-I) है जिसने डेटा के आकार को देखा। वे भविष्य में और अधिक ऑब्जर्वेटरी बनाने की योजना बना रहे हैं ताकि यह देख सकें कि "टीम कैप्टन" कैसे चलता है, "अटेंशन" कैसे काम करता है, और मशीन अपने पथ को कैसे अनुकूलित करती है।

संक्षेप में: मशीन अपने फोकस को संकुचित करके स्मार्ट नहीं हुई; बल्कि वह अपने पूरे मस्तिष्क का उपयोग करना सीखकर, अपनी जानकारी को समान रूप से फैलाकर स्मार्ट बनी, ताकि कुछ भी बर्बाद न हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →