← नवीनतम पेपर
💬 NLP

A Hyperbolicity Atlas of Large Language Model Hidden States

यह शोध पत्र पहला व्यवस्थित अध्ययन प्रस्तुत करता है जो यह प्रदर्शित करता है कि LLM हिडन स्टेट्स (hidden states) में ग्रोमोव हाइपरबोलिसिटी (Gromov hyperbolicity) मुख्य रूप से लेयर डेप्थ (layer depth) द्वारा संचालित होती है—जो मध्य परतों में चरम पर होती है और अंतिम परतों में अधिक ट्री-लाइक (tree-like) हो जाती है—न कि मॉडल स्केल द्वारा, जो विभिन्न मॉडल परिवारों और इनपुट डोमेनों में पदानुक्रमित दूरी संरचनाओं (hierarchical distance structures) को समझने के लिए एक व्यावहारिक डायग्नोस्टिक प्रदान करती है।

मूल लेखक: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

प्रकाशित 2026-09-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhichao Yang, Yuanze Hu, Gen Li, Qingchen Yu, Shiying Duan, Xinyu Wang, Ye Qiu, Zeming Liu, Guangxu Chen, Zhaoxin Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक कृत्रिम बुद्धिमत्ता (आर्टिफिशियल इंटेलिजेंस) को संचालित करने वाले कंप्यूटरों के भीतर, संख्याओं की एक छिपी हुई दुनिया है। जब ये मशीनें किसी वाक्य को पढ़ती हैं या किसी प्रश्न को संसाधित करती हैं, तो वे शब्दों को टेक्स्ट के रूप में संग्रहीत नहीं करती हैं। इसके बजाय, वे प्रत्येक शब्द को संख्याओं की एक लंबी सूची, एक 'वेक्टर' में अनुवादित करती हैं, जो एक विशाल, बहु-आयामी स्थान में मौजूद होता है। वर्षों से, वैज्ञानिक जानते हैं कि ये मशीनें जिन चीजों को संसाधित करती हैं—जैसे कि एक पारिवारिक वंशावली की संरचना, एक कोड प्रोग्राम के चरण, या एक कहानी का तर्क—वे अक्सर पदानुक्रमित (hierarchical) होती हैं। उनका एक शीर्ष, एक आधार और बीच में कई शाखाएं होती हैं। एक स्वाभाविक प्रश्न उठा: क्या वे संख्या-सूचियाँ जो मशीन इन चीजों को समझने के लिए बनाती है, क्या वे भी एक पेड़ जैसी आकृति में व्यवस्थित होती हैं? यदि मशीन का आंतरिक मानचित्र एक पेड़ जैसा दिखता है, तो इसका अर्थ यह हो सकता है कि कंप्यूटर सूचना को इस तरह से व्यवस्थित कर रहा है जो मानव भाषा और तर्क की जटिल संरचनाओं को प्रतिबिंबित करता है। इसे समझने के लिए, शोधकर्ताओं ने 'हाइपरबोलिसिटी' नामक एक गणितीय अवधारणा की ओर रुख किया, जो यह मापने के लिए एक पैमाने के रूप में कार्य करती है कि बिंदुओं का संग्रह कितना "पेड़ जैसा" है। कम स्कोर का अर्थ है कि बिंदु एक व्यवस्थित, शाखाओं वाली पदानुक्रम में व्यवस्थित हैं, जबकि उच्च स्कोर का अर्थ है कि वे अधिक अराजक, सपाट तरीके से बिखरे हुए हैं।

बीजिंग और गुआंगज़ौ के शोधकर्ताओं की एक टीम ने आज के सबसे उन्नत उपलब्ध भाषा मॉडलों में इस छिपी हुई ज्यामिति का मानचित्रण करने का लक्ष्य रखा। उन्होंने कोई नया मशीन नहीं बनाया और न ही मौजूदा मशीनों के काम करने के तरीके को बदला। इसके बजाय, उन्होंने मानचित्रकारों (cartographers) की भूमिका निभाई, दस अलग-अलग ओपन-सोर्स मॉडल लिए और उन्हें चार बहुत अलग प्रकार के कार्यों के माध्यम से भेजा: गणित की समस्याओं को हल करना, कंप्यूटर कोड लिखना, सामान्य ज्ञान के बारे में प्रश्नों के उत्तर देना, और कथनों की सत्यता का निर्णय लेना। इनपुट प्रॉम्प्ट्स के प्रत्येक शब्द के लिए, उन्होंने मशीन द्वारा बनाई गई संख्या-सूचियों के बीच की दूरी को मापा। उन्होंने 800,000 से अधिक विशिष्ट मापों के लिए यह कार्य किया, जिसमें दस अलग-अलग आकार के मॉडल और प्रत्येक मशीन के भीतर प्रसंस्करण (processing) की हर एक परत शामिल थी। उनका लक्ष्य एक एटलस बनाना था, एक विस्तृत मानचित्र जो यह दिखा सके कि इन मशीनों की आंतरिक संरचना कहाँ एक पेड़ की तरह दिखती है और कहाँ नहीं।

सबसे चौंकाने वाली खोज यह थी कि मशीन का आकार इस बात से कहीं अधिक महत्वपूर्ण था कि आप उसके भीतर कहाँ देख रहे हैं। कई लोग मानते हैं कि अधिक पैरामीटर वाला एक बड़ा मॉडल स्वतः ही "अधिक बुद्धिमान" या अधिक संरचित होता है। शोधकर्ताओं ने पाया कि यह काफी हद तक असत्य है। केवल एक मॉडल को बड़ा बनाने से उसकी आंतरिक संरचना लगातार अधिक पेड़ जैसी नहीं बनी। कुछ मामलों में, एक बड़ा मॉडल एक छोटे मॉडल की तुलना में वास्तव में कम संगठित था, और अन्य मामलों में, यह अधिक संगठित था। वास्तविक पैटर्न तब उभर कर आया जब उन्होंने मशीन के प्रसंस्करण की गहराई को देखा। जैसे-जैसे सूचना नेटवर्क की पहली परत से मध्य तक पहुँचती है, संरचना अव्यवस्थित और सपाट हो जाती है, जिससे वह अपने पेड़ जैसे आकार को खो देती है। मध्य परतों में संख्याएँ घनी और जटिल होती हैं, जो कई अलग-अलग प्रकार की सूचनाओं के मिश्रण को दर्शाती हैं। हालाँकि, जैसे ही डेटा अंतिम परतों तक पहुँचता है, उत्तर देने से ठीक पहले, संरचना नाटकीय रूप से बदल जाती है। संख्याएँ वापस एक बहुत ही स्पष्ट, अधिक पेड़ जैसी व्यवस्था में संकुचित हो जाती हैं। यह सुझाव देता है कि मशीन संभावनाओं के एक अराजक मिश्रण के साथ शुरू करती है और फिर अंत में उन्हें एक संरचित रूप में संकुचित कर देती है।

शोधकर्ताओं ने यह भी पाया कि विशिष्ट मॉडल का प्रकार और वह कार्य जिसके लिए उसे प्रशिक्षित किया गया था, मानचित्र को महत्वपूर्ण रूप से बदल देता है। बिल्कुल समान आकार के दो मॉडलों की आंतरिक ज्यामिति उनके प्रशिक्षण के आधार पर पूरी तरह से भिन्न हो सकती है। उदाहरण के लिए, प्रोग्रामिंग कार्यों को संसाधित करते समय एक विशेषज्ञ कोड मॉडल ने बहुत मजबूत पेड़ जैसी संरचना दिखाई, लेकिन सामान्य गणित के लिए प्रशिक्षित मॉडल ने गणित की समस्याओं को हल करने के लिए पूछे जाने पर भी ऐसा पैटर्न नहीं दिखाया। वास्तव में, विशेष कोड मॉडल ने कोड प्रॉम्प्ट्स की संरचना को सामान्य मॉडल की तुलना में अधिक पेड़ जैसा बना दिया, जबकि गणित-विशेषज्ञ मॉडल ने अपनी संरचना को अधिक जटिल बनाए रखा। इसका अर्थ है कि मशीन की सोच का "आकार" उसके आकार का एक स्थिर गुण नहीं है, बल्कि इस बात का लचीला परिणाम है कि उसे कैसे प्रशिक्षित किया गया है और वह वर्तमान में क्या कर रही है।

अंततः, यह अध्ययन कृत्रिम बुद्धिमत्ता सूचना को कैसे व्यवस्थित करती है, इसे समझने का एक नया तरीका प्रदान करता है। यह दिखाता है कि इन मॉडलों की आंतरिक दुनिया एक स्थिर, एकसमान परिदृश्य नहीं है। इसके बजाय, यह एक गतिशील यात्रा है जहाँ सूचना एक जटिल, सपाट अवस्था में शुरू होती है, एक भीड़भाड़ वाले मध्य भाग से गुजरती है, और अंत में एक संरचित, पेड़ जैसी आकृति में स्थिर हो जाती है। शोधकर्ता निष्कर्ष निकालते हैं कि केवल अंतिम उत्तर या मॉडल के कुल आकार को देखना पर्याप्त नहीं है। यह समझने के लिए कि ये मशीनें कैसे सोचती हैं, आपको सूचना द्वारा तय किए गए पथ को देखना होगा, यह देखते हुए कि सबसे महत्वपूर्ण संरचनात्मक परिवर्तन निर्णय लेने से ठीक पहले के अंतिम क्षणों में होते हैं। यह मानचित्र वैज्ञानिकों के लिए एक व्यावहारिक उपकरण प्रदान करता है कि वे देख सकें कि ये मॉडल अपने विचारों को कहाँ व्यवस्थित कर रहे हैं और कहाँ वे संघर्ष कर रहे हैं, जो यह प्रकट करता है कि बुद्धिमत्ता की ज्यामिति एक साधारण आकार के माप से कहीं अधिक सूक्ष्म है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →