← नवीनतम पेपर
💬 NLP

Hierarchical Concept Geometry in Language Models Emerges from Word Co-occurrence

यह शोध पत्र एक वितरण संबंधी सिद्धांत (distributional theory) प्रस्तावित और मान्य करता है जो यह दर्शाता है कि भाषा मॉडलों में अवधारणाओं की पदानुक्रमित ज्यामितीय संरचना विशेष कार्यात्मक तंत्रों की आवश्यकता के बजाय शब्द सह-उपस्थिति सांख्यिकी के स्पेक्ट्रल गुणों से स्वाभाविक रूप से उभरती है।

मूल लेखक: Andres Nava, Matthieu Wyart

प्रकाशित 2026-05-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andres Nava, Matthieu Wyart

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक विशाल, अव्यवस्थित पुस्तकालय है जहाँ हर किताब एक शब्द है। इस पुस्तकालय में, जो किताबें समान विषयों के बारे में बात करती हैं, वे एक ही शेल्फ पर या एक ही बातचीत में दिखाई देती हैं। यह शोध पत्र तर्क देता है कि कंप्यूटर जिस तरह से भाषा को समझते हैं (उसकी ज्यामिति या आकार और व्यवस्था) वह किसी जटिल, पूर्व-निर्धारित नियम पुस्तिका द्वारा नहीं बनाया गया है जो उन्हें अवधारणाओं को व्यवस्थित करने के लिए निर्देश दे, बल्कि यह संरचना स्वाभाविक रूप से उभरती है, जैसे मिट्टी से एक पेड़ उगता है, केवल इसलिए क्योंकि संबंधित शब्द अक्सर एक साथ दिखाई देते हैं।

यहाँ सरल उपमाओं का उपयोग करके शोध के निष्कर्षों का विवरण दिया गया है:

1. मुख्य विचार: "सह-उपस्थिति" (Co-occurrence) का बगीचा

भाषा सीखने को एक बगीचा लगाने की तरह समझें।

  • बीज: बीज शब्द हैं (जैसे "कुत्ता", "बिल्ली", "जानवर")।
  • मिट्टी: मिट्टी वह टेक्स्ट है जिसे कंप्यूटर पढ़ता है (जैसे विकिपीडिया)।
  • नियम: यदि दो बीज मिट्टी में एक-दूसरे के करीब लगाए जाते हैं (अर्थात शब्द वाक्यों में एक-दूसरे के पास दिखाई देते हैं), तो वे जड़ें फैलाते हैं जो आपस में उलझ जाती हैं।

लेखक एक सरल नियम प्रस्तावित करते हैं: जो शब्द अर्थ में "करीब" होते हैं (जैसे "कुत्ता" और "पिल्ला"), वे टेक्स्ट में उन शब्दों की तुलना में बहुत अधिक बार एक साथ दिखाई देते हैं जो एक-दूसरे से "दूर" होते हैं (जैसे "कुत्ता" और "चट्टान")।

2. खोज: "स्पेक्ट्रल स्प्लिटिंग" (Spectral Splitting) का पेड़

जब आप इन उलझी हुई जड़ों (शब्द कितनी बार एक साथ आते हैं इसके सांख्यिकीय डेटा) को लेते हैं और उन्हें उनके आकार को देखने के लिए समतल करने की कोशिश करते हैं, तो कुछ जादुई होता है। कंप्यूटर केवल एक रैंडम ढेर नहीं बनाता; वह एक पदानुक्रमित पेड़ (hierarchical tree) बनाता है।

एक बड़े, बहु-मंजिला अपार्टमेंट बिल्डिंग की कल्पना करें:

  • पहली मंजिल (सबसे व्यापक विभाजन): कंप्यूटर का पहला "विचार" पूरी इमारत को दो विशाल विंग्स में विभाजित करता है: जानवर बनाम पौधे। यह सबसे बड़ा, सबसे स्पष्ट अंतर है।
  • दूसरी मंजिल (मध्यम विभाजन): "जानवर" विंग के अंदर, अगला स्तर के विचार इसे पक्षी बनाम मछली में विभाजित करता है।
  • तीसरी मंजिल (सूक्ष्म विभाजन): "पक्षी" विंग के अंदर, यह उल्लू बनाम ईगल को विभाजित करता है।
  • अटारी (छोटा विभाजन): अंत में, यह विशिष्ट वस्तुओं जैसे डेज़ी बनाम पॉपी को अलग करता है।

इस शोध पत्र में इसे "Hierarchical Splitting Geometry" कहा गया है। यह रूसी नेस्टिंग डॉल्स (Russian nesting dolls) के एक सेट की तरह है, जहाँ कंप्यूटर सबसे बड़ी श्रेणियों से लेकर सबसे सूक्ष्म विवरणों तक परतों को हटाता है, और यह सब केवल इस आधार पर होता है कि शब्द कितनी बार एक साथ रहते हैं।

3. Word2vec और LLMs का "जादू"

शोधकर्ताओं ने दो प्रकार के AI पर इसका परीक्षण किया:

  1. Word2vec: एक पुराना, सरल प्रकार का AI जो केवल शब्द सांख्यिकी (word statistics) को देखता है।
  2. Gemma: एक आधुनिक, बड़ा लैंग्वेज मॉडल (LLM) जो बहुत अधिक जटिल है।

चौंकाने वाली बात: उन्होंने पाया कि दोनों प्रकार के AI ने ठीक यही "पेड़ जैसी" संरचना बनाई।

  • सरल AI में, यह समझ में आता है क्योंकि वह केवल शब्द सांख्यिकी को देख रहा था।
  • जटिल AI (Gemma) में, लोग अक्सर सोचते हैं कि AI एक विशेष, गुप्त "पदानुक्रम मॉड्यूल" (hierarchy module) का उपयोग कर रहा है ताकि वह समझ सके कि "कुत्ता" एक "जानवर" है।
  • शोध का दावा: नहीं, इसे किसी गुप्त मॉड्यूल की आवश्यकता नहीं है। जटिल AI ने यह पेड़ जैसी संरचना स्वचालित रूप से बनाई क्योंकि इसने उसी शब्द सांख्यिकी से सीखा था। "है-एक" (is-a) संबंध (hypernymy) उस तथ्य की छाया है कि संबंधित शब्द अक्सर एक साथ दिखाई देते हैं।

4. "स्पेक्ट्रल" मानचित्र

यह शोध पत्र इसे सिद्ध करने के लिए गणित (eigenvectors और eigenvalues) का उपयोग करता है। इसे एक रंगीन कांच की खिड़की (stained-glass window) के माध्यम से टॉर्च की रोशनी दिखाने की तरह समझें:

  • प्रकाश शब्द सांख्यिकी है।
  • खिड़की AI की गणितीय संरचना है।
  • दीवार पर पैटर्न पदानुक्रम (hierarchy) है।

गणित यह दर्शाता है कि "प्रकाश" (सांख्यिकी) स्वाभाविक रूप से एक ऐसा पैटर्न बनाता है जहाँ पहला "प्रकाश का पुंज" सबसे बड़े समूहों को अलग करता है, अगला पुंज मध्यम समूहों को अलग करता है, और इसी तरह। कंप्यूटर को यह करने के लिए बताया नहीं जाता; सांख्यिकी का गणित इसे होने के लिए मजबूर करता है।

सारांश

शोध पत्र निष्कर्ष निकालता है कि जिस सुंदर, व्यवस्थित तरीके से AI दुनिया को समझता है (यह जानना कि एक "पूडल" एक "कुत्ता" है, जो एक "जानवर" है), वह आवश्यक रूप से इसलिए नहीं है क्योंकि AI को अवधारणाओं के पारिवारिक पेड़ के साथ प्रोग्राम किया गया था। इसके बजाय, यह इस तथ्य का एक स्वाभाविक दुष्प्रभाव है कि एक ही परिवार के शब्द अक्सर एक ही वाक्यों में दिखाई देते हैं।

जैसे एक नदी स्थलाकृति (terrain) के आधार पर परिदृश्य में अपना रास्ता खुद बनाती है, वैसे ही AI शब्द उपयोग के परिदृश्य के आधार पर एक "अवधारणा पेड़" (concept tree) स्वाभाविक रूप से बनाता है। पदानुक्रम एक सांख्यिकीय गूँज (statistical echo) है, न कि कोई कार्यात्मक निर्देश।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →