← नवीनतम पेपर
💬 NLP

Multilinguality of Large Language Models From a Structural Perspective

यह शोध पत्र प्रतिनिधित्व संरचनात्मक विश्लेषण (representational structural analysis) के माध्यम से बड़े भाषा मॉडलों की बहुभाषी प्रकृति की जांच करता है, जिससे यह पता चलता है कि कम-संसाधन वाली भाषाएं उच्च- और मध्यम-संसाधन वाली भाषाओं की तुलना में अंग्रेजी से संरचनात्मक रूप से अधिक भिन्न हैं और भाषा-विशिष्ट पोस्ट-ट्रेनिंग अंतर-भाषी संबंधों को बनाए रखते हुए इन संरचनाओं को संशोधित करती है।

मूल लेखक: Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haruki Sakajo, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक विशाल, बहु-मंजिला पुस्तकालय के रूप में करें जहाँ हर किताब एक अलग भाषा का प्रतिनिधित्व करती है। लंबे समय से, शोधकर्ता यह समझने की कोशिश कर रहे हैं कि यह पुस्तकालय अपनी किताबों को कैसे व्यवस्थित करता है। पिछले अधिकांश अध्ययनों ने पुस्तकालय का अध्ययन शब्दों (या "टोकन") को देखकर किया, यह पूछकर, "अंग्रेजी में 'cat' शब्द जापानी में 'cat' शब्द के कितना समान है?"

हालाँकि, यह शोध पत्र एक अलग दृष्टिकोण अपनाता है। व्यक्तिगत शब्दों को देखने के बजाय, लेखक स्वयं पुस्तकालय की पूरी संरचना को देखते हैं। वे पूछते हैं: "पूरा भवन कैसे व्यवस्थित है? क्या अंग्रेजी खंड और जापानी खंड ऐसा दिखते हैं कि वे एक ही स्थापत्य शैली (architectural style) के हैं, या वे पूरी तरह से अलग ब्लूप्रिंट पर बने हैं?"

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. केवल शब्दों को देखने की समस्या

एक टोकेनाइज़र (टेक्स्ट को शब्दों में तोड़ने वाला टूल) की कल्पना कैंची के एक जोड़े के रूप में करें। अंग्रेजी में, कैंची टेक्स्ट को छोटे, साफ टुकड़ों में काटती है। अन्य भाषाओं में, कैंची टेक्स्ट को बहुत बड़े टुकड़ों या बहुत छोटे, बिखरे हुए हिस्सों में काट सकती है। क्योंकि "टुकड़े" अलग-अलग आकार के हैं, इसलिए शब्द-दर-शब्द तुलना करना लेगो ब्रिक्स (Lego bricks) के ढेर की लेगो ब्रिक्स के ढेर से तुलना करने जैसा है। आप देख सकते हैं कि वे दोनों "सामग्री" हैं, लेकिन आप यह नहीं देख पाते कि वे कैसे बने हैं।

2. नया टूल: "स्ट्रक्चरल एक्स-रे" (Structural X-Ray)

लेखकों ने STRUCTLENS नामक टूल का उपयोग किया। इसकी कल्पना एक एक्स-रे मशीन के रूप में करें जो केवल ईंटों को नहीं देखती, बल्कि पुस्तकालय के पूरे कंकाल (skeleton) को स्कैन करती है। यह प्रत्येक भाषा के लिए एक "फैमिली ट्री" बनाता है, जो यह दिखाता है कि मॉडल द्वारा प्रक्रिया (process) किए जाने के दौरान वाक्य के विभिन्न हिस्से एक-दूसरे से कैसे जुड़ते हैं।

उन्होंने इन फैमिली ट्री के बीच की दूरी (distance) को मापा। यदि जर्मन के लिए पेड़ अंग्रेजी के पेड़ के बहुत समान दिखता है, तो दूरी कम है। यदि अंग्रेजी के लिए पेड़ किसी कम-संसाधन वाली भाषा (जैसे जिंगपाव) के लिए बिल्कुल अलग दिखता है, तो दूरी बहुत अधिक है।

3. मुख्य निष्कर्ष

"समृद्ध" बनाम "निर्धन" भाषा का विभाजन
अध्ययन ने इस बात पर स्पष्ट विभाजन पाया कि पुस्तकालय कैसे व्यवस्थित है:

  • उच्च और मध्यम-संसाधन वाली भाषाएँ (समृद्ध पड़ोस): जर्मन, जापानी, चीनी और इंडोनेशियाई जैसी भाषाएँ अच्छी तरह से जुड़े हुए पड़ोसियों की तरह हैं। भले ही वे अलग हों, पुस्तकालय की आंतरिक संरचना उन्हें बहुत समान मानती है। वे एक समान स्थापत्य ब्लूप्रिंट साझा करते हैं।
  • कम-संसाधन वाली भाषाएँ (दूरदराज के गाँव): कम डेटा उपलब्ध वाली भाषाएँ (जैसे अरानेस, गुआरानी और जिंगपाव) अंग्रेजी से संरचनात्मक रूप से बहुत भिन्न हैं। वे पूरी तरह से अलग निर्माण शैली वाले दूरदराज के गाँवों की तरह हैं। भले ही मॉडल उन्हें "पढ़" सकता है, लेकिन उन्हें प्रोसेस करने का उनका आंतरिक तरीका अंग्रेजी को प्रोसेस करने के तरीके से मौलिक रूप से भिन्न है।

"कोसाइन सिमिलरिटी" (Cosine Similarity) का जाल
लेखकों ने पाया कि वैज्ञानिकों द्वारा उपयोग किया जाने वाला एक सामान्य माप (जिसे "कोसाइन सिमिलरिटी" कहा जाता है) एक पेंटिंग के औसत रंग को देखने जैसा है।

  • यदि आप लाल और नीले रंग को मिलाते हैं, तो औसत बैंगनी दिख सकता है।
  • यदि आप लाल और नीले को अलग अनुपात में मिलाते हैं, तो औसत भी भी बैंगनी दिख सकता है।
  • जाल: मॉडल का अंग्रेजी और जापानी का "औसत" दृश्य बहुत समान (उच्च कोसाइन सिमिलरिटी) दिख सकता है, जिससे यह प्रतीत होता है कि मॉडल उन्हें समान रूप से समझता है।
  • वास्तविकता: "स्ट्रक्चरल डिस्टेंस" (एक्स-रे) प्रकट करता है कि पेंट का पैटर्न पूरी तरह से अलग है। मॉडल जापानी शब्दों को अंग्रेजी शब्दों की तुलना में पूरी तरह से अलग आंतरिक पैटर्न में व्यवस्थित कर रहा है, भले ही "औसत" समान दिखता हो।

"विशेषज्ञ प्रशिक्षण" का प्रभाव (Post-Training)
शोधकर्ताओं ने यह भी देखा कि क्या होता है जब आप एक सामान्य मॉडल को लेते हैं और उसे विशेष रूप से एक भाषा (जैसे जापानी) के लिए अतिरिक्त प्रशिक्षण देते हैं।

  • उपमा: एक सामान्य ठेकेदार की कल्पना करें जो सभी के लिए घर बनाता है। यदि आप उन्हें एक विशिष्ट प्रकार का जापानी घर बनाने के लिए काम पर रखते हैं, तो वे उस घर के विवरणों (छत, स्लाइडिंग दरवाजे) में बहुत कुशल हो जाते हैं।
  • निष्कर्ष: मॉडल जापानी में बेहतर होता है, और जापानी खंड की आंतरिक संरचना अधिक परिष्कृत और अद्वितीय हो जाती है। हालाँकि, जापानी खंड और अंग्रेजी खंड के बीच की दूरी बिल्कुल वैसी ही रहती है। मॉडल ने यह नहीं बदला कि जापानी को अंग्रेजी से कैसे जोड़ा जाए; उसने बस जापानी खंड को ही अधिक पॉलिश किया है।

सारांश

संक्षेप में, यह शोध पत्र तर्क देता है कि एआई (AI) कैसे विभिन्न भाषाओं को संभालता है, इसे वास्तव में समझने के लिए हम केवल शब्दों को गिन नहीं सकते या औसत समानता को नहीं देख सकते। हमें इस बात को देखना होगा कि एआई कैसे सोचता है, उसके संरचनात्मक कंकाल (structural skeleton) को देखना होगा।

उन्होंने पाया कि:

  1. परिचित भाषाएँ (उच्च डेटा) एक समान आंतरिक "वास्तुकला" साझा करती हैं।
  2. अपरिचित भाषाएँ (कम डेटा) की एक पूरी तरह से अलग आंतरिक वास्तुकला होती है, भले ही मॉडल तकनीकी रूप से उन्हें पढ़ सके।
  3. विशेषज्ञ प्रशिक्षण एक विशिष्ट भाषा की आंतरिक संरचना में सुधार करता है लेकिन आवश्यक रूप से यह नहीं बदलता कि वह भाषा मॉडल के दिमाग में दूसरों के साथ कैसे संबंधित है।

यह हमें समझने में मदद करता है कि जबकि एआई मॉडल बहुभाषी होते जा रहे हैं, वे अपने "मस्तिष्क" के भीतर गहराई में "समृद्ध" और "निर्धन" भाषाओं के साथ मौलिक रूप से अलग तरह से व्यवहार करते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →