← नवीनतम पेपर
💬 NLP

Multilingual LLMs Struggle to Link Orthography and Semantics in Bilingual Word Processing

यह अध्ययन प्रकट करता है कि जहाँ बहुभाषी लार्ज लैंग्वेज मॉडल्स (LLMs) कॉग्नेट्स (cognates) और नॉन-कॉग्नेट्स (non-cognates) को प्रभावी ढंग से संसाधित करते हैं, वहीं वे इंटरलिंगुअल होमोग्राफ्स (interlingual homographs) के साथ काफी संघर्ष करते हैं क्योंकि वे अर्थ संबंधी समझ के बजाय वर्तनी संबंधी समानताओं पर निर्भर रहते हैं, और अक्सर वाक्य के संदर्भ के भीतर भी अर्थों का स्पष्टीकरण करने में विफल रहते हैं।

मूल लेखक: Eshaan Tanwar, Gayatri Oke, Tanmoy Chakraborty

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eshaan Tanwar, Gayatri Oke, Tanmoy Chakraborty

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक सुपर-स्मार्ट रोबोट लाइब्रेरियन है जिसका नाम "LLM" (लार्ज लैंग्वेज मॉडल) है। इस रोबोट ने दुनिया की लगभग हर किताब पढ़ ली है, लेकिन उसने ज्यादातर किताबें अंग्रेजी में पढ़ी हैं। अब, आप उससे अंग्रेजी और अन्य भाषाओं जैसे स्पेनिश, फ्रेंच या जर्मन के बीच एक पेचीदा भाषा संबंधी पहेली सुलझाने में मदद करने के लिए कहते हैं।

इस शोध पत्र के शोधकर्ताओं ने यह देखना चाहा कि क्या यह रोबोट लाइब्रेरियन वास्तव में शब्दों को समझता है, या यह केवल दृश्य युक्तियों (visual tricks) का उस्ताद है।

यहाँ उनके प्रयोग की कहानी दी गई है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. शब्द युग्मों के तीन प्रकार

रोबोट का परीक्षण करने के लिए, उन्होंने उसे "समान या भिन्न?" के खेल की तरह तीन प्रकार के शब्द युग्म दिए।

  • "कज़िन" (Cognates): ये वे शब्द हैं जो दोनों भाषाओं में एक जैसे दिखते हैं और एक ही अर्थ रखते हैं।
    • उदाहरण: Blind (अंग्रेजी) और Blind (जर्मन)। दोनों का अर्थ है "देखने में असमर्थ।"
    • रोबोट की प्रतिक्रिया: "बहुत आसान! वे एक जैसे दिखते हैं, तो उनका अर्थ भी एक ही होगा।" रोबोट इसमें बहुत अच्छा था।
  • "अजनबी" (Non-Cognates): इन शब्दों का अर्थ एक ही होता है लेकिन ये दिखने में बिल्कुल अलग होते हैं।
    • उदाहरण: Pot (अंग्रेजी) और Olla (स्पेनिश)।
    • रोबोट की प्रतिक्रिया: "हम्म, वे अलग दिखते हैं, इसलिए उनका अर्थ भी अलग होना चाहिए।" रोबोट यहाँ संघर्ष करता था, अक्सर गलत अनुमान लगाता था क्योंकि वह दृश्य संबंध नहीं देख पाता था।
  • "बहुरूपिये" (Interlingual Homographs): यह सबसे पेचीदा हिस्सा है। ये शब्द दिखने में बिल्कुल एक जैसे होते हैं लेकिन इनका अर्थ पूरी तरह से अलग होता है।
    • उदाहरण: Gift। अंग्रेजी में, इसका अर्थ है "उपहार"। जर्मन में, इसका अर्थ है "जहर"
    • रोबोट की प्रतिक्रिया: "वे बिल्कुल एक जैसे दिखते हैं! उनका अर्थ भी एक ही होना चाहिए!" रोबोट भ्रमित हो गया और अक्सर गलत चुनाव करता था, कभी-कभी तो उसका प्रदर्शन तब से भी खराब था जब उसने बिना सोचे-समझे तुक्का लगाया हो।

2. बड़ी खोज: रोबोट "सतही स्तर" (Surface-Level) पर है

शोधकर्ताओं ने कुछ आश्चर्यजनक पाया: रोबोट इस बात का जुनूनी है कि शब्द कैसे दिखते हैं, न कि उनका अर्थ क्या है।

रोबोट की तुलना उस व्यक्ति से करें जो केवल किताब के कवर को पढ़ता है लेकिन उसे कभी खोलता नहीं है।

  • जब कवर एक जैसे दिखते हैं (जैसे अंग्रेजी और जर्मन में "Gift"), तो रोबमान मान लेता है कि अंदर की कहानियाँ भी एक ही हैं।
  • वह वास्तव में यह नहीं "जानता" कि जर्मन में "Gift" का अर्थ जहर है; वह बस अक्षरों G-I-F-T को देखता है और मान लेता है कि यह एक उपहार है।

अध्ययन ने दिखाया कि जब रोबोट को अपने आप किसी शब्द का अर्थ बताने के लिए कहा गया, तो उसने अर्थ (semantics) के बजाय वर्तनी (spelling) पर बहुत अधिक भरोसा किया। यह एक ऐसे छात्र की तरह है जो गणित के प्रतीक के आकार को तो रट लेता है लेकिन यह नहीं जानता कि समीकरण को कैसे हल करना है।

3. संदर्भ परीक्षण: "वाक्य का जाल" (The Sentence Trap)

इसके बाद, शोधकर्ताओं ने रोबोट को वाक्यों के साथ चकमा देने की कोशिश की। उन्होंने "बहुरूपिया" शब्दों को एक कहानी के भीतर रखा जहाँ संदर्भ एक सुराग देता है।

  • जाल: "The villain gave the hero a gift." (अंग्रेजी में, यह समझ में आता है। जर्मन में, यदि शब्द Gift होता, तो इसका अर्थ होता "The villain gave the hero poison," जो एक कहानी में भी समझ में आता है, लेकिन रोबोट को यह पता लगाना था कि शब्द किस भाषा का है)।
  • परिणाम:
    • जब वाक्य अंग्रेजी में था, तो रोबोट आमतौर पर सही था क्योंकि वह अंग्रेजी का अभ्यस्त है।
    • जब वाक्य स्पेनिश, फ्रेंच या जर्मन में था, तो रोबोट अक्सर भ्रमित हो जाता था। वह शब्द को देखता, वाक्य की भाषा को अनदेखा कर देता, और उस पर अंग्रेजी का अर्थ थोप देता।

यह ऐसा ही है जैसे आप फ्रेंच बोल रहे हों, और कोई कहे "I am bored," लेकिन रोबोट, अंग्रेजी शब्द "bored" को सुनकर, फ्रेंच वाक्य की संरचना को अनदेखा कर देता और बस बोर होने के बारे में सोचने लगता, भले ही फ्रेंच शब्द का अर्थ कुछ और ही क्यों न हो।

4. यह क्यों मायने रखता है?

शोधकर्ताओं ने रोबोट की तुलना इस बात से की कि मानव मस्तिष्क कैसे काम करता है।

  • इंसान: जब एक द्विभाषी व्यक्ति "Gift" देखता है, तो उसका मस्तिष्क तुरंत दोनों अर्थों (उपहार और जहर) को सक्रिय कर देता है और सही अर्थ चुनने के लिए संदर्भ का उपयोग करता है। यह एक गतिशील, लचीली प्रक्रिया है।
  • रोबोट: यह एक कठोर मशीन की तरह कार्य करता है। वह अक्षरों को देखता है, अपने प्रशिक्षण (जो ज्यादातर अंग्रेजी है) के आधार पर सबसे संभावित मिलान चुनता है, और उसी पर टिका रहता है, भले ही संदर्भ कुछ भी संकेत दे रहा हो।

निचोड़ (The Bottom Line)

यह शोध पत्र हमें बताता है कि हालांकि AI व्याकरण और मानव जैसा सुनाई देने में अद्भुत है, फिर भी यह मानव भाषा की गहरी, जटिल वास्तविकता को समझने में संघर्ष करता है।

  • यह इसमें अच्छा है: उन शब्दों को पहचानने में जो विभिन्न भाषाओं में एक जैसे दिखते हैं और एक ही अर्थ रखते हैं ("कज़िन")।
  • यह इसमें बुरा है: उन शब्दों को समझने में जो एक जैसे दिखते हैं लेकिन जिनका अर्थ अलग होता है ("बहुरूपिये")।
  • सबक: वर्तमान AI मॉडल सुपर-फास्ट पैटर्न मैचिंग (पैटर्न पहचानने वाले) की तरह हैं, न कि वास्तविक विचारक। वे अर्थ (meaning) के बजाय दृश्य समानता (वर्तनी) पर निर्भर करते हैं। AI को वास्तव में द्विभाषी और बुद्धिमान बनाने के लिए, हमें इसे किताब के कवर से आगे देखना और कहानी के भीतर के अर्थ को समझना सिखाने की आवश्यकता है, चाहे वह किसी भी भाषा में लिखी गई हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →