← नवीनतम पेपर
💬 NLP

How Much Do LLMs Know About Chinese Zero Pronouns?

यह शोध पत्र विभिन्न भाषाई कार्यों में चीनी शून्य सर्वनामों (Chinese Zero Pronouns) को संभालने में विभिन्न लार्ज लैंग्वेज मॉडल्स की क्षमताओं का व्यवस्थित रूप से मूल्यांकन करता है, जो यह प्रकट करता है कि अपनी सामान्य दक्षता के बावजूद, वर्तमान मॉडल—स्टेट-ऑफ-द-आर्ट रीजनिंग-ओरिएंटेड मॉडल्स सहित—इन घटनाओं की अपस्ट्रीम पहचान और डाउनस्ट्रीम अनुवाद दोनों में काफी संघर्ष करते हैं।

मूल लेखक: Yifei Li, Guanyi Chen, Tingting He

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifei Li, Guanyi Chen, Tingting He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप चीनी भाषा में एक कहानी पढ़ रहे हैं। अंग्रेजी में, यदि "बिल" नाम का कोई पात्र कुछ करता है, तो हम आमतौर पर कहते हैं, "Bill saw him." लेकिन चीनी में, भाषा एक कुशल न्यूनतमवादी चित्रकार (minimalist painter) की तरह है जो अक्सर कैनवास के कुछ हिस्सों को खाली छोड़ देती है। आप बस देख सकते हैं: "Bill saw [खाली स्थान]।"

उस खाली स्थान को जीरो प्रोनोउन (Zero Pronoun - ZP) कहा जाता है। पाठक को उस रिक्त स्थान को भरने के लिए अपने मस्तिष्क का उपयोग करना पड़ता है: "ओह, उसने स्वयं को देखा," या "उसने कुत्ते को देखा।"

यह शोध पत्र लार्ज लैंग्वेज मॉडल्स (LLMs) के लिए एक रिपोर्ट कार्ड की तरह है—वे सुपर-स्मार्ट एआई चैटबॉट्स जिनका हम आज उपयोग करते हैं। शोधकर्ताओं जानना चाहते थे: क्या ये एआई मस्तिष्क वास्तव में चीनी भाषा के अदृश रिक्त स्थानों को "देख" सकते हैं, समझ सकते हैं कि वे किससे संबंधित हैं, और उनका सही ढंग से अंग्रेजी में अनुवाद कर सकते हैं?

यहाँ उनके अन्वेषण का विवरण दिया गया है, जिसमें कुछ सरल उपमाओं का उपयोग किया गया है।

1. पाँच-चरणीय परीक्षण (समझ की "सीढ़ी")

शोधकर्ताओं ने केवल एआई को एक वाक्य अनुवाद करने के लिए नहीं कहा। उन्होंने पाँच कार्यों की एक सीढ़ी बनाई, जो सबसे आसान (खाली स्थान को पहचानना) से लेकर सबसे कठिन (पूरी कहानी का अनुवाद करना) तक थी।

  • चरण 1: खाली स्थान को पहचानना (Identification)।
    • कार्य: एक चीनी वाक्य को देखें और सटीक रूप से बताएं कि अदृश्य सर्वनाम कहाँ छिपा है।
    • परिणाम: एआई यहाँ संघर्ष करता रहा। यह एक अंधेरे कमरे में भूत को खोजने के लिए रोबोट से पूछने जैसा है। छोटे एआई मॉडल लगभग सभी भूतों को मिस कर गए। बड़े, स्मार्ट मॉडल्स ने भी केवल लगभग 15% ही उन्हें खोज पाए।
  • चरण 2: क्या यह वास्तविक है? (Referentiality)।
    • कार्य: यह तय करना कि क्या खाली स्थान किसी विशिष्ट व्यक्ति/वस्तु को संदर्भित करता है, या यह केवल एक सामान्य "कोई" (जैसे कहना "एक व्यक्ति को सीटबेल्ट पहननी चाहिए" जहाँ "एक व्यक्ति" कोई विशिष्ट व्यक्ति नहीं है) है।
    • परिणाम: एआई आलसी था। उसने मान लिया कि हर खाली स्थान एक विशिष्ट व्यक्ति को संदर्भित करता है, भले ही ऐसा न हो। यह एक ऐसे जासूस की तरह था जो सोचता है कि हर छाया एक अपराधी है।
  • चरण 3: वह किस ओर देख रहा है? (Referential Type)।
    • कार्य: यदि खाली स्थान किसी को संदर्भित करता है, तो क्या वह व्यक्ति खाली स्थान से पहले उल्लेखित है (पीछे देखना) या उसके बाद (आगे देखना)?
    • परिणाम: एआई भ्रमित हो गया। वह पीछे देखने में ठीक था, लेकिन आगे देखने में बहुत खराब था।
  • चरण 4: पहेली सुलझाना (Resolution)।
    • कार्य: वास्तव में उस व्यक्ति का नाम बताना जिसे खाली स्थान संदर्भित करता है।
    • परिणाम: एआई का प्रदर्शन खराब रहा, विशेष रूप से बातचीत में। उसमें कमरे में सबसे प्रसिद्ध नाम का अनुमान लगाने की बुरी आदत थी, भले ही वह संदर्भ में फिट न बैठता हो।
  • चरण 5: अनुवाद (अंतिम बॉस/Final Boss)।
    • कार्य: चीनी पाठ का अंग्रेजी में अनुवाद करें, खाली स्थानों को सही अंग्रेजी शब्दों (जैसे "he," "she," या "it") के साथ भरें।
    • परिणाम: यह सबसे बड़ी विफलता थी। यहाँ तक कि सर्वश्रेष्ठ एआई मॉडल भी आधे से कम सही थे। उन्होंने अदृश्य रिक्त स्थानों में से 50% से भी कम का सही अनुवाद किया।

2. "आकार बनाम बुद्धिमत्ता" की बहस

शोधकर्ताओं ने विभिन्न आकारों (छोटे, मध्यम, विशाल) और विभिन्न "व्यक्तित्वों" (मानक बनाम "तर्क करने वाले" मॉडल जो चरण-दर-चरण सोचते हैं) के एआई मॉडलों का परीक्षण किया।

  • बड़ा हमेशा बेहतर नहीं होता: हालांकि विशाल मॉडलों ने छोटे मॉडलों की तुलना में थोड़ा बेहतर प्रदर्शन किया, लेकिन अंतर बहुत बड़ा नहीं था।
  • सोचना मदद करता है: "तर्क करने वाले" मॉडल (जो उत्तर देने से पहले थोड़ा "सोचते" हैं) ने समग्र रूप से सबसे अच्छा प्रदर्शन किया। वे उन छात्रों की तरह थे जो अपना काम जमा करने से पहले उसे दोबारा चेक करते हैं।
  • अनुवाद विरोधाभास (The Translation Paradox): आश्चर्यजनक रूप से, एआई को खाली स्थानों को खोजने में स्मार्ट बनाने से स्वचालित रूप से उन्हें अनुवाद करने में बेहतर नहीं बनाया। अनुवाद कौशल एक अलग मांसपेशी है जिसे एआई ने अभी तक पूरी तरह से विकसित नहीं किया है।

3. "ओरेकल" प्रयोग (एआई को चीट शीट देना)

शोधकर्ता सोचने लगे: यदि हम एआई को ठीक से बता दें कि खाली स्थान कहाँ हैं, तो क्या वह उनका बेहतर अनुवाद कर सकता है?

  • सेटअप: उन्होंने एआई को पाठ का एक संस्करण दिया जहाँ खाली स्थानों को एक विशेष टैग (जैसे <pro>) के साथ चिह्नित किया गया था।
  • परिणाम: बूम। प्रदर्शन नाटकीय रूप से बढ़ गया। जब एआई को पता था कि कहाँ देखना है, तो "तर्क करने वाले" मॉडलों ने लगभग 79% बार इसे सही किया।
  • सबक: एआई अनिवार्य रूप से खाली स्थान के अर्थ को समझने में बुरा नहीं है; वह बस शुरुआत में खाली स्थान को खोजने में बहुत खराब है। एक बार जब आप उसकी ओर इशारा कर देते हैं, तो वह बाकी चीज़ों को समझ सकता है।

4. "संदर्भ" की समस्या

शोधकर्ताओं ने यह भी परीक्षण किया कि एआई को कितने "पृष्ठभूमि विवरण" (background story) की आवश्यकता होती है।

  • निष्कर्ष: कुछ कार्यों के लिए, एआई को अधिक वाक्य (अधिक संदर्भ) देने से वास्तव में उसका प्रदर्शन खराब हो गया। यह एक भ्रमित छात्र को केवल उस एक पृष्ठ के बजाय किताबों का पूरा पुस्तकालय देने जैसा था जिसकी उसे आवश्यकता थी; अतिरिक्त जानकारी ने उन्हें और अधिक भ्रमित कर दिया।

निचोड़ (The Bottom Line)

यह शोध पत्र निष्कर्ष निकालता है कि चीनी ज़ीरो प्रोनौन्स वर्तमान एआई के लिए एक बहुत बड़ा, अनसुलझा सिरदर्द हैं।

आज के सबसे उन्नत एआई मॉडल भी चीन के एक ऐसे पर्यटक की तरह हैं जो कुछ शब्द जानता है लेकिन बातचीत के अदृश्य हिस्सों को बार-बार मिस कर देता है। वे वहां मौजूद शब्दों का अनुवाद कर सकते हैं, लेकिन वे उन अदृश्य रिक्त स्थानों को भरने में लगातार विफल रहते हैं जो वाक्य को अर्थपूर्ण बनाते हैं।

शोधकर्ताओं को उम्मीद है कि यह अध्ययन एक "रिपोर्ट कार्ड" के रूप में कार्य करेगा ताकि डेवलपर्स को यह दिखाया जा सके कि उनका एआई कहाँ विफल हो रहा है, ताकि वे बेहतर सिस्टम बना सकें जो मानव भाषा के "अदृश्य" हिस्सों को वास्तव में समझ सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →