← नवीनतम पेपर
💬 NLP

Exploring the Capability Boundaries of LLMs in Mastering of Chinese Chouxiang Language

यह शोध पत्र "माउस" (Mouse) को प्रस्तुत करता है, जो चीनी इंटरनेट उप-सांस्कृतिक भाषा "चोउक्सियांग" (Chouxiang) पर लार्ज लैंग्वेज मॉडल्स के मूल्यांकन के लिए एक विशेष बेंचमार्क है, जो यह प्रकट करता है कि जहाँ वर्तमान मॉडल प्रासंगिक अर्थ संबंधी समझ में उत्कृष्ट हैं, वहीं वे इस विकसित होती भाषाई घटना में महारत हासिल करने की विशिष्ट सीमाओं के कारण अन्य कार्यों में संघर्ष करते हैं।

मूल लेखक: Dianqing Lin, Tian Lan, Jiali Zhu, Jiang Li, Wei Chen, Xu Liu, Aruukhan, Xiangdong Su, Hongxu Hou, Guanglai Gao

प्रकाशित 2026-04-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dianqing Lin, Tian Lan, Jiali Zhu, Jiang Li, Wei Chen, Xu Liu, Aruukhan, Xiangdong Su, Hongxu Hou, Guanglai Gao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि इंटरनेट एक विशाल, हलचल भरे शहर की तरह है। इस शहर में, अधिकांश लोग "मानक चीनी" (Standard Chinese) बोलते हैं, जो सरकार और समाचार प्रसारणों की आधिकारिक भाषा की तरह है। लेकिन वहां एक गुप्त, भूमिगत मोहल्ला भी है जहाँ स्थानीय लोग एक बहुत ही अजीब, कोड वाली बोली बोलते हैं जिसे चोशियांग भाषा (Chouxiang Language) या "अमूर्त भाषा" (Abstract Language) कहा जाता है।

यह शोध पत्र एक समूह के जासूसों (शोधकर्ताओं) की तरह है जिन्होंने यह परीक्षण करने का निर्णय लिया कि शहर के सबसे उन्नत AI जासूस (Large Language Models, या LLMs) इस गुप्त मोहल्ले को कितनी अच्छी तरह समझ सकते हैं। उन्होंने एक विशेष परीक्षण बनाया जिसका नाम माउस (Mouse) है, यह देखने के लिए कि क्या AI इस कोड को क्रैक कर सकता है।

यहाँ उनके अन्वेषण का विवरण सरल रूप में दिया गया है:

1. "चोशियांग भाषा" क्या है?

चोशियांग भाषा को "टेलीफोन" गेम और "स्कैवेंजर हंट" के मिश्रण के रूप में समझें।

  • नियम: "तुम मूर्ख हो" कहने के बजाय, एक उपयोगकर्ता कुछ ऐसा लिख सकता है जो बड़बड़ाहट जैसा दिखता है, जैसे "🧠👻" या "91 安排"।
  • चालें:
    • होमोफोन्स (समान ध्वनि वाले शब्द): ऐसे शब्द का उपयोग करना जो सुनने में समान है लेकिन जिसका अर्थ कुछ और है (जैसे "तुम" के अर्थ के लिए "निंग" नामक वर्ण का उपयोग करना)।
    • दृश्य (Visuals): इमोजी का उपयोग करना या वर्णों को अलग-अलग करना। मस्तिष्क का चित्र "स्मार्ट" का अर्थ दे सकता है, और खोपड़ी का इमोजी "मृत्यु" या "हड्डियों" का अर्थ दे सकता है।
    • गुप्त अर्थ: एक वाक्यांश निर्दोष लग सकता है लेकिन वास्तव में यह एक विशिष्ट अपमान या मजाक हो सकता है जो उस विशिष्ट इंटरनेट समुदाय के लोगों द्वारा जाना जाता है।

मूल रूप से, इस भाषा का उपयोग सेंसरशिप (जैसे किसी वर्जित बात को कहने के लिए पासवर्ड लिखना) से बचने के लिए किया जाता था, लेकिन समय के साथ, यह युवाओं के बीच जुड़ने और मज़ाक करने के एक मज़ेदार, तटस्थ तरीके के रूप में विकसित हुआ।

2. "माउस" बेंचमार्क (परीक्षण)

शोधकर्ताओं ने माउस (Mouse own "Mouse" और "Mice" पर एक शब्द-खेल, शायद यह संकेत देने के लिए कि परीक्षण छोटे लेकिन अनेक हैं) नामक एक परीक्षण बनाया। यह AI के लिए एक जिम वर्कआउट की तरह है, लेकिन वजन उठाने के बजाय, AI को इस गुप्त भाषा से जुड़े पहेलियों को हल करना होता है।

इस परीक्षण में छह अलग-अलग चुनौतियाँ हैं:

  1. अनुवाद (Translation): क्या AI गुप्त कोड को वापस सामान्य चीनी में अनुवाद कर सकता है? (जैसे "🧠👻" को "तुम एक स्मार्ट भूत हो" में बदलना)।
  2. घटक वर्गीकरण (Component Classification): क्या AI पहचान सकता है कि कोड कैसे बनाया गया था? क्या उन्होंने समान ध्वनि वाले शब्द का उपयोग किया? एक चित्र का? या एक छिपे हुए अर्थ का?
  3. इरादा पहचान (Intent Recognition): क्या उपयोगकर्ता बुरा व्यवहार कर रहा है, मज़ाक कर रहा है, या बस नमस्ते कह रहा है?
  4. विषाक्तता का पता लगाना (Toxicity Detection): क्या यह वास्तव में एक नफरत भरा भाषण है जो मज़ाक के रूप में छिपा हुआ है, या यह केवल हानिरहित मज़ा है?
  5. अर्थ चयन (Meaning Selection): यदि आप एक अजीब वाक्य देखते हैं, तो क्या आप तीन विकल्पों में से सही अर्थ चुन सकते हैं?
  6. रिक्त स्थान पूर्ति (Cloze Completion): यदि आप एक बातचीत में हैं, तो क्या आप अगले अजीब वाक्य का अनुमान लगा सकते हैं जो पूरी तरह से फिट बैठता हो?

3. परिणाम: AI रास्ता भटक गया

शोधकर्ताओं ने दुनिया के सबसे स्मार्ट AI मॉडल (जैसे GPT-5, Qwen, और DeepSeek) का इस परीक्षण पर परीक्षण किया। यहाँ उन्हें क्या मिला:

  • "स्मार्ट" AI वास्तव में यहाँ काफी मूर्ख है: शीर्ष-स्तरीय AI अधिकांश कार्यों पर बहुत खराब प्रदर्शन करते हैं। वे चुटकुलों को डिकोड करने या छिपे हुए अर्थों को समझने में संघर्ष करते हैं।
  • "ओवरथिंकर" (ज्यादा सोचने वाला) की समस्या: दिलचस्प बात यह है कि सबसे बड़े, सबसे शक्तिशाली AI मॉडल कभी-कभी थोड़े छोटे मॉडलों की तुलना में बदतर प्रदर्शन करते हैं। यह एक प्रतिभाशाली छात्र की तरह है जो एक साधारण पहेली को हल करने के लिए 10 पन्नों का निबंध लिखने की कोशिश करता है, और इतना अधिक सोचता है कि गलत उत्तर दे देता है। छोटे मॉडल केवल अनुमान लगाते थे, और कभी-कभी वह काम कर जाता था।
  • "विषाक्तता" का अंधा बिंदु (Blind Spot): AI वास्तव में चुटकुलों को समझने की तुलना में नफरत भरे भाषणों को पहचानने में बेहतर थे। ऐसा इसलिए है क्योंकि अधिकांश पिछले प्रशिक्षण का ध्यान बुरे शब्दों को पकड़ने पर केंद्रित था, इसलिए AI "बुरे कंटेंट" के प्रति अति-संवेदनशील है लेकिन "मज़ेदार कंटेंट" के बारे में अनभिज्ञ है।
  • मानवीय अंतर: जब वास्तविक मनुष्यों ने, जो संस्कृति को जानते हैं, यह परीक्षण दिया, तो उन्होंने लगभग 100% स्कोर किया। AI, सबसे स्मार्ट वाला भी, इसके करीब नहीं पहुँच सका। यह एक समूह के दोस्तों के जटिल अंदरूनी मज़ाक को समझने की कोशिश करने जैसा है जब आपको पार्टी में आमंत्रित नहीं किया गया था।

4. यह क्यों मायने रखता है?

शोध पत्र तर्क देता है कि AI वर्तमान में बहुत अधिक पश्चिमी-केंद्रित (Western-centric) है। यह मानक अंग्रेजी या चीनी समाचारों को समझने में बहुत अच्छा है, लेकिन यह वास्तविक इंटरनेट संस्कृति की अव्यवस्थित, रचनात्मक और विकसित होती स्लैंग (slang) के साथ विफल हो जाता है।

  • रूपक: कल्पना कीजिए कि एक AI जिसने दुनिया के हर शब्दकोश को पढ़ा है लेकिन उसने कभी स्केट पार्क या गेमिंग फोरम में समय नहीं बिताया है। वह व्याकरण के नियमों को जानता है, लेकिन वह वाइब (vibe) को नहीं जानता।
  • खतरा: यदि हम इंटरनेट सामग्री की निगरानी के लिए AI पर भरोसा करते हैं, तो यह हानिरहित चुटकुलों को हटा सकता है क्योंकि इसे लगता है कि वे अपमान हैं, या यह वास्तविक खतरों को मिस कर सकता है क्योंकि इसे लगता है कि वे केवल "अजीब स्लैंग" हैं।

5. निष्कर्ष

शोधकर्ताओं ने माउस बनाया है ताकि वे AI समुदाय को दिखा सकें कि संस्कृति मायने रखती है। आप केवल एक AI को अधिक डेटा नहीं खिला सकते; आपको उसे उस संदर्भ और उस आत्मा को सिखाने की आवश्यकता है कि लोग वास्तव में ऑनलाइन कैसे बात करते हैं।

संक्षेप में: यह शोध पत्र एक वास्तविकता की जाँच (reality check) है। यह कहता है, "हे AI, तुम स्मार्ट हो सकते हो, लेकिन तुम अभी तक इंटरनेट के गुप्त हाथ मिलाने (secret handshake) को नहीं समझते हो। यहाँ इसे साबित करने के लिए एक परीक्षण है, और यहाँ बताया गया है कि हम इसे कैसे ठीक कर सकते हैं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →