← नवीनतम पेपर
💬 NLP

KMMMU: Evaluation of Massive Multi-discipline Multimodal Understanding in Korean Language and Context

यह शोध पत्र KMMMU को प्रस्तुत करता है, जो नौ विषयों में 3,466 मल्टीमॉडल परीक्षा प्रश्नों वाला एक व्यापक नेटिव कोरियाई बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान एआई मॉडल में प्रदर्शन का अंतर तर्क की गहराई के बजाय स्थानीय परंपराओं, मानकों और डोमेन-विशिष्ट ज्ञान को समझने की चुनौतियों के कारण है।

मूल लेखक: Nahyun Lee, Guijin Son, Hyunwoo Ko, Chanyoung Kim, JunYoung An, Kyubeen Han, Il-Youp Kwak

प्रकाशित 2026-04-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nahyun Lee, Guijin Son, Hyunwoo Ko, Chanyoung Kim, JunYoung An, Kyubeen Han, Il-Youp Kwak

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह परीक्षण करने की कोशिश कर रहे हैं कि रोबोटों का समूह कितना बुद्धिमान है। आप उन्हें अंग्रेजी में परीक्षण दे रहे हैं, और वे काफी अच्छे अंक प्राप्त कर रहे हैं। वे संकेतों को पढ़ सकते हैं, चित्रों को देख सकते हैं और गणित की समस्याओं को हल कर सकते हैं। लेकिन अब, आप देखना चाहते हैं कि क्या वे कोरियाई में लिखे गए परीक्षण को संभाल सकते हैं, विशेष रूप से जो कोरियाई कानूनों, स्थानीय रीति-रिवाजों और तकनीकी परीक्षाओं से संबंधित है जो केवल दक्षिण कोरिया में मौजूद हैं।

आपने जो पेपर साझा किया है, वह KMMMU पेश करता है, जो बिल्कुल यही है: एक नया, कठिन परीक्षा जो विशेष रूप से AI मॉडलों को कोरियाई दुनिया को समझने की उनकी क्षमता का परीक्षण करने के लिए डिज़ाइन की गई है, न कि केवल अंग्रेजी दुनिया को।

यहाँ उस पेपर की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "अनुवादित" जाल (The "Translated" Trap)

पिछले AI परीक्षणों को अनुवादित मेनू की तरह समझें। यदि आप एक फ्रांसीसी रेस्तरां के मेनू का अंग्रेजी में अनुवाद करते हैं, तो आपको शब्द तो सही मिल सकते हैं, लेकिन आप उसका स्वाद खो देते हैं। आप यह मिस कर सकते हैं कि "एस्कारगोट" (escargot) एक विशिष्ट सांस्कृतिक व्यंजन है, या सर्विंग का आकार अलग है।

आज के अधिकांश AI परीक्षण वैसे ही हैं। वे या तो अंग्रेजी में लिखे गए हैं या अंग्रेजी से अनुवादित हैं। इसका मतलब है कि AI केवल उन पैटर्न को पहचान रहा है जिन्हें वह पहले से जानता है। उसने वास्तव में यह नहीं सीखा है कि एक कोरियाई कार्यालय, एक कोरियाई इंजीनियरिंग ब्लूप्रिंट, या एक कोरियाई कानूनी दस्तावेज़ के विशिष्ट नियमों, कानूनों और दृश्य शैलियों को कैसे नेविगेट किया जाए।

KMMMU "प्रामाणिक स्थानीय मेनू" है। इसे अनुवादित नहीं किया गया था; इसे कोरियाई सिविल सेवा परीक्षाओं, इंजीनियरिंग प्रमाणपत्रों और विश्वविद्यालय ओलंपियाडों से वास्तविक परीक्षाओं का उपयोग करके मूल रूप से कोरियाई में लिखा गया था।

2. परीक्षा: एक "विशाल जिग्सॉ पहेली" (A "Giant Jigsaw Puzzle")

शोधकर्ताओं ने 3,466 प्रश्न एकत्र किए। एक विशाल जिग्सॉ पहेली की कल्पना करें जहाँ हर टुकड़ा एक अलग प्रकार की चुनौती है:

  • विषय: यह इंजीनियरिंग और कानून से लेकर कला और डिजाइन तक 9 विभिन्न क्षेत्रों को कवर करता है।
  • दृश्य (Visuals): यह केवल टेक्स्ट नहीं है। AI को सर्किट आरेख (circuit diagrams), मानचित्र, थर्मल कैमरा फोटो और जटिल तालिकाओं को देखना पड़ता है।
  • "केवल कोरियाई" टुकड़े: इसमें 300 प्रश्नों का एक विशेष खंड है जिसे विशिष्ट कोरियाई कानूनों (जैसे कि कोरियाई यातायात नियमों के तहत "लघु वाहन" को कैसे परिभाषित किया जाए) या सांस्कृतिक संदर्भ को जाने बिना हल करना असंभव है।

3. परिणाम: रोबोट एक दीवार से टकरा गए

शोधकर्ताओं ने इस परीक्षा पर उपलब्ध सबसे स्मार्ट AI मॉडलों (दोनों मुफ्त ओपन-सोर्स और महंगे "प्रो" मॉडल) का परीक्षण किया।

  • स्कोर: सबसे कठिन प्रश्नों पर सबसे अच्छे AI ने भी केवल लगभग 52% अंक प्राप्त किए। यह एक हाई स्कूलर के लिए भी पास होने लायक ग्रेड से मुश्किल से अधिक है, तो "सुपर-इंटेलिजेंट" रोबोट तो दूर की बात है।
  • अंतर (The Gap): जब प्रश्नों के लिए विशिष्ट कोरियाई ज्ञान (जैसे स्थानीय कानून) की आवश्यकता थी, तो AI का प्रदर्शन काफी गिर गया। यह एक ऐसे पर्यटक की तरह है जो सियोल में कॉफी ऑर्डर करना तो जानता है लेकिन टैक्स फॉर्म भरने के लिए पूछे जाने पर खो जाता है।
  • अवरोध (Bottlenecks): AI को सबसे अधिक कानून और नैतिकता (Law & Ethics) और कला और डिजाइन (Arts & Design) में कठिनाई हुई। क्यों? क्योंकि ये क्षेत्र बहुत विशिष्ट, कठोर नियमों और लेबल पर निर्भर करते हैं जो इंटरनेट से सीखी गई सामान्य "विश्व जानकारी" में मौजूद नहीं हैं।

4. वे क्यों असफल हुए? ("स्कोर के पीछे का कारण")

शोधकर्ताओं ने देखा कि AI कैसे विफल हुआ, और ऐसा इसलिए नहीं था कि रोबोट "मूर्ख" थे। वे तीन विशिष्ट कारणों से विफल हुए:

  • "डिक्शनरी" की समस्या: AI कोरियाई शब्दों को पढ़ सकता था, लेकिन वह आधिकारिक परिभाषा नहीं जानता था।
    • उपमा: कल्पना कीजिए कि एक रोबोट एक कार की तस्वीर देखता है। वह जानता है कि यह एक "कार" है। लेकिन कोरियाई कानून कहता है, "यदि इसमें 1000cc और 1600cc के बीच का इंजन है, तो यह एक 'लघु वाहन' (Small Vehicle) है और इसकी टैक्स दर अलग है।" AI "कार" देखता है लेकिन विशिष्ट कानूनी लेबल "लघु वाहन" को मिस कर देता है। यह एक "कुत्ता" जानने जैसा है, लेकिन यह न जानना कि डॉग शो के लिए आवश्यक विशिष्ट नस्ल क्या है।
  • "पैटर्न" की समस्या: कुछ प्रश्नों में AI को कुछ उदाहरणों से एक गुप्त नियम का पता लगाने के लिए कहा गया (जैसे कि एक लॉजिक पजल)।
    • उपमा: यदि आप एक रोबोट को एक "खुश" चेहरे की तीन तस्वीरें और एक "दुखी" चेहरा दिखाते हैं, और उससे नियम का अनुमान लगाने को कहते हैं, तो वह अनुमान लगा सकता है कि "मुस्कान खुशी का संकेत है।" लेकिन यदि नियम वास्तव में यह है कि "नीली आँखें खुशी का संकेत हैं," तो रोबोट भ्रमित हो जाता है क्योंकि वह उस विशिष्ट नियम के आधार पर अनुमान लगा रहा है जो उसके सामने है, न कि उस आधार पर जो वह सामान्यतः सोचता है।
  • "अनुवाद" का शोर (Translation Noise): कभी-कभी, AI इसे हल करने के लिए अपने दिमाग में कोरियाई प्रश्न को अंग्रेजी में अनुवाद करने की कोशिश करता है, और ऐसा करने में, वह सूक्ष्मता (nuance) खो देता है।
    • उपमा: यह उस पहेली को हल करने की तरह है जो आप उस बोली में लिखी गई है जिसे आप नहीं बोलते, और उसे शब्द-दर-शब्द अपनी मातृभाषा में अनुवाद करके। मजाक फीका पड़ जाता है क्योंकि सांस्कृतिक संदर्भ खो जाता है।

5. "हार्ड मोड" (The "Hard" Mode)

शोधकर्ताओं ने 627 प्रश्नों का एक "हार्ड सबसेट" भी बनाया जिसे सबसे स्मार्ट मॉडल भी गलत कर गए। वे देखना चाहते थे कि क्या AI अपनी गलतियों से सीख सकता है।

  • परिणाम: यहाँ तक कि "सोचने वाले" (Thinking) मॉडलों (AI जो उत्तर देने से पहले खुद से बात करता है) के साथ भी, वे बहुत बेहतर नहीं हुए। यह साबित करता है कि समस्या यह नहीं है कि AI "पर्याप्त गहराई से नहीं सोच रहा है।" समस्या यह है कि इसके पास सही जानकारी (स्थानीय नियम) नहीं है या यह दृश्य संकेतों को सही लेबल के साथ मैप नहीं कर सकता

मुख्य निष्कर्ष (The Big Takeaway)

यह पेपर एक चेतावनी है। यह हमें बताता है कि अंग्रेजी और सामान्य विज्ञान में अच्छा होने का मतलब यह नहीं है कि एक AI किसी विशिष्ट देश का विशेषज्ञ बन जाता है।

यदि हम चाहते हैं कि AI कोरिया में डॉक्टरों, वकीलों और इंजीनियरों की मदद करे, तो हम केवल अंग्रेजी परीक्षणों का अनुवाद नहीं कर सकते। हमें ऐसे सिस्टम बनाने की आवश्यकता है जो उस देश की स्थानीय संस्कृति, विशिष्ट कानूनों और अद्वितीय दृश्य भाषा को समझ सकें। KMMMU उस पुल को बनाने की दिशा में पहला कदम है, यह सुनिश्चित करने के लिए कि भविष्य का AI केवल एक "वैश्विक पर्यटक" नहीं, बल्कि एक "स्थानीय विशेषज्ञ" हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →