← नवीनतम पेपर
💬 NLP

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

यह शोध पत्र VMMU को प्रस्तुत करता है, जो एक वियतनामी बेंचमार्क है जिसमें सात कार्यों के माध्यम से 2,500 बहुआयामी (मल्टीमॉडल) प्रश्न शामिल हैं, जिन्हें अंग्रेजी से परे वास्तविक दृश्य-पाठ्य तर्क करने की विज़न-लैंग्वेज मॉडल्स की क्षमता का मूल्यांकन करने के लिए डिज़ाइन किया गया है, जो यह प्रकट करता है कि वर्तमान मॉडल मजबूत भाषा-विशिष्ट प्रदर्शन के बावजूद मुख्य रूप से OCR के बजाय मल्टीमॉडल ग्राउंडिंग के साथ संघर्ष करते हैं।

मूल लेखक: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

प्रकाशित 2026-01-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुभाषी रोबोट सहायक है। आप देखना चाहते हैं कि क्या वह एक वियतनामी छात्र को एक कठिन होमवर्क समस्या हल करने में मदद कर सकता है जो एक तस्वीर के रूप में आई है। वह तस्वीर केवल एक फोटो नहीं है; वह एक पाठ्यपुस्तक या ड्राइविंग टेस्ट का एक पन्ना है जिसमें चित्रों, चार्ट और ट्रैफिक संकेतों के साथ वियतनामी टेक्स्ट मिला हुआ है।

यह पेपर एक नया "टेस्ट" पेश करता है जिसे VMMU कहा जाता है, यह देखने के लिए कि ये रोबोट इस विशिष्ट कार्य में कितने अच्छे हैं। यहाँ उन्होंने जो पाया है, उसका विवरण सरल उपमाओं (analogies) का उपयोग करते हुए दिया गया है:

1. टेस्ट: एक "मल्टीटास्क" बाधा दौड़ (Obstacle Course)

VMMU को AI के लिए एक जिम की तरह समझें, लेकिन वजन उठाने के बजाय, रोबोटों को 2,548 अलग-अलग पहेलियाँ हल करनी होती हैं। ये पहेलियाँ सात क्षेत्रों को कवर करती हैं: गणित, भौतिक विज्ञान, रसायन विज्ञान, जीव विज्ञान, भूगोल, ड्राइविंग टेस्ट और IQ टेस्ट।

पेंच यह है कि प्रश्न केवल स्क्रीन पर टाइप किए हुए नहीं हैं। वे छवियों में समाहित हैं। उत्तर देने के लिए, रोबोट को:

  • चित्र के अंदर वियतनामी शब्दों को पढ़ना होगा (जैसे किसी साइन को पढ़ना)।
  • चित्र वाले हिस्से को देखना होगा (जैसे कोई ग्राफ या मानचित्र)।
  • उत्तर खोजने के लिए दोनों को आपस में जोड़ना होगा।

2. बड़ा आश्चर्य: पढ़ना समस्या नहीं है

शोधकर्ताओं ने सबसे पहले पूछा: "क्या रोबोट इसलिए विफल हो रहा है क्योंकि वह वियतनामी नहीं पढ़ पा रहा है?"
उन्होंने छवियों के भीतर के टेक्स्ट को केवल ट्रांसक्राइब (बोलकर पढ़ना) करने की रोबोट की क्षमता का परीक्षण किया।

  • परिणाम: रोबमाों की वियतनामी टेक्स्ट पढ़ने की क्षमता वास्तव में बेहतरीन थी। उन्होंने लगभग 95% बार इसे सही पढ़ा।
  • उपमा: कल्पना कीजिए कि एक छात्र जो एक पन्ने पर लिखे हर शब्द को पूरी तरह से पढ़ सकता है, लेकिन फिर भी गणित की समस्या गलत कर देता है क्योंकि उसे समझ नहीं आता कि संख्याएँ चित्र से कैसे संबंधित हैं। समस्या आँखों की नहीं; दिमाग की है।

3. असली संघर्ष: कड़ियों को जोड़ना

जब रोबोटों ने पूर्ण समस्याओं (पढ़ना + देखना + तर्क करना) को हल करने की कोशिश की, तो उनके स्कोर में काफी गिरावट आई।

  • परिणाम: यहाँ तक कि सबसे स्मार्ट कमर्शियल रोबोट भी लगभग 66% उत्तर ही सही दे पाए।
  • "सोचने" वाला कारक: शोधकर्ताओं ने "तेज़" रोबोटों और "सोचने वाले" रोबोटों के बीच एक बड़ा अंतर पाया।
    • तेज़ रोबोट: वे जल्दी से अनुमान लगाते थे और लगभग 50-70% सही होते थे।
    • सोचने वाले रोबोट: ये मॉडल चरणों के माध्यम से "सोचने" के लिए रुकते हैं। इनका स्कोर बहुत अधिक (73-86%) था।
  • उपमा: यह उस छात्र के बीच के अंतर जैसा है जो बिना सोचे पहला उत्तर बोल देता है बनाम वह जो रुकता है, एक आरेख (diagram) बनाता है और चरण-दर-चरण तर्क के साथ आगे बढ़ता है। "सोचने वाले" मॉडल बहुत बेहतर प्रदर्शन करते हैं।

4. "कचरे" (Clutter) की समस्या

शोधकर्ताओं ने देखा कि जब टेक्स्ट और चित्र एक ही अस्त-व्यस्त छवि में ठुंसे हुए थे, तो रोबोट भ्रमित हो गए।

  • प्रयोग: उन्होंने चित्र से टेक्स्ट को बाहर निकाल दिया और इसे रोबोट को एक साफ सूची के रूप में दिया, जबकि चित्र उन्हें अलग से दिया।
  • परिणाम: रोबोट समस्या को हल करने में बेहतर हो गए।
  • उपमा: यह एक पहेली सुलझाने जैसा है जबकि कोई आपसे कमरे के दूसरे कोने से निर्देश चिल्ला रहा हो। यदि वे आपको साफ कागज पर निर्देश देते हैं और आपको पहेली के टुकड़ों पर ध्यान केंद्रित करने देते हैं, तो आप बहुत बेहतर करते हैं। रोबोट टेक्स्ट के "शोर" को इमेज के साथ मिश्रित होने पर अनदेखा करने में संघर्ष कर रहे थे।

5. अनुवाद मदद नहीं करता

शोधकर्ताओं ने सोचा: "शायद रोबोट वियतनामी भाषा को अच्छी तरह से नहीं जानते। क्या होगा अगर हम प्रश्न का अंग्रेजी में अनुवाद कर दें?"

  • परिणाम: नहीं। प्रश्न का अंग्रेजी में अनुवाद करने से रोबोट और भी बुरे हो गए।
  • उपमा: एक ड्राइविंग टेस्ट की कल्पना करें जहाँ संकेत वियतनामी में हैं, लेकिन निर्देश अंग्रेजी में हैं। रोबोट भ्रमित हो जाता है क्योंकि साइन वियतनामी में "Stop" कहता है, लेकिन अंग्रेजी निर्देश दृश्य संदर्भ (visual context) से मेल नहीं खाते। पहेली को हल करने के लिए रोबोट को पूरे वियतनामी संदर्भ को समझने की आवश्यकता है।

6. "अनुमान लगाने" की आदत

अंत में, उन्होंने चित्र को पूरी तरह से हटा दिया और केवल रोबोट को टेक्स्ट वाला प्रश्न दे दिया।

  • परिणाम: रोबोट के स्कोर गिर गए, लेकिन वे शून्य तक नहीं गिरे। वे अभी भी लगभग 51% सही थे (25% के रैंडम गेस की तुलना में)।
  • उपमा: यह पता चलता है कि रोबोट उन छात्रों की तरह हैं जिन्होंने टेस्ट की "ट्रिक्स" को रट लिया है। चित्र के बिना भी, वे केवल प्रश्न की शब्दावली के आधार पर सही उत्तर का अनुमान लगा सकते हैं, जो पैटर्न उन्होंने पहले देखे हैं। वे वास्तव में उत्तर को "देख" नहीं रहे हैं; वे बस अनुमान लगाने में अच्छे हैं।

मुख्य निष्कर्ष (The Bottom Line)

यह पेपर निष्कर्ष निकालता है कि वर्तमान AI मॉडल छवियों में वियतनामी टेक्स्ट को पढ़ने में बहुत अच्छे हैं, लेकिन वे उस टेक्स्ट को दृश्य साक्ष्य के साथ जोड़ने और समस्या के माध्यम से तर्क करने में अभी भी संघर्ष कर रहे हैं। उन्हें केवल शॉर्टकट या अनुमान लगाने पर निर्भर रहने के बजाय, गहराई से "सोचना" और टेक्स्ट एवं इमेज के मिश्रित वास्तविक स्वरूप को संभालना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →