← नवीनतम पेपर
💻 computer science

JAMMEval: A Refined Collection of Japanese Benchmarks for Reliable VLM Evaluation

यह शोध पत्र JAMMEval को प्रस्तुत करता है, जो मौजूदा डेटासेट में डेटा गुणवत्ता संबंधी समस्याओं को दूर करने के लिए व्यवस्थित मानव एनोटेशन के माध्यम से निर्मित जापानी बेंचमार्क का एक परिष्कृत संग्रह है, जिससे विजन-लैंग्वेज मॉडलों का अधिक विश्वसनीय और सटीक मूल्यांकन सक्षम होता है।

मूल लेखक: Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki

प्रकाशित 2026-04-07
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Issa Sugiura, Koki Maeda, Shuhei Kurita, Yusuke Oda, Daisuke Kawahara, Naoaki Okazaki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह आंकने की कोशिश कर रहे हैं कि एक नया छात्र मानचित्र (मैप) पढ़ने और छिपा हुआ खजाना खोजने में कितना अच्छा है। आप उसे एक परीक्षा देते हैं। लेकिन क्या होगा अगर वह परीक्षा ही खराब हो?

  • मानचित्र गायब है: कुछ प्रश्न ऐसी चीजों के बारे में पूछते हैं जो मानचित्र पर हैं ही नहीं।
  • प्रश्न अस्पष्ट हैं: कुछ प्रश्न ऐसे हैं जैसे, "मुझे इस चित्र के बारे में सब कुछ बताओ," जिसका कोई एक सही उत्तर नहीं है।
  • उत्तर कुंजी गलत है: कभी-कभी शिक्षक की उत्तर कुंजी कहती है "नीला" जबकि चित्र स्पष्ट रूप से "लाल" दिखाता है।

यदि आप इस खराब परीक्षा का उपयोग करते हैं, तो आप सोच सकते हैं कि छात्र मानचित्रों में बुरा है जबकि वह वास्तव में बहुत अच्छा है, या आप सोच सकते हैं कि दो छात्र समान रूप से अच्छे हैं जबकि एक स्पष्ट रूप से बेहतर है।

यह ठीक वही समस्या है जिसे "JAMMEval" पेपर जापानी AI के लिए हल करता है।

समस्या: "खराब परीक्षा" (The "Broken Test")

विज़न-लैंग्वेज मॉडल्स (VLMs) AI मस्तिष्क हैं जो चित्रों को "देख" सकते हैं और टेक्स्ट को "पढ़" सकते हैं। उन्हें स्मार्ट बनाने के लिए, शोधकर्ताओं को उनका परीक्षण करने की आवश्यकता होती है। हालाँकि, जापानी AI के मौजूदा परीक्षण ऊपर दिए गए खराब खजाने की खोज की तरह थे। वे इनसे भरे हुए थे:

  • अस्पष्ट प्रश्न (बहुत अधिक खुले अंत वाले)।
  • चालाकी (Tricks) जहाँ आप चित्र देखे बिना भी उत्तर दे सकते थे।
  • गलत उत्तर आधिकारिक कुंजी में।

इन खामियों के कारण, स्कोर सच्चाई नहीं बताते थे। यह एक गणित की परीक्षा को ग्रेड देने जैसा था जहाँ शिक्षक ने उत्तर कुंजी में टाइपिंग की गलती कर दी, जिससे छात्र को सही होने के बावजूद दंडित किया गया।

समाधान: JAMMEval (एक "परिष्कृत परीक्षा")

लेखकों ने JAMMEval बनाया। इसे एक विशेषज्ञ संपादकों की टीम के रूप में समझें जिन्होंने सात मौजूदा, बिखरे हुए टेस्ट पेपर्स को लिया और उन्हें पूरी तरह से साफ किया।

उन्होंने केवल खराब प्रश्नों को फेंका नहीं (जिससे परीक्षा बहुत छोटी हो जाती), बल्कि उन्होंने उन्हें सुधारा:

  1. अस्पष्ट को स्पष्ट किया: उन्होंने "मुझे इसके बारे में बताओ" को "ऊपरी बाएँ कोने में पक्षी का रंग क्या है?" में बदल दिया।
  2. उत्तर कुंजियों को ठीक किया: उन्होंने गलत उत्तरों को सुधारा।
  3. चीटिंग (Cheats) को हटाया: उन्होंने उन प्रश्नों को हटा दिया जिन्हें चित्र देखे बिना भी हल किया जा सकता था।

उन्होंने यह दो बार किया: एक बार पेपर के लेखकों द्वारा, और दूसरी बार बाहरी विशेषज्ञों द्वारा यह सुनिश्चित करने के लिए कि सब कुछ एकदम सही हो।

परिणाम: एक स्पष्ट तस्वीर

परीक्षणों को ठीक करने के बाद, उन्होंने उन्हीं AI मॉडल्स को नए, साफ-सुथरे JAMMEval के माध्यम से चलाया। यहाँ बताया गया है कि क्या हुआ:

  • स्कोर बढ़ गए (लेकिन सही कारणों से): मॉडल्स के स्कोर बढ़ गए। ऐसा इसलिए नहीं हुआ कि मॉडल्स रातों-रात स्मार्ट हो गए; बल्कि इसलिए हुआ क्योंकि "खराब उत्तर कुंजियों" को ठीक कर दिया गया था, जिससे मॉडल्स को आखिरकार उन सही उत्तरों के लिए श्रेय मिला जो वे पहले से ही दे रहे थे।
  • शोर (Noise) गायब हो गया: पहले, यदि आप परीक्षण को दो बार चलाते थे, तो स्कोर बहुत अधिक उतार-चढ़ाव दिखाते थे (जैसे एक हिलता हुआ कैमरा)। परिष्करण के बाद, स्कोर स्थिर और विश्वसनीय थे (जैसे एक स्थिर ट्राइपॉड)।
  • बेहतर छँटाई: परीक्षण एक "शुरुआती" AI और एक "विशेषज्ञ" AI के बीच अंतर करने में बेहतर हो गया। पहले, खराब परीक्षण ने उन सभी को एक जैसा बना दिया था। अब, अंतर स्पष्ट हैं।

"कक्षा" का रूपक (The "Classroom" Analogy)

एक कक्षा की कल्पना करें जहाँ शिक्षक (AI) को एक ग्रेडर (बेंचमार्क) द्वारा ग्रेड दिया जा रहा है।

  • पुराना तरीका: ग्रेडर थका हुआ है, उसकी दृष्टि कमजोर है, और कभी-कभी वह "सही" को "गलत" के रूप में चिह्नित करता है। शिक्षक निराश हो जाता है और प्रयास करना बंद कर देता है क्योंकि फीडबैक भ्रमित करने वाला है।
  • JAMMEval का तरीका: ग्रेडर को एक नया चश्मा, एक ताज़ा उत्तर कुंजी और एक स्पष्ट नियम पुस्तिका (rubric) मिलती है। अब, जब शिक्षक एक प्रश्न सही करता है, तो उसे एक गोल्ड स्टार मिलता है। जब वह गलत होता है, तो उसे सुधारने के लिए विशिष्ट फीडबैक मिलता है।

यह क्यों महत्वपूर्ण है

यह पेपर AI समुदाय के लिए एक उपहार है। इन साफ किए गए परीक्षणों और उन्हें बनाने के कोड को जारी करके, लेखक कह रहे हैं: "आइए हम इस बात पर बहस करना बंद करें कि कौन सा AI सबसे अच्छा है क्योंकि परीक्षण खराब था। आइए एक निष्पक्ष परीक्षण का उपयोग करें ताकि हम वास्तव में देख सकें कि कौन सुधार कर रहा है और किसे अधिक काम करने की आवश्यकता है।"

यह "अनुमान लगाने" से "जानने" की ओर एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →