← नवीनतम पेपर
💻 computer science

MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc

MMLongBench-Doc-V2, MMLongBench-Doc बेंचमार्क का एक सुधारा गया और अर्थ-जागरूक (semantics-aware) संशोधन है जो 106 ग्राउंड-ट्रुथ एनोटेशन को ठीक करता है, स्ट्रिंग-मैचिंग मेट्रिक्स को LLM-आधारित जज से बदलता है, और लंबे दस्तावेज़ों के QA के लिए एक अधिक विश्वसनीय मूल्यांकन ढांचा प्रदान करने के लिए अमान्य नमूनों को हटाता है।

मूल लेखक: Mingtian Zhang

प्रकाशित 2026-08-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingtian Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाले टैलेंट शो के जज हैं जहाँ प्रतियोगी बहुत बुद्धिमान कंप्यूटर प्रोग्राम हैं जिन्हें "AI" कहा जाता है। ये AI जटिल दस्तावेज़ों—जैसे वित्तीय रिपोर्ट, वैज्ञानिक शोध पत्र और निर्देश मैनुअल—को पढ़ने और उनके बारे में सवालों के जवाब देने की कोशिश कर रहे हैं। यह Document QA (प्रश्न उत्तर) की दुनिया है। इस अखाड़े में लक्ष्य सरल है: AI एक लंबा PDF पढ़ता है, और आप उससे एक सवाल पूछते हैं। यदि वह उत्तर सही देता है, तो वह अंक जीतता है। यदि वह गलत होता है, या यदि वह उत्तर तब बना लेता है जब दस्तावेज़ में वह जानकारी नहीं होती, तो वह अंक खो देता है।

हमें इसकी परवाह क्यों है? क्योंकि जैसे-जैसे ये AI स्मार्ट होते जा रहे हैं, वे उन अति-आत्मविश्वासी छात्रों की तरह व्यवहार करने लगते हैं जो केवल व्यस्त दिखने के लिए उत्तर का अनुमान लगाने लगते हैं। हमें यह परीक्षण करने के लिए एक तरीका चाहिए कि क्या वे वास्तव में पढ़ रहे हैं या केवल भ्रमित (hallucinating) हो रहे हैं (यानी मनगढ़ंत बातें बना रहे हैं)। इसे करने के लिए, वैज्ञानिकों ने एक विशाल परीक्षण बनाया जिसे MMLongBench-Doc कहा जाता है। यह एक अंतिम परीक्षा की तरह है जिसमें 135 अलग-अलग दस्तावेज़ों में फैले 1,000 से अधिक प्रश्न हैं। लेकिन, जैसा कि यह नया पेपर बताता है, इस परीक्षा में कुछ गंभीर खामियां थीं जिन्होंने ग्रेडिंग को अनुचित बना दिया।


दोषपूर्ण परीक्षा: जब ग्रेडर ही समस्या हो

मूल परीक्षा (MMLongBench-Doc) को एक सख्त, पुराने जमाने के शिक्षक के रूप में सोचें जो केवल सटीक स्पेलिंग मिलान खोजने वाले लाल पेन से ग्रेडिंग करता है। यदि सही उत्तर "1,358,000" है और AI "1358000" लिखता है (बिना कॉमा के), तो शिक्षक उसे गलत मार्क कर देता है। यदि उत्तर "Operating Activities" है और AI "Operations activities" लिखता है, तो शिक्षक उसे गलत मार्क कर देता है। यह एक गणित के शिक्षक द्वारा छात्र को "12.0" के बजाय "12" लिखने के लिए फेल करने जैसा है, भले ही संख्या सही हो।

इससे भी बुरा यह है कि शिक्षक की उत्तर कुंजी (answer key) कभी-कभी गलत होती थी। कल्पना करें कि एक प्रश्न पूछ रहा है, "पेज 5 पर कितने नीले तीर हैं?" उत्तर कुंजी कहती है "शून्य"। लेकिन यदि आप पेज को देखते हैं, तो वास्तव में वहां कोई नीला तीर नहीं है, इसलिए "शून्य" सही है। हालांकि, कभी-कभी कुंजी ने "शून्य" कहा जब दस्तावेज़ में वास्तव में एक तीर था, या प्रश्न इतना भ्रमित करने वाला लिखा गया था कि कोई इंसान भी उसका उत्तर नहीं दे सकता था। सबसे बुरी बात? ये गलतियाँ कठिन प्रश्नों पर केंद्रित थीं। इसलिए, सबसे स्मार्ट AI को सबसे अधिक दंडित किया गया, जबकि कम समझ वाले AI (जो रैंडम अनुमान लगा रहे थे) उतने प्रभावित नहीं हुए। यह एक ऐसी दौड़ की तरह था जहाँ सबसे तेज़ धावकों को पैरों में सीसे के जूते पहना दिए गए थे, जबकि धीमी चाल वाले लोग नहीं।

समाधान: MMLongBench-Doc-V2

यहाँ नया पेपर आता है: MMLongBench-Doc-V2। लेखक, जो कि मिंगटियन झांग (Mingtian Zhang) हैं, ने परीक्षा को फेंकने के बजाय उसे ठीक करने का निर्णय लिया। उन्होंने मूल परीक्षण को एक बिखरे हुए ड्राफ्ट की तरह माना और तीन बड़े कदमों के साथ इसे साफ किया।

1. नया ग्रेडर: एक "अर्थ" का जासूस (Meaning Detective)
केवल यह जाँचने वाले रोबोट के बजाय कि क्या दो टेक्स्ट स्ट्रिंग्स बिल्कुल समान दिखते हैं, उन्होंने एक "अर्थ का जासूस" (एक विशेष AI जज) नियुक्त किया। यह जासूस कॉमा, बड़े अक्षरों या अतिरिक्त स्पेस की परवाह नहीं करता है। यह AI के उत्तर को देखता है और पूछता है, "क्या इसका अर्थ वही है जो सही उत्तर का है?"

  • उपमा: यदि उत्तर "The cat is sleeping" है, और AI कहता है "A feline is napping," तो पुराना ग्रेडर इसे फेल कर देता। नया जासूस इसे पास कर देता है क्योंकि अर्थ समान है।
  • सावधानी: यह जासूस मूल दस्तावेज़ नहीं देखता है। यह केवल AI के उत्तर की सही उत्तर कुंजी से तुलना करता है। यह जासूस को खराब स्कैन या PDF में गायब टेक्स्ट से भ्रमित होने से रोकता है।

2. उत्तर कुंजी को ठीक करना (106 सुधार)
लेखक ने परीक्षा की समीक्षा की और उन्हें 106 प्रश्न मिले जहाँ उत्तर कुंजी गलत थी, प्रश्न टूटा हुआ था, या दस्तावेज़ प्रश्न से मेल नहीं खाता था।

  • "गलत फ़ाइल" की समस्या: उन्हें 10 प्रश्न मिले जो ऐसे दस्तावेज़ के बारे में पूछ रहे थे जो टेस्ट फोल्डर में था ही नहीं! यह "हैरी पॉटर के अध्याय 5" के बारे में पूछने जैसा था लेकिन छात्र को "द हॉबिट" की प्रति थमा दी गई थी। कोई भी इसका उत्तर नहीं दे सकता था, इसलिए उन्होंने उन प्रश्नों को पूरी तरह से हटा दिया।
  • "चिह्न" (Sign) की त्रुटि: एक मामले में, कुंजी ने कहा कि एक संख्या 60.3% बढ़ी, लेकिन दस्तावेज़ ने दिखाया कि यह घटी है। लेखक ने चिह्न को ठीक किया।
  • "अस्पष्टता" का समाधान: कुछ प्रश्न बहुत अस्पष्ट थे। यदि एक दस्तावेज़ में "short-term debt" और "long-term debt" को अलग-अलग सूचीबद्ध किया गया था, लेकिन प्रश्न ने बिना यह बताए कि किन दोनों को जोड़ना है कि "कुल ऋण" (total debt) कितना है, तो लेखक ने प्रश्न को अत्यधिक विशिष्ट बनाने के लिए फिर से लिखा।

3. "खाली सेट" (Empty Set) का द्वंद्व
यह सबसे पेचीदा हिस्सा है। कुछ प्रश्न पूछते हैं, "इस वित्तीय रिपोर्ट में कितने ड्रैगन हैं?" उत्तर स्पष्ट रूप से शून्य है। लेकिन मूल परीक्षण में, कुछ "शून्य" उत्तरों को "उत्तर योग्य नहीं" (Not Answerable - यानी दस्तावेज़ में जानकारी नहीं है) के रूप में चिह्नित किया गया था, जबकि अन्य को "0" (यानी दस्तावेज़ की जाँच की गई और कुछ नहीं मिला) के रूप में चिह्नित किया गया था।

  • नियम: लेखक ने एक सख्त नियम बनाया: यदि दस्तावेज़ मौजूद है और आप सिद्ध कर सकते हैं कि वह चीज़ वहाँ नहीं है, तो उत्तर 0 है। यदि दस्तावेज़ का कोई पूरा पेज गायब है या प्रश्न ऐसी चीज़ के बारे में पूछता है जिसे गिना नहीं जा सकता (जैसे "ब्रह्मांड के सभी तारे"), तो यह उत्तर योग्य नहीं (Not Answerable) है।
  • परिणाम: उन्होंने 14 प्रश्नों को समायोजित किया ताकि "शून्य" वाले उत्तर निष्पक्ष हों। यह AI को यह सोचने के लिए मजबूर होने से रोकता है कि "मुझे नहीं पता" ही सही उत्तर है जब वास्तव में सही उत्तर "कोई नहीं" है।

अंतिम स्कोरबोर्ड

सभी सफाई के बाद, नए परीक्षण (V2) में 1,071 प्रश्न और 134 दस्तावेज़ हैं (1,082 प्रश्नों और 135 दस्तावेज़ों से कम)।

  • बड़ा बदलाव: इस नए परीक्षण पर स्कोर तुलनीय नहीं हैं। आप यह नहीं कह सकते कि, "पिछले साल AI का स्कोर 44.9% था और इस साल 50% है, इसलिए इसमें सुधार हुआ है।" परीक्षण स्वयं बदल गया है, इसलिए संख्याएँ एक अलग पैमाने पर हैं।
  • अच्छी खबर: यह नया परीक्षण यह देखने का एक निष्पक्ष तरीका है कि क्या कोई AI वास्तव में स्मार्ट है या केवल भाग्यशाली है। यह उन "ट्रिक प्रश्नों" को हटा देता है जो सर्वश्रेष्ठ मॉडलों को भ्रमित कर रहे थे।
  • चेतावनी: लेखक स्वीकार करते हैं कि उन्होंने हर एक प्रश्न की जाँच नहीं की। उन्होंने उन प्रश्नों पर ध्यान केंद्रित किया जहाँ स्मार्ट AI गलत हो गए थे, क्योंकि वहीं त्रुटियों के छिपने की सबसे अधिक संभावना थी। अभी भी परीक्षण में कुछ गलतियाँ हो सकती हैं, लेकिन वे पहले की तुलना में बहुत कम हैं।

यह क्यों मायने रखता है

यह पेपर एक नया सुपर-AI बनाने के बारे में नहीं है। यह उस पैमाने (ruler) को ठीक करने के बारे में है जिसका उपयोग हम उन्हें मापने के लिए करते हैं। यदि आप कानूनी अनुबंध या मेडिकल रिपोर्ट पढ़ने के लिए एक रोबोट बना रहे हैं, तो आपको यह जानने की आवश्यकता है कि क्या वह वास्तव में पढ़ रहा है या केवल अनुमान लगा रहा है। MMLongBench-Doc-V2 हमें एक स्वच्छ, अधिक ईमानदार पैमाना देता है। यह सुनिश्चित करता है कि जब कोई AI किसी प्रश्न का सही उत्तर देता है, तो वह इसलिए होता है क्योंकि उसने दस्तावेज़ को समझा है, न कि इसलिए क्योंकि उसने सही संख्या में कॉमा का अनुमान लगा लिया था।

लेखक ने अपने सभी सुधार, नया टेस्ट डेटा और उत्तरों को ग्रेड करने के उपकरण सभी के लिए उपलब्ध करा दिए हैं। यह एक याद दिलाता है कि विज्ञान में, कभी-कभी सबसे महत्वपूर्ण काम इंजन बनाना नहीं, बल्कि स्पीडोमीटर को ठीक करना होता है ताकि हमें पता चल सके कि हम वास्तव में कितनी तेज़ गति से जा रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →