MMLongBench-Doc-V2: A Corrected-Annotation, Semantics-Aware Revision of MMLongBench-Doc
MMLongBench-Doc-V2, MMLongBench-Doc बेंचमार्क का एक सुधारा गया और अर्थ-जागरूक (semantics-aware) संशोधन है जो 106 ग्राउंड-ट्रुथ एनोटेशन को ठीक करता है, स्ट्रिंग-मैचिंग मेट्रिक्स को LLM-आधारित जज से बदलता है, और लंबे दस्तावेज़ों के QA के लिए एक अधिक विश्वसनीय मूल्यांकन ढांचा प्रदान करने के लिए अमान्य नमूनों को हटाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, उच्च-दांव वाले टैलेंट शो के जज हैं जहाँ प्रतियोगी बहुत बुद्धिमान कंप्यूटर प्रोग्राम हैं जिन्हें "AI" कहा जाता है। ये AI जटिल दस्तावेज़ों—जैसे वित्तीय रिपोर्ट, वैज्ञानिक शोध पत्र और निर्देश मैनुअल—को पढ़ने और उनके बारे में सवालों के जवाब देने की कोशिश कर रहे हैं। यह Document QA (प्रश्न उत्तर) की दुनिया है। इस अखाड़े में लक्ष्य सरल है: AI एक लंबा PDF पढ़ता है, और आप उससे एक सवाल पूछते हैं। यदि वह उत्तर सही देता है, तो वह अंक जीतता है। यदि वह गलत होता है, या यदि वह उत्तर तब बना लेता है जब दस्तावेज़ में वह जानकारी नहीं होती, तो वह अंक खो देता है।
हमें इसकी परवाह क्यों है? क्योंकि जैसे-जैसे ये AI स्मार्ट होते जा रहे हैं, वे उन अति-आत्मविश्वासी छात्रों की तरह व्यवहार करने लगते हैं जो केवल व्यस्त दिखने के लिए उत्तर का अनुमान लगाने लगते हैं। हमें यह परीक्षण करने के लिए एक तरीका चाहिए कि क्या वे वास्तव में पढ़ रहे हैं या केवल भ्रमित (hallucinating) हो रहे हैं (यानी मनगढ़ंत बातें बना रहे हैं)। इसे करने के लिए, वैज्ञानिकों ने एक विशाल परीक्षण बनाया जिसे MMLongBench-Doc कहा जाता है। यह एक अंतिम परीक्षा की तरह है जिसमें 135 अलग-अलग दस्तावेज़ों में फैले 1,000 से अधिक प्रश्न हैं। लेकिन, जैसा कि यह नया पेपर बताता है, इस परीक्षा में कुछ गंभीर खामियां थीं जिन्होंने ग्रेडिंग को अनुचित बना दिया।
दोषपूर्ण परीक्षा: जब ग्रेडर ही समस्या हो
मूल परीक्षा (MMLongBench-Doc) को एक सख्त, पुराने जमाने के शिक्षक के रूप में सोचें जो केवल सटीक स्पेलिंग मिलान खोजने वाले लाल पेन से ग्रेडिंग करता है। यदि सही उत्तर "1,358,000" है और AI "1358000" लिखता है (बिना कॉमा के), तो शिक्षक उसे गलत मार्क कर देता है। यदि उत्तर "Operating Activities" है और AI "Operations activities" लिखता है, तो शिक्षक उसे गलत मार्क कर देता है। यह एक गणित के शिक्षक द्वारा छात्र को "12.0" के बजाय "12" लिखने के लिए फेल करने जैसा है, भले ही संख्या सही हो।
इससे भी बुरा यह है कि शिक्षक की उत्तर कुंजी (answer key) कभी-कभी गलत होती थी। कल्पना करें कि एक प्रश्न पूछ रहा है, "पेज 5 पर कितने नीले तीर हैं?" उत्तर कुंजी कहती है "शून्य"। लेकिन यदि आप पेज को देखते हैं, तो वास्तव में वहां कोई नीला तीर नहीं है, इसलिए "शून्य" सही है। हालांकि, कभी-कभी कुंजी ने "शून्य" कहा जब दस्तावेज़ में वास्तव में एक तीर था, या प्रश्न इतना भ्रमित करने वाला लिखा गया था कि कोई इंसान भी उसका उत्तर नहीं दे सकता था। सबसे बुरी बात? ये गलतियाँ कठिन प्रश्नों पर केंद्रित थीं। इसलिए, सबसे स्मार्ट AI को सबसे अधिक दंडित किया गया, जबकि कम समझ वाले AI (जो रैंडम अनुमान लगा रहे थे) उतने प्रभावित नहीं हुए। यह एक ऐसी दौड़ की तरह था जहाँ सबसे तेज़ धावकों को पैरों में सीसे के जूते पहना दिए गए थे, जबकि धीमी चाल वाले लोग नहीं।
समाधान: MMLongBench-Doc-V2
यहाँ नया पेपर आता है: MMLongBench-Doc-V2। लेखक, जो कि मिंगटियन झांग (Mingtian Zhang) हैं, ने परीक्षा को फेंकने के बजाय उसे ठीक करने का निर्णय लिया। उन्होंने मूल परीक्षण को एक बिखरे हुए ड्राफ्ट की तरह माना और तीन बड़े कदमों के साथ इसे साफ किया।
1. नया ग्रेडर: एक "अर्थ" का जासूस (Meaning Detective)
केवल यह जाँचने वाले रोबोट के बजाय कि क्या दो टेक्स्ट स्ट्रिंग्स बिल्कुल समान दिखते हैं, उन्होंने एक "अर्थ का जासूस" (एक विशेष AI जज) नियुक्त किया। यह जासूस कॉमा, बड़े अक्षरों या अतिरिक्त स्पेस की परवाह नहीं करता है। यह AI के उत्तर को देखता है और पूछता है, "क्या इसका अर्थ वही है जो सही उत्तर का है?"
- उपमा: यदि उत्तर "The cat is sleeping" है, और AI कहता है "A feline is napping," तो पुराना ग्रेडर इसे फेल कर देता। नया जासूस इसे पास कर देता है क्योंकि अर्थ समान है।
- सावधानी: यह जासूस मूल दस्तावेज़ नहीं देखता है। यह केवल AI के उत्तर की सही उत्तर कुंजी से तुलना करता है। यह जासूस को खराब स्कैन या PDF में गायब टेक्स्ट से भ्रमित होने से रोकता है।
2. उत्तर कुंजी को ठीक करना (106 सुधार)
लेखक ने परीक्षा की समीक्षा की और उन्हें 106 प्रश्न मिले जहाँ उत्तर कुंजी गलत थी, प्रश्न टूटा हुआ था, या दस्तावेज़ प्रश्न से मेल नहीं खाता था।
- "गलत फ़ाइल" की समस्या: उन्हें 10 प्रश्न मिले जो ऐसे दस्तावेज़ के बारे में पूछ रहे थे जो टेस्ट फोल्डर में था ही नहीं! यह "हैरी पॉटर के अध्याय 5" के बारे में पूछने जैसा था लेकिन छात्र को "द हॉबिट" की प्रति थमा दी गई थी। कोई भी इसका उत्तर नहीं दे सकता था, इसलिए उन्होंने उन प्रश्नों को पूरी तरह से हटा दिया।
- "चिह्न" (Sign) की त्रुटि: एक मामले में, कुंजी ने कहा कि एक संख्या 60.3% बढ़ी, लेकिन दस्तावेज़ ने दिखाया कि यह घटी है। लेखक ने चिह्न को ठीक किया।
- "अस्पष्टता" का समाधान: कुछ प्रश्न बहुत अस्पष्ट थे। यदि एक दस्तावेज़ में "short-term debt" और "long-term debt" को अलग-अलग सूचीबद्ध किया गया था, लेकिन प्रश्न ने बिना यह बताए कि किन दोनों को जोड़ना है कि "कुल ऋण" (total debt) कितना है, तो लेखक ने प्रश्न को अत्यधिक विशिष्ट बनाने के लिए फिर से लिखा।
3. "खाली सेट" (Empty Set) का द्वंद्व
यह सबसे पेचीदा हिस्सा है। कुछ प्रश्न पूछते हैं, "इस वित्तीय रिपोर्ट में कितने ड्रैगन हैं?" उत्तर स्पष्ट रूप से शून्य है। लेकिन मूल परीक्षण में, कुछ "शून्य" उत्तरों को "उत्तर योग्य नहीं" (Not Answerable - यानी दस्तावेज़ में जानकारी नहीं है) के रूप में चिह्नित किया गया था, जबकि अन्य को "0" (यानी दस्तावेज़ की जाँच की गई और कुछ नहीं मिला) के रूप में चिह्नित किया गया था।
- नियम: लेखक ने एक सख्त नियम बनाया: यदि दस्तावेज़ मौजूद है और आप सिद्ध कर सकते हैं कि वह चीज़ वहाँ नहीं है, तो उत्तर 0 है। यदि दस्तावेज़ का कोई पूरा पेज गायब है या प्रश्न ऐसी चीज़ के बारे में पूछता है जिसे गिना नहीं जा सकता (जैसे "ब्रह्मांड के सभी तारे"), तो यह उत्तर योग्य नहीं (Not Answerable) है।
- परिणाम: उन्होंने 14 प्रश्नों को समायोजित किया ताकि "शून्य" वाले उत्तर निष्पक्ष हों। यह AI को यह सोचने के लिए मजबूर होने से रोकता है कि "मुझे नहीं पता" ही सही उत्तर है जब वास्तव में सही उत्तर "कोई नहीं" है।
अंतिम स्कोरबोर्ड
सभी सफाई के बाद, नए परीक्षण (V2) में 1,071 प्रश्न और 134 दस्तावेज़ हैं (1,082 प्रश्नों और 135 दस्तावेज़ों से कम)।
- बड़ा बदलाव: इस नए परीक्षण पर स्कोर तुलनीय नहीं हैं। आप यह नहीं कह सकते कि, "पिछले साल AI का स्कोर 44.9% था और इस साल 50% है, इसलिए इसमें सुधार हुआ है।" परीक्षण स्वयं बदल गया है, इसलिए संख्याएँ एक अलग पैमाने पर हैं।
- अच्छी खबर: यह नया परीक्षण यह देखने का एक निष्पक्ष तरीका है कि क्या कोई AI वास्तव में स्मार्ट है या केवल भाग्यशाली है। यह उन "ट्रिक प्रश्नों" को हटा देता है जो सर्वश्रेष्ठ मॉडलों को भ्रमित कर रहे थे।
- चेतावनी: लेखक स्वीकार करते हैं कि उन्होंने हर एक प्रश्न की जाँच नहीं की। उन्होंने उन प्रश्नों पर ध्यान केंद्रित किया जहाँ स्मार्ट AI गलत हो गए थे, क्योंकि वहीं त्रुटियों के छिपने की सबसे अधिक संभावना थी। अभी भी परीक्षण में कुछ गलतियाँ हो सकती हैं, लेकिन वे पहले की तुलना में बहुत कम हैं।
यह क्यों मायने रखता है
यह पेपर एक नया सुपर-AI बनाने के बारे में नहीं है। यह उस पैमाने (ruler) को ठीक करने के बारे में है जिसका उपयोग हम उन्हें मापने के लिए करते हैं। यदि आप कानूनी अनुबंध या मेडिकल रिपोर्ट पढ़ने के लिए एक रोबोट बना रहे हैं, तो आपको यह जानने की आवश्यकता है कि क्या वह वास्तव में पढ़ रहा है या केवल अनुमान लगा रहा है। MMLongBench-Doc-V2 हमें एक स्वच्छ, अधिक ईमानदार पैमाना देता है। यह सुनिश्चित करता है कि जब कोई AI किसी प्रश्न का सही उत्तर देता है, तो वह इसलिए होता है क्योंकि उसने दस्तावेज़ को समझा है, न कि इसलिए क्योंकि उसने सही संख्या में कॉमा का अनुमान लगा लिया था।
लेखक ने अपने सभी सुधार, नया टेस्ट डेटा और उत्तरों को ग्रेड करने के उपकरण सभी के लिए उपलब्ध करा दिए हैं। यह एक याद दिलाता है कि विज्ञान में, कभी-कभी सबसे महत्वपूर्ण काम इंजन बनाना नहीं, बल्कि स्पीडोमीटर को ठीक करना होता है ताकि हमें पता चल सके कि हम वास्तव में कितनी तेज़ गति से जा रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।