PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies
PRISMM-Bench पहला बेंचमार्क है जो वैज्ञानिक शोधपत्रों के टेक्स्ट, आकृतियों (figures), तालिकाओं और समीकरणों के बीच वास्तविक पीयर-रिव्यू द्वारा चिह्नित विसंगतियों पर आधारित है, जिसे वर्तमान लार्ज मल्टीमॉडल मॉडल्स की मल्टीमॉडल वैज्ञानिक त्रुटियों का पता लगाने, उन्हें सुधारने और उनके बारे में तर्क करने की महत्वपूर्ण सीमाओं का कठोरता से मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिष्ठित विज्ञान पत्रिका के वरिष्ठ संपादक हैं। आपका काम शोध पत्रों के अंतिम मसौदों की जांच करना है। आप देखते हैं कि कुछ अजीब हो रहा है: कभी-कभी टेक्स्ट कुछ और कहता है, लेकिन चित्र या चार्ट कुछ और ही दिखाते हैं। शायद टेक्स्ट कहता है कि एक मशीन लर्निंग मॉडल 99% सटीक है, लेकिन ग्राफ दिखाता है कि वह आधी बार विफल हो जाता है। या टेक्स्ट एक पुल का वर्णन करता है, लेकिन आरेख में एक नाव दिखाई देती है।
ये मल्टीमॉडल विसंगतियां (multimodal inconsistencies) हैं। ये सूक्ष्म, भ्रमित करने वाली और खतरनाक हैं क्योंकि ये विज्ञान में विश्वास को कम करती हैं।
यह पेपर एक नया टूल पेश करता है जिसे PRISMM-Bench कहा जाता है (जो एक प्रिज्म की तरह लगता है जो प्रकाश को रंगों में तोड़ता है, लेकिन यहाँ यह जटिल शोध पत्रों को उनकी विसंगतियों में तोड़ता है)। यहाँ उन्होंने जो किया है उसकी कहानी सरल रूप में दी गई है:
1. समस्या: "विश्वास करें लेकिन जांचें" का अंतर (The "Trust but Verify" Gap)
वैज्ञानिक अब लार्ज मल्टीमॉडल मॉडल्स (LMMs) का उपयोग करने लगे हैं—सुपर-स्मार्ट AI सहायक जो टेक्स्ट भी पढ़ सकते हैं और चित्रों को भी देख सकते हैं—ताhelp देने के लिए लिखने और शोध पत्रों की जांच करने में। उम्मीद यह है कि ये AI उन गलतियों को पकड़ सकते हैं जिन्हें इंसान मिस कर देते हैं।
लेकिन यहाँ एक पेंच है: क्या ये AI वास्तव में शब्दों और छवियों के बीच सूक्ष्म बेमेल को पहचान सकते हैं?
वर्तमान परीक्षण इन AI के लिए एक गणितीय क्विज़ देने जैसा है जिसमें स्पष्ट त्रुटियां होती हैं (जैसे, "2 + 2 = 5")। वास्तविक वैज्ञानिक शोध पत्र अधिक कठिन होते हैं। त्रुटियां किसी अनुबंध में टाइपो या ऐसे मानचित्र की तरह होती हैं जो इलाके से मेल नहीं खाता। मौजूदा परीक्षण इस वास्तविक दुनिया की अव्यवस्था को नहीं पकड़ पा रहे थे।
2. समाधान: "कचरे" में से सोना खोजना (Mining the "Trash" for Gold)
शोधकर्ताओं को इन AI का परीक्षण करने के लिए वास्तविक गलतियों की आवश्यकता थी। इसलिए, वे OpenReview डेटाबेस की खुदाई करने में जुट गए, जहाँ वैज्ञानिक शोध पत्र जमा करते हैं और उनकी समीक्षा प्राप्त करते हैं।
- उपमा: कल्पना कीजिए एक विशाल पुस्तकालय की जहाँ हर किताब के साथ एक "समीक्षा कार्ड" लगा होता है। अधिकांश कार्ड कहते हैं, "शानदार किताब!" लेकिन कुछ कार्ड कहते हैं, "अरे, लेखक कहता है कि नायक लंबा है अध्याय 1 में, लेकिन अध्याय 5 के चित्र में वह बौना दिखता है।"
- प्रक्रिया: टीम ने इन "लंबे बनाम बौने" वाली शिकायतों को खोजने के लिए कंप्यूटर का उपयोग करके हजारों इन समीक्षा कार्डों को स्कैन किया। फिर उन्होंने मानव विशेषज्ञों से इनकी पुष्टि करवाई।
- परिणाम: उन्होंने 353 वैज्ञानिक शोध पत्रों से 384 वास्तविक विसंगतियों का एक डेटासेट बनाया। यह उनका "PRISMM-Bench" है। यह मनगढ़ंत नहीं है; यह वही असली चीज़ है जिसे समीक्षकों ने वास्तव में चिह्नित किया था।
3. परीक्षण: कठिनाई के तीन स्तर
उन्होंने AI से केवल यह नहीं पूछा, "क्या यहाँ कोई गलती है?" बल्कि उन्होंने उन्हें तीन अलग-अलग खेल खिलाए:
- जासूस (पहचान - Identification): "यहाँ एक टेक्स्ट और एक चित्र है। झूठ क्या है?"
- डॉक्टर (उपचार - Remedy): "ठीक है, आपने झूठ ढूंढ लिया। हम इसे कैसे ठीक करें? क्या हम टेक्स्ट बदलें या चित्र को फिर से बनाएं?"
- मैचमेकर (जोड़ी बनाना - Pairing): "यहाँ एक टेक्स्ट विवरण है। इनमें से कौन सा चित्र इसके विपरीत है?"
4. चालाकी भरी चाल: "बहुविकल्पीय" जाल (The "Multiple Choice" Trap)
शोधकर्ताओं ने एक मजेदार समस्या देखी। जब उन्होंने AI को बहुविकल्पीय प्रश्न (A, B, C, D) दिए, तो AI ने बहुत अच्छे स्कोर प्राप्त किए। लेकिन जब उन्होंने चित्र हटा दिए और केवल टेक्स्ट दिखाया, तब भी AI ने उच्च स्कोर प्राप्त किया!
- रूपक: यह एक छात्र के टेस्ट देने जैसा है जो प्रश्न नहीं पढ़ता। वह बस उत्तरों को देखता है और कहता है, "विकल्प C हमेशा सबसे लंबा होता है, इसलिए मैं C चुनूँगा।" या, "विकल्प A सुनने में बहुत फैंसी लगता है, इसलिए वही सही होगा।" AI भाषा के पैटर्न का अनुमान लगाकर "चीटिंग" कर रहा था, न कि वास्तव में चित्रों को देख रहा था।
समाधान: इस चीटिंग को रोकने के लिए, उन्होंने प्रारूप बदल दिया। उत्तरों के लिए लंबे, फैंसी वाक्यों के बजाय, उन्होंने AI को एक JSON फॉर्म (एक स्ट्रक्चर्ड डेटा बॉक्स) भरने के लिए मजबूर किया।
- पुराना तरीका: "चित्र एक लाल कार दिखाता है, लेकिन टेक्स्ट नीला कहता है।"
- नया तरीका:
{"Attribute": "Color", "Claim": "Blue", "Evidence": "Red"}
इसने "फैंसी शब्दों" को हटा दिया और AI को वास्तव में डेटा देखने के लिए मजबूर किया ताकि वह बॉक्स भर सके। यह ऐसा था जैसे छात्र से उसकी चीटिंग शीट छीन ली गई हो।
5. परिणाम: AI अभी भी एक नौसिखिया है
उन्होंने दुनिया के 21 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया (जिसमें GPT-5 और Gemini जैसे बड़े नाम शामिल हैं)।
- स्कोर: सबसे अच्छे मॉडल्स भी केवल लगभग 54% सही थे।
- वास्तविकता की जाँच: एक मानव विशेषज्ञ बहुत अधिक स्कोर प्राप्त करेगा। AI मॉडल्स अभी भी एक वाक्य और एक चार्ट के बीच संबंध जोड़ने में संघर्ष कर रहे हैं। वे अक्सर सूक्ष्म सुरागों को मिस कर देते हैं या टेक्स्ट की भारी मात्रा से विचलित हो जाते हैं।
- "रीज़निंग" का लाभ: उन्होंने पाया कि जिन मॉडल्स को "कदम-दर-कदम सोचने" (जैसे कि कोई इंसान पहेली को ज़ोर से हल करता है) के लिए कहा गया, वे केवल अनुमान लगाने वाले मॉडल्स की तुलना में बहुत बेहतर प्रदर्शन करते हैं।
मुख्य निष्कर्ष
यह पेपर एक चेतावनी है। हम चाहते हैं कि AI हमारे वैज्ञानिक सहायक बनें, जो शोध पत्र लिखने और जाँचने में हमारी मदद करें। लेकिन अभी, यदि आप किसी AI को टेक्स्ट और छवियों के बीच विरोधाभासों की जांच करने के लिए कहते हैं, तो यह अभी तक विश्वसनीय नहीं है। यह एक ऐसे प्रूफरीडर को काम पर रखने जैसा है जो कभी-कभी फॉन्ट साइज के आधार पर उत्तर का अनुमान लगाने में इतना व्यस्त हो जाता है कि टाइपो को मिस कर देता है।
PRISM-Bench इन AI सहायकों के लिए नया "ड्राइविंग टेस्ट" है। यह साबित करता है कि हालांकि वे स्मार्ट हो रहे हैं, लेकिन विज्ञान को ईमानदार बनाए रखने के लिए उन्हें अभी लंबा रास्ता तय करना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।