← नवीनतम पेपर
💻 computer science

PRISMM-Bench: A Benchmark of Peer-Review Grounded Multimodal Inconsistencies

PRISMM-Bench पहला बेंचमार्क है जो वैज्ञानिक शोधपत्रों के टेक्स्ट, आकृतियों (figures), तालिकाओं और समीकरणों के बीच वास्तविक पीयर-रिव्यू द्वारा चिह्नित विसंगतियों पर आधारित है, जिसे वर्तमान लार्ज मल्टीमॉडल मॉडल्स की मल्टीमॉडल वैज्ञानिक त्रुटियों का पता लगाने, उन्हें सुधारने और उनके बारे में तर्क करने की महत्वपूर्ण सीमाओं का कठोरता से मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lukas Selch, Yufang Hou, M. Jehanzeb Mirza, Sivan Doveh, James Glass, Rogerio Feris, Wei Lin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिष्ठित विज्ञान पत्रिका के वरिष्ठ संपादक हैं। आपका काम शोध पत्रों के अंतिम मसौदों की जांच करना है। आप देखते हैं कि कुछ अजीब हो रहा है: कभी-कभी टेक्स्ट कुछ और कहता है, लेकिन चित्र या चार्ट कुछ और ही दिखाते हैं। शायद टेक्स्ट कहता है कि एक मशीन लर्निंग मॉडल 99% सटीक है, लेकिन ग्राफ दिखाता है कि वह आधी बार विफल हो जाता है। या टेक्स्ट एक पुल का वर्णन करता है, लेकिन आरेख में एक नाव दिखाई देती है।

ये मल्टीमॉडल विसंगतियां (multimodal inconsistencies) हैं। ये सूक्ष्म, भ्रमित करने वाली और खतरनाक हैं क्योंकि ये विज्ञान में विश्वास को कम करती हैं।

यह पेपर एक नया टूल पेश करता है जिसे PRISMM-Bench कहा जाता है (जो एक प्रिज्म की तरह लगता है जो प्रकाश को रंगों में तोड़ता है, लेकिन यहाँ यह जटिल शोध पत्रों को उनकी विसंगतियों में तोड़ता है)। यहाँ उन्होंने जो किया है उसकी कहानी सरल रूप में दी गई है:

1. समस्या: "विश्वास करें लेकिन जांचें" का अंतर (The "Trust but Verify" Gap)

वैज्ञानिक अब लार्ज मल्टीमॉडल मॉडल्स (LMMs) का उपयोग करने लगे हैं—सुपर-स्मार्ट AI सहायक जो टेक्स्ट भी पढ़ सकते हैं और चित्रों को भी देख सकते हैं—ताhelp देने के लिए लिखने और शोध पत्रों की जांच करने में। उम्मीद यह है कि ये AI उन गलतियों को पकड़ सकते हैं जिन्हें इंसान मिस कर देते हैं।

लेकिन यहाँ एक पेंच है: क्या ये AI वास्तव में शब्दों और छवियों के बीच सूक्ष्म बेमेल को पहचान सकते हैं?
वर्तमान परीक्षण इन AI के लिए एक गणितीय क्विज़ देने जैसा है जिसमें स्पष्ट त्रुटियां होती हैं (जैसे, "2 + 2 = 5")। वास्तविक वैज्ञानिक शोध पत्र अधिक कठिन होते हैं। त्रुटियां किसी अनुबंध में टाइपो या ऐसे मानचित्र की तरह होती हैं जो इलाके से मेल नहीं खाता। मौजूदा परीक्षण इस वास्तविक दुनिया की अव्यवस्था को नहीं पकड़ पा रहे थे।

2. समाधान: "कचरे" में से सोना खोजना (Mining the "Trash" for Gold)

शोधकर्ताओं को इन AI का परीक्षण करने के लिए वास्तविक गलतियों की आवश्यकता थी। इसलिए, वे OpenReview डेटाबेस की खुदाई करने में जुट गए, जहाँ वैज्ञानिक शोध पत्र जमा करते हैं और उनकी समीक्षा प्राप्त करते हैं।

  • उपमा: कल्पना कीजिए एक विशाल पुस्तकालय की जहाँ हर किताब के साथ एक "समीक्षा कार्ड" लगा होता है। अधिकांश कार्ड कहते हैं, "शानदार किताब!" लेकिन कुछ कार्ड कहते हैं, "अरे, लेखक कहता है कि नायक लंबा है अध्याय 1 में, लेकिन अध्याय 5 के चित्र में वह बौना दिखता है।"
  • प्रक्रिया: टीम ने इन "लंबे बनाम बौने" वाली शिकायतों को खोजने के लिए कंप्यूटर का उपयोग करके हजारों इन समीक्षा कार्डों को स्कैन किया। फिर उन्होंने मानव विशेषज्ञों से इनकी पुष्टि करवाई।
  • परिणाम: उन्होंने 353 वैज्ञानिक शोध पत्रों से 384 वास्तविक विसंगतियों का एक डेटासेट बनाया। यह उनका "PRISMM-Bench" है। यह मनगढ़ंत नहीं है; यह वही असली चीज़ है जिसे समीक्षकों ने वास्तव में चिह्नित किया था।

3. परीक्षण: कठिनाई के तीन स्तर

उन्होंने AI से केवल यह नहीं पूछा, "क्या यहाँ कोई गलती है?" बल्कि उन्होंने उन्हें तीन अलग-अलग खेल खिलाए:

  1. जासूस (पहचान - Identification): "यहाँ एक टेक्स्ट और एक चित्र है। झूठ क्या है?"
  2. डॉक्टर (उपचार - Remedy): "ठीक है, आपने झूठ ढूंढ लिया। हम इसे कैसे ठीक करें? क्या हम टेक्स्ट बदलें या चित्र को फिर से बनाएं?"
  3. मैचमेकर (जोड़ी बनाना - Pairing): "यहाँ एक टेक्स्ट विवरण है। इनमें से कौन सा चित्र इसके विपरीत है?"

4. चालाकी भरी चाल: "बहुविकल्पीय" जाल (The "Multiple Choice" Trap)

शोधकर्ताओं ने एक मजेदार समस्या देखी। जब उन्होंने AI को बहुविकल्पीय प्रश्न (A, B, C, D) दिए, तो AI ने बहुत अच्छे स्कोर प्राप्त किए। लेकिन जब उन्होंने चित्र हटा दिए और केवल टेक्स्ट दिखाया, तब भी AI ने उच्च स्कोर प्राप्त किया!

  • रूपक: यह एक छात्र के टेस्ट देने जैसा है जो प्रश्न नहीं पढ़ता। वह बस उत्तरों को देखता है और कहता है, "विकल्प C हमेशा सबसे लंबा होता है, इसलिए मैं C चुनूँगा।" या, "विकल्प A सुनने में बहुत फैंसी लगता है, इसलिए वही सही होगा।" AI भाषा के पैटर्न का अनुमान लगाकर "चीटिंग" कर रहा था, न कि वास्तव में चित्रों को देख रहा था।

समाधान: इस चीटिंग को रोकने के लिए, उन्होंने प्रारूप बदल दिया। उत्तरों के लिए लंबे, फैंसी वाक्यों के बजाय, उन्होंने AI को एक JSON फॉर्म (एक स्ट्रक्चर्ड डेटा बॉक्स) भरने के लिए मजबूर किया।

  • पुराना तरीका: "चित्र एक लाल कार दिखाता है, लेकिन टेक्स्ट नीला कहता है।"
  • नया तरीका: {"Attribute": "Color", "Claim": "Blue", "Evidence": "Red"}

इसने "फैंसी शब्दों" को हटा दिया और AI को वास्तव में डेटा देखने के लिए मजबूर किया ताकि वह बॉक्स भर सके। यह ऐसा था जैसे छात्र से उसकी चीटिंग शीट छीन ली गई हो।

5. परिणाम: AI अभी भी एक नौसिखिया है

उन्होंने दुनिया के 21 सबसे स्मार्ट AI मॉडल्स का परीक्षण किया (जिसमें GPT-5 और Gemini जैसे बड़े नाम शामिल हैं)।

  • स्कोर: सबसे अच्छे मॉडल्स भी केवल लगभग 54% सही थे।
  • वास्तविकता की जाँच: एक मानव विशेषज्ञ बहुत अधिक स्कोर प्राप्त करेगा। AI मॉडल्स अभी भी एक वाक्य और एक चार्ट के बीच संबंध जोड़ने में संघर्ष कर रहे हैं। वे अक्सर सूक्ष्म सुरागों को मिस कर देते हैं या टेक्स्ट की भारी मात्रा से विचलित हो जाते हैं।
  • "रीज़निंग" का लाभ: उन्होंने पाया कि जिन मॉडल्स को "कदम-दर-कदम सोचने" (जैसे कि कोई इंसान पहेली को ज़ोर से हल करता है) के लिए कहा गया, वे केवल अनुमान लगाने वाले मॉडल्स की तुलना में बहुत बेहतर प्रदर्शन करते हैं।

मुख्य निष्कर्ष

यह पेपर एक चेतावनी है। हम चाहते हैं कि AI हमारे वैज्ञानिक सहायक बनें, जो शोध पत्र लिखने और जाँचने में हमारी मदद करें। लेकिन अभी, यदि आप किसी AI को टेक्स्ट और छवियों के बीच विरोधाभासों की जांच करने के लिए कहते हैं, तो यह अभी तक विश्वसनीय नहीं है। यह एक ऐसे प्रूफरीडर को काम पर रखने जैसा है जो कभी-कभी फॉन्ट साइज के आधार पर उत्तर का अनुमान लगाने में इतना व्यस्त हो जाता है कि टाइपो को मिस कर देता है।

PRISM-Bench इन AI सहायकों के लिए नया "ड्राइविंग टेस्ट" है। यह साबित करता है कि हालांकि वे स्मार्ट हो रहे हैं, लेकिन विज्ञान को ईमानदार बनाए रखने के लिए उन्हें अभी लंबा रास्ता तय करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →