← नवीनतम पेपर
💻 computer science

M2-Verify: A Large-Scale Multidomain Benchmark for Checking Multimodal Claim Consistency

यह शोध पत्र M2-Verify को प्रस्तुत करता है, जो 16 वैज्ञानिक डोमेन में फैले 469K से अधिक इंस्टेंस वाला एक बड़े पैमाने का, विशेषज्ञ-सत्यापित मल्टीमॉडल बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल जटिल दावा-साक्ष्य निरंतरता (claim-evidence consistency) के साथ संघर्ष करते हैं और सरल कार्यों पर उच्च प्रदर्शन के बावजूद अक्सर स्पष्टीकरणों में मतिभ्रम (hallucinate) का शिकार होते हैं।

मूल लेखक: Abolfazl Ansari, Delvin Ce Zhang, Zhuoyang Zou, Wenpeng Yin, Dongwon Lee

प्रकाशित 2026-04-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abolfazl Ansari, Delvin Ce Zhang, Zhuoyang Zou, Wenpeng Yin, Dongwon Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में। आपके पास एक संदिग्ध का बयान है (दावा/Claim) और सबूतों का एक ढेर है (एक फोटो और उस फोटो का विवरण)। आपका काम यह पता लगाना है: क्या सबूत वास्तव में वह साबित करते हैं जो संदिग्ध कह रहा है, या वह झूठ बोल रहा है?

लंबे समय तक, जासूसों के पास केवल टेक्स्ट (शब्दों) के साथ काम करने का विकल्प था। लेकिन विज्ञान में, "सबूत" अक्सर एक जटिल एक्स-रे, एक अजीब चार्ट, या एक 3D मॉडल होता है। यदि आप केवल टेक्स्ट विवरण पढ़ते हैं, तो आप तस्वीर में छिपे झूठ को मिस कर सकते हैं।

यह पेपर M2-VERIFY पेश करता है, जो AI जासूसों के लिए एक विशाल नया प्रशिक्षण मैदान (training ground) है ताकि वे वैज्ञानिक शोध पत्रों में इन झूठों को पकड़ना सीख सकें।

यहाँ उन्होंने क्या किया, इसका विवरण दिया गया है, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: "आंखों पर पट्टी बांधा हुआ" AI

एक ऐसे AI की कल्पना करें जो किताबें पढ़ने में तो बहुत अच्छा है लेकिन तस्वीरों को देखने में बहुत बुरा है।

  • समस्या: वैज्ञानिक शोध पत्रों में टेक्स्ट और इमेज (चित्र) दोनों होते हैं। कभी-कभी, टेक्स्ट कहता है, "यह दवा ट्यूमर को सिकोड़ देती है," लेकिन इमेज वास्तव में दिखाती है कि ट्यूमर बढ़ रहा है।
  • कमी: मौजूदा परीक्षणों में AI को केवल टेक्स्ट-आधार वाले सुराग दिए जाते थे। उन्होंने यह टेस्ट नहीं किया कि क्या AI वास्तव में सबूत को देख सकता है और कह सकता है, "रुको जरा, यह फोटो कहानी से मेल नहीं खाती।"
  • जोखिम: यदि AI टूल्स वैज्ञानिक शोध पत्र लिखना शुरू करते हैं, तो वे अनजाने में (या जानबूझकर) ऐसे नकली चित्र बना सकते हैं जो असली दिखते हैं लेकिन टेक्स्ट के विपरीत होते हैं। हमें उन्हें पकड़ने के लिए एक तरीके की आवश्यकता है।

2. समाधान: "विशाल विज्ञान जिम" (M2-VERIFY)

लेखकों ने AI के लिए एक विशाल जिम बनाया है। इसे M2-VERIFY कहा जाता है।

  • आकार: यह बहुत बड़ा है। उन्होंने वास्तविक वैज्ञानिक शोध पत्रों (जैसे मेडिकल जर्नल और कंप्यूटर साइंस आर्काइव्स) से 469,000 उदाहरण एकत्र किए।
  • विविधता: यह चिकित्सा (X-rays देखना) से लेकर भौतिकी (पार्टिकल कोलिजन चार्ट देखना) तक 16 विभिन्न क्षेत्रों को कवर करता है।
  • ट्विस्ट: उन्होंने केवल कॉपी-पेस्ट नहीं किया। उन्होंने एक "ट्रिकस्टर मोड" (छली मोड) बनाया।
    • नॉर्मल मोड: टेक्स्ट और इमेज मेल खाते हैं।
    • ट्रिकस्टर मोड: उन्होंने एक असली इमेज ली और उसके बारे में झूठ बोलने के लिए टेक्स्ट को सूक्ष्म रूप से बदल दिया। उदाहरण के लिए, वे एक स्वस्थ हृदय की फोटो ले सकते हैं और कैप्शन को बदलकर कह सकते हैं, "इस हृदय में एक बड़ा ब्लॉकेज है।"
    • लक्ष्य: AI को फोटो को देखना होगा, कैप्शन को पढ़ना होगा, और कहना होगा, "नहीं, यह एक झूठ है!"

3. "मानवीय रेफरी" (Human Referees)

आप केवल एक कंप्यूटर पर दूसरे कंप्यूटर के लिए टेस्ट बनाने का भरोसा नहीं कर सकते। यह एक रोबोट को रोबोट्स के लिए गणित का टेस्ट ग्रेड करने के लिए कहने जैसा है।

  • ऑडिट: उन्होंने काम की जांच करने के लिए 92 वास्तविक मानव विशेषज्ञों (डॉक्टर, वैज्ञानिक, इंजीनियर) को काम पर रखा।
  • प्रक्रिया:
    1. ब्लाइंड टेस्ट: विशेषज्ञों ने इमेज और दावों को बिना यह जाने देखा कि उत्तर क्या है, ताकि यह देखा जा सके कि क्या इंसान भी सच्चाई पर सहमत हो सकते हैं। (पता चला कि, इंसान भी मेडिकल इमेज को समझने में मुश्किल पाते हैं!)
    2. क्वालिटी कंट्रोल: उन्होंने यह जांचा कि किसी चीज़ के सच या झूठ होने के पीछे AI के स्पष्टीकरण (explanations) समझ में आने वाले थे या नहीं।
  • परिणाम: उन्होंने एक "गोल्ड स्टैंडर्ड" डेटासेट बनाया जो जितना संभव हो सके उतना सटीक है।

4. परिणाम: AI बुरी तरह फंस गया

उन्होंने 12 सबसे स्मार्ट AI मॉडल्स (जैसे GPT-4o, Llama, और Qwen) को इस जिम में डाला ताकि यह देखा जा सके कि वे कैसा प्रदर्शन करते हैं।

  • अच्छी खबर: AI सरल चीजों में काफी अच्छा है। यदि टेक्स्ट कहता है "आसमान नीला है" और फोटो नीले आसमान की है, तो वे 85% बार सही होते हैं।
  • बुरी खबर: जब चीजें जटिल होती हैं, तो AI बुरी तरह विफल हो जाता है।
    • "एनाटॉमी शिफ्ट" (शरीर रचना परिवर्तन): यदि AI को एक एक्स-रे में दो समान दिखने वाले शरीर के अंगों के बीच अंतर करना होता है, तो इसकी सटीकता गिरकर 61% हो जाती है।
    • "हैलुसिनेशन" (भ्रम): कभी-कभी, AI पूरी तरह से इमेज को अनदेखा कर देता है। वह 12 ब्लॉक्स वाला चार्ट देखता है और आत्मविश्वास से कहता है, "इस चार्ट में 6 ब्लॉक्स हैं," क्योंकि वह केवल अपने ट्रेनिंग डेटा से जो याद है उसके आधार पर अनुमान लगा रहा है, न कि वास्तव में जो वह देख रहा है उसके आधार पर।
    • "एक्सप्लेनेशन" (स्पष्टीकरण) की समस्या: भले ही AI सही उत्तर का अनुमान लगा ले, लेकिन उसका स्पष्टीकरण अक्सर निरर्थक होता है। यह एक ऐसे छात्र की तरह है जो गणित तो सही करता है लेकिन समाधान में एलियंस की कहानी लिख देता है।

5. यह क्यों महत्वपूर्ण है

M2-VERIFY को विज्ञान के भविष्य के लिए एक स्ट्रेस टेस्ट के रूप में सोचें।

  • जैसे-जैसे AI अधिक वैज्ञानिक शोध पत्र और डायग्राम बनाना शुरू करेगा, हमें यह सुनिश्चित करने की आवश्यकता है कि वह अनजाने में (या दुर्भावनापूर्ण रूप से) गलत सूचना न फैलाए।
  • यह डेटासेट हमें ठीक से दिखाता है कि वर्तमान AI कहाँ कमजोर है: यह पढ़ सकता है, लेकिन यह अभी तक वास्तव में "देख" और "तर्क" (reason) एक साथ नहीं कर सकता।

संक्षेप में: लेखकों ने AI के लिए एक विशाल, विशेषज्ञ-सत्यापित बाधा दौड़ (obstacle course) बनाई है। उन्होंने पाया कि हालांकि AI तेज है, लेकिन वह अक्सर बारीकियों में उलझ जाता है, तस्वीरों को अनदेखा कर देता है और कहानियाँ बनाने लगता है। यह डेटासेट वह मानचित्र है जिसकी उन्हें उन कमजोरियों को ठीक करने और भरोसेमंद वैज्ञानिक AI बनाने के लिए आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →