Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs
यह शोध पत्र REST और REST+ बेंचमार्क प्रस्तुत करता है ताकि व्यवस्थित रूप से यह प्रदर्शित किया जा सके कि अत्याधुनिक मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स, इमेज, टेक्स्ट और मिश्रित मोडैलिटीज के माध्यम से समान अर्थपूर्ण जानकारी को संसाधित करते समय महत्वपूर्ण क्रॉस-मोडल विसंगति प्रदर्शित करते हैं, जो केवल टेक्स्ट रिकग्निशन त्रुटियों के बजाय दृश्य विशेषताओं और टोकन गणनाओं से प्रभावित एक घटना है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एलेक्स (Alex) नाम का एक बेहद प्रतिभाशाली छात्र है। एलेक्स किताबें पढ़ने और कागज पर लिखे गणित के सवालों को हल करने में अविश्वसनीय रूप से स्मार्ट है। लेकिन एलेक्स के पास एक कैमरा भी है, और जब आप एलेक्स को किसी गणित के सवाल की तस्वीर दिखाते हैं, तो एलेक्स कभी-कभी भ्रमित हो जाता है, भले ही वह तस्वीर एकदम स्पष्ट क्यों न हो।
यह शोध पत्र यह खोजने के बारे में है कि मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स (MLLMs)—वे सुपर-स्मार्ट AI दिमाग जो ChatGPT, Gemini और Claude जैसे टूल्स को शक्ति देते हैं—बिल्कुल उस छात्र की तरह हैं। वे "क्रॉस-मोडल इनकंसिस्टेंसी" (Cross-Modal Inconsistency) नामक स्थिति से जूझ रहे हैं।
शोधकर्ताओं ने जो पाया, उसका सरल विवरण यहाँ दिया गया है:
1. "वही सामग्री, अलग उत्तर" वाली समस्या
शोधकर्ताओं ने एक सरल प्रश्न पूछा: यदि आप किसी AI को एक ही जानकारी तीन अलग-अलग तरीकों से देते हैं, तो क्या वह एक ही उत्तर देगा?
उन्होंने इस परीक्षण के लिए एक ही प्रश्न के तीन "फ्लेवर" (रूप) लिए:
- टेक्स्ट फ्लेवर (The Text Flavor): प्रश्न चैट बॉक्स में टाइप किया गया है।
- इमेज फ्लेवर (The Image Flavor): प्रश्न कागज के एक टुकड़े पर लिखा गया है, उसकी फोटो खींची गई है, और उसे एक चित्र के रूप में भेजा गया है।
- मिक्सड फ्लेवर (The Mixed Flavor): प्रश्न टाइप किया गया है, लेकिन संदर्भ (जैसे कोई डायग्राम) एक चित्र है।
चौंकाने वाला परिणाम: भले ही AI चित्र को पूरी तरह से पढ़ पा रहा था (कोई धुंधला टेक्स्ट नहीं, कोई टाइपिंग की गलती नहीं), फिर भी यह अक्सर प्रस्तुति के तरीके के आधार पर अलग-अलग उत्तर देता था।
- उदाहरण: यदि आप टेक्स्ट में पूछते हैं "7 + 1 क्या है?", तो AI कहता है "8"। यदि आप "7 + 1" की एक तस्वीर दिखाते हैं, तो AI आत्मविश्वास से "9" या "7" कह सकता है।
यह बिल्कुल वैसा ही है जैसे एलेक्स नाम का छात्र पाठ्यपुस्तक पढ़ते समय गणित में बहुत अच्छा है, लेकिन यदि आप उसे पाठ्यपुस्तक के पन्ने की फोटो थमा दें, तो वह अचानक जोड़ना भूल जाता है।
2. "REST" टेस्ट: AI की क्षमता की कड़ी परीक्षा
यह साबित करने के लिए कि यह केवल एक इत्तेफाक नहीं था, शोधकर्ताओं ने एक नई परीक्षा बनाई जिसे REST (रेंडर-इक्विवेलेंस स्ट्रेस टेस्ट्स) कहा जाता है।
REST को एक "ट्यूरिंग टेस्ट" की तरह समझें जो निरंतरता (consistency) की जांच करता है। उन्होंने प्रसिद्ध गणित और तर्क संबंधी पहेलियों को लिया और उन्हें छवियों में बदल दिया। उन्होंने सुनिश्चित किया कि छवियां इतनी स्पष्ट हों कि कोई भी इंसान उन्हें तुरंत पढ़ सके। फिर, उन्होंने 15 अलग-अलग AI मॉडल को उन्हें हल करने के लिए कहा।
निष्कर्ष:
- कोई भी शानदार प्रदर्शन के साथ पास नहीं हुआ। यहाँ तक कि सबसे स्मार्ट मॉडल (जैसे GPT-5-mini और Claude Haiku) भी केवल फॉर्मेट बदलने के कारण लगभग 10% बार गलत हो गए।
- "टेक्स्ट बायस" (The Text Bias): लगभग सभी AI मॉडल टेक्स्ट फॉर्मेट को पसंद करते थे। वे शब्दों को पढ़ने के बजाय चित्रों में शब्दों को देखने में काफी कम स्मार्ट थे।
- यह "ऑप्टिकल कैरेक्टर रिकग्निशन" (OCR) की समस्या नहीं है: आप सोच सकते हैं, "शायद AI फोटो में लिखावट नहीं पढ़ पा रहा है?" शोधकर्ताओं ने इस बात को गलत साबित कर दिया। उन्होंने उन सभी प्रश्नों को हटा दिया जहाँ AI टेक्स्ट पढ़ने में विफल रहा। यहाँ तक कि जब AI ने टेक्स्ट को बिल्कुल सही पढ़ा, तब भी वह इमेज वर्जन के बारे में तर्क करने में कमजोर रहा।
3. "मैजिक ग्लासेस" प्रयोग (विजुअल विशेषताएं)
इसके बाद शोधकर्ताओं ने यह देखने के लिए "जादुई चश्मा" पहना कि क्या इमेज के लुक को बदलने से मदद मिलेगी। उन्होंने बदला:
- रेज़ोल्यूशन (Resolution): इमेज को धुंधला (लो DPI) या शार्प (हाई DPI) बनाना।
- फॉन्ट (Font): कर्सिव, ब्लॉक लेटर्स या टाइपराइटर फॉन्ट का उपयोग करना।
- रंग (Color): टेक्स्ट को काले, नीले या पीले रंग का बनाना।
आश्चर्यजनक बातें:
- धुंधलापन बुरा है: जब इमेज बहुत धुंधली थी, तो AI भ्रमित हो गया।
- रंग अच्छे हैं: आश्चर्यजनक रूप से, रंगीन टेक्स्ट ने AI को काले टेक्स्ट की तुलना में बेहतर प्रदर्शन करने में मदद की! ऐसा लगता है कि AI अपना ध्यान केंद्रित करने के लिए थोड़े रंगीन उभार को पसंद करता है।
- फॉन्ट से ज्यादा फर्क नहीं पड़ा: चाहे वह कर्सिव था या ब्लॉक लेटर्स, AI का प्रदर्शन लगभग एक जैसा ही रहा।
4. "दो दिमागों" का सिद्धांत (ऐसा क्यों हो रहा है?)
शोधकर्ताओं ने AI के "दिमाग" (इसके आंतरिक कोड) की गहराई से जांच की ताकि मूल कारण का पता लगाया जा सके। उन्होंने एक "मोडैलिटी गैप" (Modality Gap) की खोज की।
कल्पना कीजिए कि AI के पास जानकारी के लिए दो अलग-अलग फाइलिंग कैबिनेट हैं:
- टेक्स्ट कैबिनेट: जहाँ यह शब्दों के अर्थ को स्टोर करता है।
- इमेज कैबिनेट: जहाँ यह चित्रों के अर्थ को स्टोर करता है।
समस्या यह है कि ये दोनों कैबिनेट अलग-अलग कमरों में हैं। जब AI को टेक्स्ट में प्रश्न मिलता है, तो वह 'टेक्स्ट रूम' में जाता है। जब उसे इमेज में प्रश्न मिलता है, तो वह 'इमेज रूम' में जाता है। भले ही जानकारी एक ही हो, लेकिन AI के दिमाग में उसका "पता" (address) अलग होता है।
- सहसंबंध (The Correlation): शोधकर्ताओं ने पाया कि ये दोनों कमरे जितने अधिक "एलाइन" (aligned) होते हैं (यानी, AI के अंदर "सेब" शब्द का प्रतिनिधित्व और सेब की तस्वीर का प्रतिनिधित्व जितना समान दिखता है), AI के उत्तर उतने ही अधिक सुसंगत होते हैं।
- निष्कर्ष: AI अलग तरह से "तर्क" (reasoning) नहीं कर रहा है; यह बस जानकारी को दो अलग-अलग लेंसों के माध्यम से देख रहा है जो आपस में मेल नहीं खाते।
5. हमें इसकी परवाह क्यों करनी चाहिए?
यह एक बड़ी बात है क्योंकि हम चिकित्सा निदान (X-rays से) या कानूनी दस्तावेजों के विश्लेषण जैसे महत्वपूर्ण कार्यों के लिए AI सिस्टम बना रहे हैं।
यदि कोई AI एक गणित के सवाल को हल कर सकता है जब आप उसे टाइप करते हैं, लेकिन उसी सवाल की फोटो दिखाने पर विफल हो जाता है, तो हम उस पर पूरी तरह से भरोसा नहीं कर सकते। इसका मतलब है कि AI की बुद्धिमत्ता नाजुक है और इस बात पर निर्भर करती है कि आप सवाल कैसे पूछते हैं, न कि केवल इस पर कि आप क्या पूछते हैं।
मुख्य निष्कर्ष (The Takeaway)
शोध पत्र निष्कर्ष निकालता है कि हालांकि ये AI मॉडल अद्भुत हैं, लेकिन वे अभी भी एक "सार्वभौमिक भाषा" बोलने की सीख रहे हैं जो दृष्टि (sight) और ध्वनि (sound) को जोड़ती है। फिलहाल, वे एक ऐसे व्यक्ति की तरह हैं जो एक ही भाषा की दो बोलियाँ बोलता है लेकिन उनके बीच स्विच करते समय भ्रमित हो जाता है। शोधकर्ता उम्मीद करते हैं कि इस "गैप" को समझकर, हम ऐसा AI बना पाएंगे जो वास्तव में सुसंगत हो, चाहे जानकारी किसी भी रूप में प्रस्तुत की जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।