I Came, I Saw, I Explained: Benchmarking Multimodal LLMs on Figurative Meaning in Memes
यह शोध पत्र इंटरनेट मीम्स में लाक्षणिक अर्थों का पता लगाने और उन्हें समझाने की उनकी क्षमता पर आठ अत्याधुनिक मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स का बेंचमार्किंग करता है, जिससे यह पता चलता है कि हालांकि मॉडल ऐसे अर्थों की पहचान कर सकते हैं, वे लाक्षणिक सामग्री मौजूद होने का अनुमान लगाने की ओर एक मजबूत पूर्वाग्रह प्रदर्शित करते हैं और अक्सर उनके पूर्वानुमान सही होने पर भी निष्ठापूर्ण स्पष्टीकरण प्रदान करने में विफल रहते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक पार्टी है जहाँ हर कोई चुटकुले सुना रहा है, मीम्स साझा कर रहा है और अंदरूनी बातें (inside jokes) बना रहा है। एक मीम (meme) इस पार्टी से भेजे गए एक पोस्टकार्ड की तरह है: इसमें एक तस्वीर और कुछ शब्द होते हैं, लेकिन असली मज़ा अक्सर केवल शब्दों या तस्वीर में नहीं होता। यह उनके बीच के ट्विस्ट (twist) में होता है।
उदाहरण के लिए, यदि एक तस्वीर में एक बिल्ली गुस्से में दिख रही है और टेक्स्ट कहता है, "मैं आया, मैंने देखा, मैं शिकायत की," तो मज़ा एक प्रसिद्ध वीरतापूर्ण उद्धरण का मज़ाक उड़ाने में है। इसे समझने के लिए आपको इतिहास, लहजे और दृश्य संकेत (visual cue) को समझना होगा। इसे आलंकारिक अर्थ (figurative meaning) कहा जाता है—एक बात कहना लेकिन दूसरी बात का अर्थ निकालना, या किसी गहरी बात को कहने के लिए तस्वीर का उपयोग करना।
यह पेपर एक रिपोर्ट कार्ड की तरह है जो नवीनतम, सबसे स्मार्ट एआई रोबोटों (जिन्हें मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स या MLLMs कहा जाता है) के लिए है, यह देखने के लिए कि क्या वे वास्तव में इन चुटकुलों को "समझ" सकते हैं।
यहाँ बताया गया है कि शोधकर्ताओं ने क्या किया और उन्हें क्या मिला, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:
1. परीक्षण: "मीम ओलंपिक्स"
शोधकर्ताओं ने आठ सबसे स्मार्ट एआई मॉडल्स को (सोचिए कि वे एआई की दुनिया के शीर्ष एथलीट हैं) एक कठिन परीक्षण से गुजारा।
- एथलीट: अया (Aya), जेम्मा (Gemma) और क्वेन (Qwen) जैसे परिवारों के मॉडल (जो छोटे और फुर्तीले से लेकर विशाल और भारी-भरकम दिग्गजों तक विस्तृत हैं)।
- इवेंट्स: उन्होंने एआई को तीन अलग-अलग प्रकार के मीम्स दिखाए।
- कार्य:
- पहचानना (Detect): "क्या यह मीम एक चुटकुला (आलंकारिक) बना रहा है, या यह सिर्फ एक सामान्य तस्वीर (शाब्दिक) है?"
- व्याख्या करना (Explain): "यह एक चुटकुला क्यों है? इसकी कहानी बताओ।"
2. एक बड़ा आश्चर्य: "अति-उत्साही जासूस"
सबसे बड़ी खोज यह थी कि एआई मॉडल साजिश करने वाले सिद्धांतकारों (conspiracy theorists) या अति-उत्साही जासूसों की तरह हैं।
- पूर्वाग्रह (Bias): यहाँ तक कि जब एक मीम पूरी तरह से गंभीर और शाब्दिक होता है (जैसे सैंडविच खाते हुए कुत्ते की फोटो), तब भी एआई लगभग हमेशा कहता है, "आह! यह एक गहरा रूपक है! यहाँ कोई छिपा हुआ अर्थ है!"
- उपमा: एक ऐसे जासूस की कल्पना करें जो दूध खरीदने वाले व्यक्ति को देखता है और तुरंत निष्कर्ष निकालता है, "वह निश्चित रूप से एक जासूस है जो दूध के कार्टन में गुप्त कोड छिपा रहा है!" एआई बस छिपे हुए अर्थ खोजने के लिए बेताब रहता है, भले ही वहाँ कोई न हो। वह मान लेता है कि हर मीम एक पहेली है जिसे सुलझाना है, भले ही वह सिर्फ एक साधारण तस्वीर हो।
3. "आंखों पर पट्टी" वाला परीक्षण: उन्हें क्या देखने की आवश्यकता है?
यह पता लगाने के लिए कि एआई इन चुटकुलों को कैसे समझता है, शोधकर्ताओं ने एआई के साथ एक चाल चली। उन्होंने एआई को तीन तरीकों से मीम्स दिखाए:
- पूरा मीम: तस्वीर + टेक्स्ट।
- केवल टेक्स्ट: सिर्फ शब्द (तस्वीर को मिटा दिया गया)।
- केवल इमेज: सिर्फ तस्वीर (शब्दों को मिटा दिया गया)।
परिणाम:
- विडंबना (Irony) और व्यंग्य (Sarcasm): ये दृश्य पंचलाइन (visual punchlines) की तरह हैं। यदि आप तस्वीर हटा देते हैं, तो एआई भ्रमित हो जाता है। चुटकुले को समझने के लिए उसे गुस्से वाला चेहरा या अजीब स्थिति देखने की आवश्यकता होती है।
- रूपक (Metaphors): ये जटिल रेसिपी की तरह हैं। आपको व्यंजन बनाने के लिए दोनों सामग्रियों (टेक्स्ट) और पकाने के तरीके (इमेज) की आवश्यकता होती है। यदि आप एआई को केवल टेक्स्ट या केवल इमेज देते हैं, तो वह बुरी तरह विफल हो जाता है। कनेक्शन को समझने के लिए उसे पूरे पैकेज की आवश्यकता होती है।
- अतिशयोक्ति (Exaggeration): दिलचस्प रूप से, कभी-कभी एआई अतिशयोक्ति को पहचानने में तब बेहतर हो जाता है जब टेक्स्ट हटा दिया जाता है, जिससे पता चलता है कि वह पहले बहुत अधिक शब्दों पर निर्भर था और उनसे विचलित हो रहा था।
4. "भ्रम" (Hallucination) की समस्या: आत्मविश्वास के साथ झूठ बोलना
शोधकर्ताओं ने एआई से पूछा कि उसे क्यों लगा कि एक मीम मजेदार है। यहीं पर चीजें गड़बड़ा गईं।
- समस्या: भले ही एआई ने सही लेबल (जैसे, "यह व्यंग्य है") का अनुमान लगाया हो, लेकिन उसकी व्याख्या अक्सर मनगढ़ंत होती थी।
- उपमा: एक छात्र की कल्पना करें जो परीक्षा दे रहा है। वह सही उत्तर का अनुमान लगाता है, लेकिन जब शिक्षक उससे पूछता है, "अपना काम दिखाओ (show your work)," तो छात्र लिखता है, "क्योंकि तस्वीर में बिल्ली ने टोपी पहनी है, और टोपियां व्यंग्य का प्रतीक हैं।"
- उत्तर सही था, लेकिन तर्क निरर्थक था।
- एआई अक्सर उन विवरणों को "हैलुसिनेट" (मनगढ़ंत विवरण बनाना) करता है जो वहां नहीं हैं (जैसे कि बिल्ली के मुंह पर उंगली देखना जबकि वह वास्तव में अपनी नाक उठा रही है) या चुटकुले के पीछे की वास्तविक मानवीय भावना को मिस कर देता है।
5. "मानवीय स्पर्श" का अंतर
शोधकर्ताओं ने मनुष्यों से एआई की व्याख्याओं को ग्रेड करने के लिए कहा।
- फैसला: एआई टेक्स्ट पढ़ने में बहुत अच्छा है लेकिन माहौल (room) को पढ़ने में बहुत बुरा है। वह सामाजिक बारीकियों (social nuance) को समझने में चूक जाता है।
- उदाहरण: एक मीम में दिखाया गया था कि कोई व्यक्ति फोन पर $1,000 खर्च करने को तैयार है लेकिन 99 सेंट के ऐप के लिए गुस्सा हो जाता है। यह मानव मनोविज्ञान (हम बड़े खर्चों को तर्कसंगत बनाते हैं लेकिन छोटी फीस से नफरत करते हैं) के बारे में है। आधे एआई मॉडल इसे पूरी तरह से मिस कर गए, इसे एक सामाजिक अवलोकन के बजाय एक शाब्दिक गणितीय समस्या के रूप में माना। उनमें "सड़क की समझ" (street smarts) की कमी है।
निचोड़ (The Bottom Line)
यह पेपर हमें बताता है कि हालांकि एआई पढ़ने और देखने में अविश्वसनीय रूप से अच्छा हो रहा है, फिर भी वह मीम की आत्मा को समझने के लिए संघर्ष कर रहा है।
- यह बहुत उत्सुक है: यह वहां भी रूपक देखता है जहां कोई नहीं है।
- यह एक बुरा कहानीकार है: यह अपने अनुमानों के लिए अक्सर मनगढ़ंत कारण बनाता है।
- इसमें जीवन के अनुभव की कमी है: यह मानव व्यवहार के अजीब और तर्कहीन तरीकों को नहीं समझता, जो अक्सर एक मीम को मजेदार बनाता है।
संक्षेप में: एआई उस प्रतिभाशाली रोबोट की तरह है जिसने लाइब्रेरी की हर किताब पढ़ ली है लेकिन वह कभी किसी पार्टी में नहीं गया है। वह भाषा के नियमों को जानता है, लेकिन उसने अभी तक 'इनसाइड जोक' की कला नहीं सीखी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।