Real Images, Worse Judgments: Evaluating Vision-Language Models on Concreteness and Imagery
यह शोध पत्र यह प्रदर्शित करता है कि विजन-लैंग्वेज मॉडल्स को वास्तविक-छवि संदर्भ प्रदान करने से अक्सर स्पूरियस (मिथ्या) दृश्य संकेतों के प्रति संवेदनशीलता उत्पन्न होकर, मूर्तता (concreteness) और कल्पनाशीलता (imagery) के शाब्दिक निर्णयों पर उनके प्रदर्शन में गिरावट आती है, जो इस बात का सुझाव देता है कि इस बात के बेहतर अंशांकन (calibration) की आवश्यकता है कि दृश्य इनपुट को ऐसे कार्यों में कब सूचित करना चाहिए।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक परीक्षा दे रहे हैं जहाँ आपको किसी विशिष्ट शब्द के कितने "ठोस" या "चित्रणीय" (picture-able) होने का अनुमान लगाना है। उदाहरण के लिए, क्या शब्द "सेब" (apple) को चित्रित करना आसान है? हाँ। क्या शब्द "स्वतंत्रता" (freedom) को चित्रित करना आसान है? वास्तव में नहीं।
अब, कल्पना कीजिए कि आप यह परीक्षा तब दे रहे हैं जब कोई व्यक्ति आपको शब्द के बगल में एक यादृच्छिक (random) चित्र दिखा रहा है।
यह शोध पत्र जांच करता है कि क्या आधुनिक AI मॉडल (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) इस परीक्षण में क्या करते हैं। शोधकर्ता यह देखना चाहते थे कि क्या AI को एक चित्र दिखाने से वह शब्द को बेहतर ढंग से समझने में मदद मिलती है, या क्या वह चित्र वास्तव में उसे विचलित करता है और उसे गलत उत्तर देने पर मजबूर करता है।
यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. सेटअप: "विचलित करने वाली कक्षा"
शोधकर्ताओं ने AI को शब्दों की एक सूची दी और उससे उन्हें "कितना ठोस" (वास्तविक/स्पर्श करने योग्य) या "कितना कल्पना करने में आसान" के पैमाने पर रेट करने के लिए कहा।
- कंट्रोल ग्रुप (Control Group): AI ने केवल शब्द देखा (या एक खाली सफेद वर्ग के साथ)।
- टेस्ट ग्रुप (Test Group): AI ने शब्द साथ ही इंटरनेट से प्राप्त एक वास्तविक फोटो देखी।
बड़ी हैरानी:
आप सोच सकते हैं, "यदि मैं AI को 'कुत्ता' (dog) का चित्र दिखाता हूँ, तो उसे यह जानने में बेहतर होना चाहिए कि 'कुत्ता' एक ठोस शब्द है।" और सरल, ठोस शब्दों के लिए, AI ने ठीक प्रदर्शन किया।
हालाँकि, अमूर्त शब्दों (abstract words) के लिए (जैसे "न्याय", "स्वतंत्रता", या "प्रकृति"), चित्रों ने AI को और भी खराब कर दिया।
- उपमा: कल्पना कीजिए कि एक छात्र गणित की परीक्षा दे रहा है। यदि आप उन्हें प्रश्न "2+2 क्या है?" के बगल में एक कैलकुलेटर का चित्र थमा देते हैं, तो वे इसे सही कर सकते हैं। लेकिन यदि आप उनसे पूछें, "क्या 'ईमानदारी' की अवधारणा कठिन या आसान है?", और आप उन्हें एक सूर्यास्त का चित्र थमा दें, तो छात्र भ्रमित हो जाएगा। वह उस सुंदर सूर्यास्त को देखेगा और कहेगा, "ओह, यह बहुत ठोस और वास्तविक है!" और शब्द "ईमानदारी" को वास्तविकता के लिए उच्च स्कोर देगा, भले ही वह शब्द स्वयं ऐसा न हो। चित्र एक तेज़, विचलित करने वाले पड़ोसी की तरह काम करता जो गलत उत्तर चिल्ला रहा हो।
2. "मानव बनाम रोबोट" तुलना
यह सुनिश्चित करने के लिए कि यह केवल एक अजीब AI समस्या नहीं थी, शोधकर्ताओं ने वास्तविक मनुष्यों को भी वही परीक्षण करने के लिए कहा।
- परिणाम: मनुष्य भी चित्रों से थोड़ा विचलित हुए, लेकिन वे पूरी तरह से विफल नहीं हुए। वे जानते थे कि चित्र केवल एक सजावट था।
- AI की समस्या: AI, हालांकि, चित्र को ठोस प्रमाण मानता था। वह यह अंतर नहीं कर सका कि "कुत्ते का चित्र" (जो साबित करता है कि 'कुत्ता' शब्द वास्तविक है) और "सूर्यास्त का चित्र" (जिसका 'स्वतंत्रता' से कोई लेना-देना नहीं है) के बीच क्या अंतर है। AI ने शब्द के अर्थ के बजाय चित्र की सामग्री के आधार पर अनुमान लगाना शुरू कर दिया।
3. ऐसा क्यों हुआ? ("आंतरिक गड़बड़ी")
शोधकर्ताओं ने AI के "मस्तिष्क" (इसके आंतरिक डेटा स्तरों) के अंदर झाँका कि क्या गलत हो रहा था।
- शिफ्ट (Shift): जब AI ने एक वास्तविक चित्र देखा, तो शब्द के बारे में उसकी आंतरिक समझ वास्तव में बदल गई। यह ऐसा था जैसे AI के मस्तिष्क ने अचानक निर्णय लिया, "ओह, मैं अब एक चित्र देख रहा हूँ, इसलिए मुझे जो दिख रहा है उसके आधार पर उत्तर देना चाहिए, न कि जो मैं पढ़ रहा हूँ उसके आधार पर।"
- संवेदनशीलता: AI "स्प्यूरियस क्यूज़" (spurious cues) के प्रति अत्यधिक संवेदनशील हो गया। यह एक फैंसी तरीका है यह कहने का कि वह चित्र के उन यादृच्छिक विवरणों से चिपक गया जिनका शब्द से कोई लेना-देना नहीं था। अमूर्त शब्दों के लिए, इस कारण से AI ने शब्द के कितने "वास्तविक" होने का अत्यधिक आकलन किया।
4. समाधान: "शिक्षक का नोट"
चूंकि AI विचलित हो रहा था, शोधकर्ताओं ने एक सरल ट्रिक आजमाई। उन्होंने प्रॉम्प्ट में एक छोटा सा निर्देश जोड़ा, जैसे एक शिक्षक का नोट:
"हे, यह चित्र शब्द से संबंधित नहीं भी हो सकता है। कृपया चित्र को अनदेखा करें और केवल शब्द को रेट करें।"
परिणाम:
- यह सरल नोट एक मानसिक फिल्टर की तरह काम कर गया। इसने AI को विचलित करने वाले पड़ोसी को देखना बंद करने और टेस्ट प्रश्न पर ध्यान केंद्रित करने के लिए कहा।
- इससे AI के प्रदर्शन में काफी सुधार हुआ, विशेष रूप से उन कठिन अमूर्त शब्दों के लिए। इसने सब कुछ पूरी तरह से ठीक नहीं किया, लेकिन इसने AI को सबसे बड़ी गलतियाँ करने से रोक दिया।
सारांश
शोध पत्र निष्कर्ष निकालता है कि जबकि हम अक्सर यह मान लेते हैं कि AI को चित्र देने से वह स्मार्ट हो जाता है, कभी-कभी चित्र वास्तव में एक जाल होते हैं।
- ठोस चीजों के लिए (जैसे "बिल्ली" शब्द को पहचानने में मदद करने के लिए बिल्ली का चित्र), चित्र मदद करते हैं।
- अमूर्त चीजों के लिए (जैसे "शांति" को पहचानने के लिए तूफान का चित्र), चित्र AI को भ्रमित करते हैं, जिससे वह गलत संकेतों पर निर्भर हो जाता है।
समाधान चित्रों का उपयोग करना बंद करना नहीं है, बल्कि AI को यह सिखाना है कि कब उन्हें अनदेखा करना है। ठीक वैसे ही जैसे एक अच्छा छात्र जानता है कि कब एक आरेख (diagram) को देखना है और कब अपनी आँखें बंद करके अवधारणा के बारे में सोचना है, इन AI मॉडल्स को भी यह सीखने की आवश्यकता है कि दृश्य संदर्भ कब एक सहायक संकेत है और कब वह केवल शोर (noise) है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।