Do Vision-Language Models Understand Visual Persuasiveness? A Diagnosis via Visual Persuasive Factors
यह शोध पत्र दृश्य प्रभावशीलता (visual persuasiveness) का आकलन करने में विजन-लैंग्वेज मॉडल्स की सीमाओं का निदान करता है, जो रिकॉल-ओरिएंटेड बायस (recall-oriented bias) के कारण अति-पूर्वानुमान लगाने और वस्तुओं की पहचान को सिमेंटिक संदर्भ के साथ ठीक से संरेखित करने में विफलता को प्रकट करते हुए, यह दर्शाता है कि लक्षित विजुअल पर्सुएसिव फैक्टर्स (VPFs) हस्तक्षेपों के माध्यम से प्रदर्शन में सुधार किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आधुनिक दुनिया में, चित्र शायद ही कभी केवल सजावट के होते हैं। सिगरेट के पैकेटों पर सार्वजनिक स्वास्थ्य चेतावनियों से लेकर राजनीतिक अभियान पोस्टरों तक, दृश्य तत्वों को इस तरह तैयार किया जाता है कि वे हमारे सोचने, महसूस करने और कार्य करने के तरीके को आकार दे सकें। यह प्रक्रिया, जिसे 'विजुअल पर्सुएशन' (दृश्य अनुनय) कहा जाता है, इस बात पर निर्भर करती है कि हम जो देखते हैं और जो संदेश हम पढ़ते हैं, उनके बीच एक जटिल परस्पर क्रिया होती है। एक उज्ज्वल, खुशनुमा फोटो एक सुरक्षा टिप को उत्साहजनक बना सकती है, जबकि एक गहरा, अव्यवस्थित चित्र उसी टिप को डरावना बना सकता है। दशकों से, मनोवैज्ञानिकों ने अध्ययन किया है कि मनुष्य इन संकेतों को कैसे संसाधित करते हैं, यह समझते हुए कि हमारे मस्तिष्क रंगों, वस्तुओं के स्थान और लोगों की उपस्थिति को यह तय करने के लिए तौलते हैं कि कोई संदेश कितना विश्वसनीय है। अब, जैसे-जैसे आर्टिफिशियल इंटेलिजेंस सिस्टम एक साथ छवियों को देखने और पढ़ने में सक्षम हो रहे हैं, एक महत्वपूर्ण प्रश्न उभरा है: क्या ये मशीनें अनुनय को उसी तरह समझती हैं जैसे इंसान समझते हैं, या वे केवल सतही पैटर्न के आधार पर अनुमान लगा रही हैं?
दक्षिण कोरिया के POSTECH में शोधकर्ताओं की एक टीम ने आधुनिक विजन-लैंग्वेज मॉडल्स को एक कठोर परीक्षण में डालकर इसका उत्तर देने का प्रयास किया। ये उन्नत कंप्यूटर सिस्टम हैं जो एक छवि को देख सकते हैं और एक टेक्स्ट संदेश पढ़ सकते हैं, और फिर यह समझने का प्रयास करते हैं कि चित्र टेक्स्ट का कितनी अच्छी तरह समर्थन करता है। शोधकर्ताओं ने 562 चित्र-और-संदेश युग्मों (pairs) का एक सावधानीपूर्वक क्यूरेट किया गया संग्रह बनाया। ये इंटरनेट से मिले यादृच्छिक चित्र नहीं थे; इन्हें इसलिए चुना गया था क्योंकि मानव न्यायाधीशों ने पहले ही उन्हें देखा था और इस बात पर लगभग पूर्ण सहमति व्यक्त की थी कि प्रत्येक युग्म अत्यधिक प्रेरक था या नहीं। इसने एक स्पष्ट "ग्राउंड ट्रुथ" (वास्तविक सत्य) बनाया जिसके विरुद्ध कंप्यूटर मॉडल को मापा जा सके। लक्ष्य यह देखना था कि क्या मशीनें मानवीय निर्णय की नकल कर सकती हैं या वे इस बात के बारे में कुछ मौलिक समझने में चूक रही हैं कि दृश्य अनुनय कैसे काम करता है।
परिणामों ने एक चौंकाने वाले और सुसंगत दोष को उजागर किया कि ये कृत्रिम बुद्धिमत्ता प्रणाली कैसे कार्य करती हैं। 'हाँ' कहने की ओर झुकाव दिखाने के लिए ये मॉडल अत्यधिक पक्षपाती थे। वे उन छवियों को पकड़ने में अविश्वसनीय रूप से अच्छे थे जिन्हें मनुष्य प्रेरक पाते थे, लेकिन वे गैर-प्रेरक छवियों को भी प्रेरक बताने के लिए बहुत अधिक उत्सुक थे। तकनीकी शब्दों में, उन्होंने उच्च "रिकॉल" प्राप्त किया लेकिन 'फॉल्स पॉजिटिव' (गलत सकारात्मकता) की बाढ़ से जूझ रहे थे। मूल रूप से, मशीनें अनुनय की अति-भविष्यवाणी कर रही थीं, और लगभग किसी भी छवि को जिसमें एक संभावित दृश्य तत्व मौजूद था, एक सफल तर्क मान रही थीं। वे इस मानवीय क्षमता की कमी प्रदर्शित कर रहे थे कि कब एक दृश्य संकेत केवल उपस्थित होता है बनाम कब वह वास्तव में अनुनय का कार्य कर रहा होता है।
यह समझने के लिए कि ऐसा क्यों हो रहा था, शोधकर्ताओं ने दृश्य दुनिया को विशिष्ट, मापने योग्य घटकों में विभाजित किया जिन्हें उन्होंने 'विजुअल पर्सुएसिव फैक्टर्स' (दृश्य प्रेरक कारक) कहा। ये कारक एक छवि के तत्काल संवेदी प्रभाव, जैसे कि इसकी रंगीनता और चमक से लेकर, इसके संयोजन, जैसे कि मुख्य विषय केंद्र में है या काल्पनिक ग्रिड लाइनों के प्रतिच्छेदन पर, तक विस्तृत थे। उन्होंने अर्थ संबंधी तत्वों (semantic elements) को भी देखा, जैसे कि क्या कोई प्रमुख वस्तु, एक मानव आकृति, या टेक्स्ट का कोई हिस्सा दिखाई दे रहा है। जब शोधकर्ताओं ने तुलना की कि मनुष्य और मशीनें इन कारकों को कैसे तौलते हैं, तो एक स्पष्ट अंतर दिखाई दिया। मनुष्य इन संकेतों का सूक्ष्मता से उपयोग करते थे, यह समझते हुए कि एक उज्ज्वल छवि एक सकारात्मक संदेश के लिए प्रेरक हो सकती है लेकिन नकारात्मक के लिए नहीं। हालाँकि, मशीनें अक्सर एक संकेत की उपस्थिति को ही सफलता की गारंटी मान लेती थीं। उदाहरण के लिए, यदि किसी छवि में मानव चेहरा या टेक्स्ट में उल्लेखित कोई विशिष्ट वस्तु शामिल थी, तो मॉडल उसे प्रेरक घोषित करने की संभावना रखते थे, भले ही समग्र संदर्भ इसके विपरीत हो। वे एक रेसिपी (व्यंजन) के घटकों को तैयार व्यंजन समझने की गलती कर रहे थे।
अध्ययन ने यह भी पता लगाया कि क्या मशीनों को अधिक स्पष्ट निर्देश देना इस समस्या को ठीक कर सकता है। शोधकर्ताओं ने दो मुख्य दृष्टिकोणों का परीक्षण किया। सबसे पहले, उन्होंने मॉडल्स को विस्तृत ज्ञान दिया, उन्हें उदाहरण के तौर पर बताया कि एक व्यक्ति की उपस्थिति को एक निर्णायक कारक के बजाय एक सहायक सुराग के रूप में माना जाना चाहिए। दूसरा, उन्होंने मॉडल्स को चरण-दर-चरण सोचने के लिए कहा, यानी अंतिम निर्णय लेने से पहले अपने तर्क को तोड़ने के लिए कहा। यहाँ निष्कर्ष सूक्ष्म थे। मॉडल्स को सही संदर्भ प्रदान करना—विशेष रूप से, इन दृश्य संकेतों को एक निश्चित नियम के बजाय व्याख्या किए जाने वाले कुछ के रूप में फ्रेम करना—ने त्रुटियों की संख्या को कम करने में मदद की। हालाँकि, केवल मॉडल्स को समस्या पर तर्क करने के लिए कहना या किसी वस्तु की उपस्थिति की ओर इशारा करना पर्याप्त नहीं था। कुछ मामलों में, मॉडल्स को स्पष्ट संकेतों के साथ तर्क करने के लिए मजबूर करने से उनका पूर्वाग्रह वास्तव में और खराब हो गया, जिससे वे गलत निर्णयों पर और अधिक अडिग हो गए।
शोधकर्ताओं ने पाया कि मुख्य मुद्दा मशीन की तर्क प्रक्रिया में एक विशिष्ट बाधा (bottleneck) में निहित था। जब टीम ने चरण-दर-चरण स्पष्टीकरणों का विश्लेषण किया, तो उन्होंने पाया कि मशीनें वस्तुओं को पहचानने और टेक्स्ट का वर्णन करने में आम तौर पर अच्छी थीं। वे यह भी समझा सकती थीं कि एक वस्तु संदेश से कैसे संबंधित हो सकती है। विफलता अंतिम चरण में हुई: साक्ष्य को संचार के अंतिम लक्ष्य से जोड़ना। मॉडल यह तय करने में संघर्ष कर रहे थे कि उनके द्वारा खोजा गया दृश्य साक्ष्य वास्तव में इच्छित संदेश का समर्थन करता है या यह केवल एक संयोग है। वे हिस्सों को देख सकते थे, लेकिन वे उन्हें एक सुसंगत निर्णय में संश्लेषित करने में सक्षम नहीं थे।
यह शोध बताता है कि हालांकि आर्टिफिशियल इंटेलिजेंस ने एक छवि में क्या है, इसे पहचानने में जबरदस्त प्रगति की है, लेकिन इसमें अभी भी इस बात की गहरी, प्रासंगिक समझ की कमी है कि वह छवि क्यों महत्वपूर्ण है। मशीनें वर्तमान में अनुनय के घटकों को पहचानने में उत्कृष्ट हैं लेकिन अंतिम उत्पाद का स्वाद चखने में कमजोर हैं। वे मान लेते हैं कि यदि सही दृश्य तत्व मौजूद हैं, तो संदेश अवश्य ही प्रेरक होगा, और वे संदर्भ, स्वर और इरादे को तौलने की सूक्ष्म मानवीय क्षमता को अनदेखा कर देते हैं। अध्ययन निष्कर्ष निकालता है कि इन प्रणालियों के लिए दृश्य अनुनय को वास्तव में समझने के लिए, उन्हें केवल वस्तुओं की पहचान करने से आगे बढ़कर उन अवलोकनों को उनके पीछे के संचार उद्देश्य से जोड़ना सीखना होगा। जब तक वे वह छलांग नहीं लगा सकते, वे बिना किसी आधार के अनुनय देखने के प्रति संवेदनशील रहेंगे, और एक संकेत की उपस्थिति को एक संदेश की शक्ति समझने की गलती करते रहेंगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।