← नवीनतम पेपर
🤖 AI

Chart Deception in Vision-Language Models: From Vulnerability to Mitigation

यह शोध पत्र VisDeception को प्रस्तुत करता है, जो चार्ट के भ्रामक डिजाइनों के प्रति विजन-लैंग्वेज मॉडल्स (Vision-Language Models) की संवेदनशीलता का मूल्यांकन करने के लिए पहला युग्मित बेंचमार्क है, जो दृश्य हेरफेर के प्रति उनकी उच्च संवेदनशीलता को प्रकट करता है और संरचित मेटाडेटा ग्राउंडिंग के माध्यम से मजबूती में सुधार करने के लिए एक मल्टी-एजेंट मिटिगेशन फ्रेमवर्क का प्रस्ताव देता है।

मूल लेखक: Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

प्रकाशित 2026-07-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Ridwan Mahbub, Mohammed Saidul Islam, Md Tahmid Rahman Laskar, Mizanur Rahman, Mir Tafseer Nayeem, Enamul Hoque

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रहस्य सुलझाने की कोशिश कर रहे हैं एक जासूस के रूप में, लेकिन उंगलियों के निशान या पैरों के निशान खोजने के बजाय, आप एक तस्वीर देख रहे हैं। आर्टिफिशियल इंटेलिजेंस की दुनिया में, इनके पास विशेष "सुपर-सेंस" होते हैं जिन्हें विजन-लैंग्वेज मॉडल्स (VLMs) कहा जाता है। इन्हें ऐसे समझें जैसे कि ये अविश्वसनीय रूप से स्मार्ट रोबोट हैं जो एक छवि (जैसे कि कोई चार्ट या ग्राफ) को देख सकते हैं और उससे जुड़ी कहानी को पढ़ सकते हैं, ठीक वैसे ही जैसे एक इंसान करेगा। वे जटिल डेटा को समझने में हमारी मदद करने के लिए प्रसिद्ध हो रहे हैं, स्टॉक मार्केट के रुझानों से लेकर मौसम के पैटर्न तक। लेकिन यहाँ एक पेंच है: जैसे एक जादूगर हाथ की सफाई से आपकी आँखों को धोखा दे सकता है, वैसे ही एक चार्ट को आपके दिमाग को छकाने के लिए डिज़ाइन किया जा सकता है। एक वैज्ञानिक बिल्कुल उन्हीं नंबरों को लेकर उन्हें इस तरह से बना सकता है जिससे एक छोटा सा बदलाव एक बड़े विस्फोट जैसा दिखने लगे, या एक स्थिर बढ़त एक गिरावट जैसी दिखने लगे। यह शोध पत्र एक डरावना सवाल पूछता है: यदि हम इन AI रोबोटों को चार्ट पढ़ना सिखाते हैं, तो क्या वे जादूगर की चालों को पहचानने के लिए पर्याप्त स्मार्ट होंगे, या वे भी उसी तरह धोखा खा जाएंगे जैसे हम हो सकते हैं?

इन इन मॉडल्स के पीछे के शोधकर्ताओं ने इन AI रोबोटों को "चार्ट डीसेप्शन" (Chart Deception) नामक एक खेल के साथ परखने का फैसला किया। उन्होंने VisDeception नामक एक विशाल खेल का मैदान बनाया, जिसमें 1,600 चार्टों के जोड़े शामिल हैं। प्रत्येक जोड़े में, एक चार्ट ईमानदार है और सच बताता है, जबकि दूसरा एक "झूठा" है जो चालाकी भरी डिजाइन ट्रिक्स का उपयोग करता है—जैसे कि अक्षों (axes) को उल्टा करना, तस्वीर को सिकोड़ना ताकि रेखाएं अधिक खड़ी दिखें, या अजीब रंगों का उपयोग करना—ताकी असली कहानी को छिपाया जा सके। वैज्ञानिकों ने दुनिया के 10 सबसे स्मार्ट AI मॉडल्स से इन चार्टों को देखने और सवालों के जवाब देने के लिए कहा। वे देखना चाहते थे कि क्या AI विजुअल ट्रिक्स से भ्रमित हो जाएगा।

परिणाम थोड़े चौंकाने वाले थे। यहाँ तक कि सबसे उन्नत AI रोबोट भी, जिन पर हम आमतौर पर बहुत बुद्धिमान होने के कारण भरोसा करते हैं, धोखा खा गए। जब चार्ट्स को झूठ बोलने के लिए डिज़ाइन किया गया था, तो AI अक्सर अपना उत्तर बदल देता था, विजुअल ट्रिक पर विश्वास करने के बजाय वास्तविक नंबरों पर। उदाहरण के लिए, यदि किसी चार्ट को ऊपर की ओर बढ़ती प्रवृत्ति को नीचे गिरती हुई दिखाने के लिए उल्टा कर दिया गया था, तो AI आत्मविश्वास से कहता था, "ओह नहीं, यह नीचे जा रहा है!" भले ही डेटा कह रहा था कि यह ऊपर जा रहा है। शोधकर्ताओं ने पाया कि AI विशेष रूप से उलटे हुए अक्षों (flipped axes) और भ्रमित करने वाले रंगों वाले ट्रिक्स को पहचानने में खराब था। ऐसा लगता है कि ये रोबोट अभी भी इस बात पर बहुत अधिक ध्यान केंद्रित कर रहे हैं कि चित्र कैसा दिखता है, बजाय इसके कि उसके पीछे का गणित क्या है।

लेकिन चिंता न करें, यह शोध पत्र केवल एक समस्या लेकर नहीं आता है; यह एक चतुर समाधान भी प्रदान करता है। शोधकर्ताओं ने एक नई रणनीति आजमाई जिसे "मल्टी-एजेंट फ्रेमवर्क" (multi-agent framework) कहा जाता है। कल्पना कीजिए कि सवाल का जवाब देने से पहले, AI को एक अनुवादक की तरह कार्य करना होगा। पहले, एक "डेटा एजेंट" चार्ट को देखेगा और वास्तविक नंबरों और नियमों की एक सख्त, उबाऊ सूची लिखेगा (जैसे कि "Y-अक्ष उल्टा है")। फिर, एक "सॉल्वर एजेंट" उस सूची का उपयोग करके उत्तर का पता लगाएगा, चमकदार और भ्रामक चित्र को अनदेखा करते हुए। यह तरीका स्मार्ट मॉडल्स के लिए जादू की तरह काम कर गया। इसने उन्हें यह समझने में मदद की, "रुको, चित्र झूठ बोल रहा है, लेकिन नंबर कुछ और कह रहे हैं!" उदाहरण के लिए, एक शीर्ष मॉडल, जेमिनी 2.5 प्रो (Gemini 2.5 Pro) ने इस नए तरीके का उपयोग करने पर अपनी गलतियों को पूरे 76% तक कम कर दिया।

तो, इसका क्या अर्थ है? यह शोध पत्र सुझाव देता है कि हालांकि हमारा AI चार्ट पढ़ने में बेहतर हो रहा है, लेकिन यह उन विजुअल ट्रिक्स के प्रति संवेदनशील है जिनसे इंसान भी धोखा खा सकते हैं। हालाँकि, AI को निर्णय लेने से पहले "रसीदें" (स्ट्रक्चर्ड डेटा) चेक करने के लिए मजबूर करके, हम उसे धोखा देना बहुत कठिन बना सकते हैं। यह अध्ययन दिखाता है कि भविष्य के लिए वास्तव में भरोसेमंद AI बनाने के लिए, हम केवल इस पर निर्भर नहीं रह सकते कि रोबोट कितना अच्छा दिखता है; हमें उसे जादू के पीछे के गणित को दोबारा जांचना सिखाना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →