← नवीनतम पेपर
🤖 machine learning

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

VRIQ बेंचमार्क यह प्रकट करता है कि वर्तमान विज़न लैंग्वेज मॉडल्स विज़ुअल रीजनिंग कार्यों पर खराब प्रदर्शन करते हैं, जिसका मुख्य कारण तर्क संबंधी कमियों के बजाय धारणा संबंधी सीमाएँ हैं, जिसमें अमूर्त पहेलियों पर 28% से लेकर प्राकृतिक छवियों पर 45% तक की सटीकता देखी गई है।

मूल लेखक: Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

प्रकाशित 2026-02-06
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बेहद बुद्धिमान रोबोटों की एक टीम है जो किताबें पढ़ सकती हैं और तस्वीरें देख सकती है। आप यह जानना चाहते हैं कि वे वास्तव में "बुद्धिमान" हैं या वे केवल अनुमान लगाने में बहुत अच्छे हैं। यह पता लगाने के लिए, इस शोध पत्र के लेखकों ने एक विशेष परीक्षण बनाया जिसे VRIQ (विजुअल रीजनिंग IQ) कहा गया।

VRIQ को एक विशाल, डिजिटल "पहेली बॉक्स" की तरह समझें जिसे इन रोबोटों को चकमा देने के लिए डिज़ाइन किया गया है। इस बॉक्स में दो प्रकार की पहेलियाँ हैं:

  1. अमूर्त पहेलियाँ (Abstract Puzzles): ये क्लासिक आईक्यू टेस्ट कार्ड्स की तरह हैं जिनमें अजीब आकार, रेखाएं और पैटर्न होते हैं। यहाँ कोई वास्तविक दुनिया की वस्तुएं नहीं हैं, बस प्रतीक हैं।
  2. प्राकृतिक पहेलियाँ (Natural Puzzles): ये रोज़मर्रा की चीज़ों, जैसे सेब, कार या लोगों की असली तस्वीरों का उपयोग करती हैं, लेकिन पूछती हैं वही पेचीदा तर्क संबंधी प्रश्न।

बड़ी हैरानी: रोबोट "अंधे" हैं

जब शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट एआई मॉडल्स (ओपनएआई और गूगल सहित प्रसिद्ध मॉडल्स) का परीक्षण किया, तो उन्हें एक चौंकाने वाली बात पता चली।

  • अमूर्त पỂलियों पर: रोबोट लगभग उतना ही खराब प्रदर्शन कर रहे थे जितना कि वे बिना किसी आधार के केवल अंदाज़ा लगा रहे हों। उनका औसत स्कोर लगभग 28% था (जहाँ 25% शुद्ध भाग्य या तुक्का है)। यह एक ऐसे छात्र की तरह है जिसने शब्दकोश तो रट लिया है लेकिन एक भी वाक्य नहीं पढ़ सकता।
  • प्राकृतिक पहेलियों पर: उन्होंने थोड़ा बेहतर प्रदर्शन किया (लगभग 45%), लेकिन वे अभी भी पूर्णता से बहुत दूर थे।

शोध पत्र यह खुलासा करता है कि समस्या यह नहीं है कि रोबोट "सोचने" (तर्क करने) में खराब हैं। समस्या यह है कि वे "देखने" (प्रत्यक्षण/परसेप्शन) में खराब हैं।

जासूसी कार्य: वे क्यों विफल हुए?

यह पता लगाने के लिए कि रोबोट वास्तव में कहाँ विफल हो रहे हैं, शोधकर्ताओं ने जासूसों की तरह काम किया। उन्होंने केवल यह नहीं पूछा, "उत्तर क्या है?" बल्कि उन्होंने हर पहेली को "प्रोब प्रश्नों" (जांच प्रश्नों) का उपयोग करके छोटे-छोटे चरणों में विभाजित किया।

कल्पना कीजिए कि एक रोबोट एक पहेली में विफल हो जाता है जहाँ उसे अलग दिखने वाले आकार को खोजना है। शोधकर्ताओं ने पूछा:

  • परसेप्शन प्रोब (देखने की जांच): "आपको कितने लाल घेरे दिखाई दे रहे हैं?"
  • रीजनिंग प्रोब (तर्क की जांच): "यदि 3 लाल घेरे हैं और नियम है 'एक को हटा दें', तो क्या शेष बचा?"

जांच के परिणाम:

  • 56% बार: रोबोट इसलिए विफल हुआ क्योंकि वह बुनियादी चीज़ों को नहीं देख सका (जैसे, वह घेरों को गिन नहीं सका या यह नहीं बता सका कि आकार किस दिशा में इशारा कर रहा था)।
  • 43% बार: रोबोट बुनियादी चीज़ों को नहीं देख सका और तर्क भी नहीं लगा सका।
  • केवल 1% बार: रोबोट ने सब कुछ पूरी तरह से देखा लेकिन उसका तर्क गलत निकला।

रूपक (Metaphor): यह एक शेफ को केक की रेसिपी देने जैसा है। शेफ (AI) बेकिंग के तर्क को पूरी तरह से जानता है। लेकिन यदि शेफ की आँखों पर पट्टी बंधी हो और वह देख न पाए कि वहाँ 4 के बजाय केवल 2 अंडे हैं, तो केक विफल हो जाएगा। विफलता खाना बनाने के तर्क की नहीं थी; यह सामग्री को देखने में असमर्थता की थी।

"टूल" का मोड़

शोधकर्ताओं ने एक और चीज़ आज़माई। उन्होंने एक विशिष्ट एआई मॉडल (OpenAI का o3) को डिजिटल टूल्स का एक सेट दिया, जैसे कि एक आवर्धक लेंस (magnifying glass), एक कैंची (छवियों को क्रॉप करने के लिए), और एक कैलकुलेटर। इस मॉडल को छवियों के साथ "सोचने" की अनुमति दी गई, यानी उत्तर देने से पहले सक्रिय रूप से चित्र में बदलाव करने की अनुमति मिली।

परिणाम: इस टूल का उपयोग करने वाला रोबोट बहुत आगे निकल गया। वह अमूर्त पहेलियों पर 28% के स्कोर से उछलकर 50% से अधिक पर पहुँच गया और प्राकृतिक पहेलियों पर 80-100% तक पहुँच गया। यह साबित करता है कि यदि आप रोबोट को बेहतर "आंखें" (टूल्स) देते हैं, तो उसका "दिमाग" (तर्क) बहुत बेहतर काम करता है।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि वर्तमान एआई मॉडल इसलिए विफल नहीं हो रहे हैं क्योंकि उनमें बुद्धिमत्ता या तर्क की कमी है। वे इसलिए विफल हो रहे हैं क्योंकि उन्हें दृश्य दुनिया को सटीक रूप से देखने (perceive) में संघर्ष करना पड़ता है। वे वस्तुओं को विश्वसनीय रूप से गिन नहीं सकते, 3D गहराई को नहीं समझ सकते, या यह नहीं बता सकते कि कोई चीज़ किस दिशा में घूम रही है।

एआई को दृश्य तर्क (visual reasoning) में वास्तव में स्मार्ट बनाने के लिए, हमें केवल बड़े दिमागों की ही नहीं, बल्कि उन्हें बेहतर आंखों की भी आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →