Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families
यह शोध पत्र यह प्रदर्शित करता है कि विजन-लैंग्वेज मॉडल्स में स्थानिक तर्क (spatial reasoning) की एक मौलिक सीमा है, क्योंकि टेक्स्ट संकेतों के बिना बाइनरी ग्रिड में भरे हुए सेल्स को स्थानीयकृत करने की उनकी क्षमता ढह जाती है, जो मूल दृश्य प्रसंस्करण (native visual processing) के बजाय टेक्स्ट-रिकग्निशन पाथवे पर उनके भारी निर्भरता को प्रकट करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक विशाल, 15-बाय-15 का चेकरबोर्ड (checkerboard) है। कुछ खाने काले रंग के हैं, और कुछ सफेद छोड़े गए हैं। आपका काम एक तस्वीर को देखना है और कंप्यूटर को ठीक-ठीक बताना है कि कौन से खाने काले हैं।
आप सोच सकते हैं, "कोई समस्या नहीं! AI तस्वीरें देखने में बहुत माहिर है।" लेकिन यह शोध पत्र एक मज़ेदार, निराशाजनक रहस्य उजागर करता है: ये AI मॉडल "शुद्ध" तस्वीरें देखने में वास्तव में बहुत खराब हैं, लेकिन वे "ऐसी तस्वीरों को पढ़ने में अद्भुत हैं जो टेक्स्ट जैसी दिखती हैं।"
यहाँ इस प्रयोग की कहानी सरल रूप में दी गई है।
एक ही पहेली के दो संस्करण
शोधकर्ताओं ने दो अलग-अलग तरीकों से बिल्कुल एक ही चेकरबोर्ड पैटर्न बनाए:
- "टाइपराइटर" संस्करण: उन्होंने ग्रिड को टेक्स्ट कैरेक्टर्स (text characters) का उपयोग करके बनाया। खाली खानों के लिए बिंदु (
.) और भरे हुए खानों के लिए हैश चिन्ह (#) का उपयोग किया गया।- उदाहरण:
.#.#.
- उदाहरण:
- "सॉलिड ब्लॉक" संस्करण: उन्होंने ग्रिड को ठोस काले और सफेद खानों का उपयोग करके बनाया, जिसमें कोई ग्रिड लाइन या टेक्स्ट नहीं था। बस काले पिक्सल का एक धब्बा।
- उदाहरण: एक ठोस काला वर्ग एक सफेद वर्ग के बगल में।
ट्विस्ट: कंप्यूटर की "आँख" (विजुअल एनकोडर) के लिए, ये दोनों ही केवल चित्र हैं। इनमें से कोई भी "असली" टेक्स्ट नहीं है जिसे कंप्यूटर किताब की तरह पढ़ सके। ये दोनों ही केवल पिक्सल हैं।
परिणाम: दो दिमागों की कहानी
जब शोधकर्ताओं ने तीन शीर्ष-स्तरीय AI मॉडलों (Claude, ChatGPT, और Gemini) को इन ग्रिडों को ट्रांसक्राइब (लिखने) करने के लिए कहा, तो परिणाम चौंकाने वाले थे:
- जब ग्रिड टेक्स्ट जैसा दिखता था (
.#.#): AI लगभग सटीक थे। उन्होंने लगभग 90% खाने सही पहचाने। वे आपको बता सकते थे कि हर काला खाना ठीक कहाँ स्थित है। - जब ग्रिड ठोस ब्लॉकों जैसा दिखता था: AI पूरी तरह विफल रहे। उनकी सटीकता गिरकर 60-70% रह गई, और सटीक काले खानों को खोजने की उनकी क्षमता 30-40% तक गिर गई।
उपमा (Analogy):
कल्पना कीजिए कि आप भीड़ में किसी विशिष्ट व्यक्ति को खोजने की कोशिश कर रहे हैं।
- परिदृश्य A (टेक्स्ट): हर कोई बड़े अक्षरों में अपना नाम लिखा हुआ नेमटैग पहने हुए है। आप नाम पढ़ सकते हैं और व्यक्ति को तुरंत ढूंढ सकते हैं।
- परिदृश्य B (ब्लॉक्स): हर कोई एक ठोस काला मास्क पहने हुए है। आप काले आकारों की एक भीड़ देख सकते हैं, लेकिन आप एक व्यक्ति को दूसरे से अलग नहीं कर सकते या सटीक व्यक्ति को नहीं पहचान सकते।
AI मॉडल उन लोगों की तरह हैं जो नेमटैग पढ़ने में तो बहुत तेज़ हैं लेकिन मास्क पहने हुए चेहरों को पहचानने में बहुत खराब हैं।
ऐसा क्यों होता है?
यह शोध पत्र सुझाव देता है कि ये AI एक "चीट कोड" का उपयोग करते हैं जब वे टेक्स्ट देखते हैं।
- "OCR" की महाशक्ति: जब AI
#प्रतीक देखता है, तो वह इसे केवल एक काली आकृति के रूप में नहीं देखता। वह इसे एक "हैश साइन" के रूप में पहचानता है। क्योंकि वह जानता है कि यह एक कैरेक्टर है, वह अपने पढ़ने वाले दिमाग (जो बहुत अच्छा है कि पेज पर अक्षर कहाँ होते हैं) का उपयोग करके स्थान का पता लगाता है। यह अनिवार्य रूप से एक स्थानिक पहेली (spatial puzzle) को हल करने के लिए आंतरिक "ऑप्टिकल कैरेक्टर रिकग्निशन" (छवि को टेक्स्ट के रूप में पढ़ना) कर रहा है। - "विजुअल" कमजोरी: जब AI एक ठोस काला वर्ग देखता है, तो वह अपने पढ़ने वाले दिमाग का उपयोग नहीं कर पाता। उसे अपने देखने वाले दिमाग (शुद्ध विजुअल प्रोसेसिंग) पर निर्भर रहना पड़ता है। शोध पत्र दिखाता है कि वर्तमान AI का "देखने वाला दिमाग" सटीक स्थानों को पहचानने के मामले में काफी धुंधला है। वह बता सकता है कि "वहाँ एक काला धब्बा है," लेकिन वह यह नहीं बता सकता कि "वह ठीक से स्क्वायर नंबर 4, रो 2 है।"
मशीन में "भूत" (The Ghost in the Machine)
शोधकर्ताओं ने पाया कि प्रत्येक AI ठोस ब्लॉकों को देखते समय अपने अनूठे और अजीब तरीके से विफल हुआ:
- Claude एक "अंडर-काउंटर" (कम गिनने वाला) था। उसने काला क्षेत्र देखा लेकिन सोचा, "यह बहुत अधिक वर्ग हैं," इसलिए उसने कुछ को छोड़ दिया।
- ChatGPT एक "ओवर-काउंटर" (ज़्यादा गिनने वाला) था। वह उत्साहित हो गया और उन काले खानों की कल्पना करने लगा जो मौजूद ही नहीं थे, जिससे धब्बे वास्तविक आकार से बड़े दिखने लगे।
- Gemini एक "पैटर्न फेकर" (पैटर्न बनाने वाला) था। जब ग्रिड बहुत भीड़भाड़ वाला हो गया, तो उसने हार मान ली और एक रैंडम "प्लस साइन" या "L-शेप" पैटर्न बना दिया जो वास्तविक ग्रिड से बिल्कुल अलग था। वह केवल इस आधार पर अनुमान लगा रहा था कि एक ग्रिड कैसा होना चाहिए।
"मैजिक लेबल" प्रयोग
अपने सिद्धांत को सिद्ध करने के लिए, शोधकर्ताओं ने एक बीच का रास्ता अपनाया। उन्होंने ठोस काले वर्गों को लिया और उनके अंदर एक छोटा सा "1" और सफेद खानों के अंदर "0" लिख दिया।
- Claude और Gemini के लिए: यह जादू की तरह काम किया! जैसे ही उन्होंने नंबर देखे, उनका प्रदर्शन आसमान छू गया। टेक्स्ट ने उनकी दृष्टि को "एंकर" (स्थिर) कर दिया।
- ChatGPT के लिए: यह भ्रमित हो गया। काले खानों के अंदर छोटे टेक्स्ट ने इसे वास्तव में और भी बदतर बना दिया। ऐसा लगता है कि ChatGPT का "पढ़ने वाला दिमाग" और "देखने वाला दिमाग" आपस में उलझ गए और एक-दूसरे से टकरा गए।
मुख्य निष्कर्ष (The Big Takeaway)
यह शोध पत्र हमें आधुनिक AI के बारे में एक विनम्र सबक सिखाता है:
ये मॉडल दुनिया को उस तरह से नहीं "देख" रहे हैं जैसे इंसान देखते हैं। वे ज्यादातर दुनिया को "पढ़" रहे हैं। यदि आप उन्हें ऐसा चित्र देते हैं जो किसी दस्तावेज़ या स्प्रेडशीट जैसा दिखता है, तो वे जीनियस हैं। लेकिन यदि आप उन्हें केवल आकृतियों, रंगों और बिना किसी टेक्स्ट वाले धब्बों का चित्र देते हैं, तो उनका स्थानिक तर्क (spatial reasoning) बिखर जाता है।
यह एक ऐसे लाइब्रेरियन की तरह है जो शेल्फ पर रखी किसी भी किताब को ढूंढ सकता है यदि उनकी रीढ़ (spines) पर शीर्षक लिखे हों, लेकिन यदि सभी किताबें सादे भूरे कागज में लिपटी हों, तो वह पूरी तरह से खो जाता है। जब तक हम इसे ठीक नहीं करते, हम पूरी तरह से भरोसा नहीं कर सकते कि ये AI दृश्य दुनिया में नेविगेट कर सकते हैं, जब तक कि हम उन्हें पकड़ने के लिए टेक्स्ट लेबल न दें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।