← नवीनतम पेपर
🤖 AI

Probing Perceptual Constancy in Large Vision-Language Models

यह अध्ययन रंग, आकार और रूप स्थिरता (color, size, and shape constancy) पर 236 प्रयोगों के माध्यम से 155 विजन-लैंग्वेज मॉडल्स का मूल्यांकन करता है, जो प्रदर्शन की महत्वपूर्ण परिवर्तनशीलता और रूप स्थिरता की क्षमताओं तथा रंग और आकार की क्षमताओं के बीच एक स्पष्ट पृथक्करण को प्रकट करता है।

मूल लेखक: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Ho
प्रकाशित 2026-02-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक लाल सेब को देख रहे हैं। यदि आप उससे दूर जाते हैं, तो वह छोटा दिखाई देता है। यदि आप उस पर नीली टॉर्च जलाते हैं, तो वह बैंगनी दिखाई देता है। यदि आप उसे बगल से देखते हैं, तो वह एक वृत्त के बजाय एक अंडाकार (oval) जैसा दिखता है।

एक मानव मस्तिष्क अद्भुत है क्योंकि वह जानता है कि सेब अभी भी एक बड़ा, लाल, गोल सेब ही है, चाहे वे बदलाव क्यों न हों। वह इन बदलावों से धोखा नहीं खाता। इस सुपरपावर को परसेप्चुअल कॉन्स्टेंसी (Perceptual Constancy) कहा जाता है।

यह शोध पत्र 155 अलग-अलग "AI मस्तिष्क" (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है) के लिए एक विशाल रिपोर्ट कार्ड की तरह है, यह देखने के लिए कि क्या उनके पास भी यही सुपरपावर है। शोधकर्ताओं ने इस सुपरपावर की जांच करने के लिए एक विशेष परीक्षण बनाया जिसे ConstancyBench कहा जाता है, जो तीन विशिष्ट कौशलों की जांच करता है:

1. परीक्षण किए गए तीन कौशल

इन कौशलों को एक वीडियो गेम के तीन अलग-अलग स्तरों के रूप में सोचें:

  • कलर कॉन्स्टेंसी (प्रकाश का स्तर - The "Lighting" Level): क्या AI यह बता सकता है कि एक सफेद दीवार सफेद ही है, भले ही कमरे में पीला लैंप या नीला नियॉन साइन लगा हो?
    • परीक्षण: AI अजीब रोशनी में एक रूबिक क्यूब को देखता है और उसे बीच वाले वर्ग का असली रंग बताना होता है।
  • साइज कॉन्स्टेंसी (दूरी का स्तर - The "Distance" Level): क्या AI समझ सकता है कि दूर खड़ी कार और पास खड़ी कार का आकार वास्तव में एक ही है, भले ही दूर वाली कार स्क्रीन पर छोटी दिखाई दे रही हो?
    • परीक्षण: AI दो मिसाइलों को देखता है, एक बहुत पीछे और एक बिल्कुल करीब, और उसे यह तय करना होता है कि क्या वे वास्तव में अलग-अलग आकार की हैं या केवल परिप्रेक्ष्य (perspective) के कारण अलग दिख रही हैं।
  • शेप कॉन्स्टेंसी (कोण का स्तर - The "Angle" Level): क्या AI जान सकता है कि एक गोल प्लेट अभी भी एक वृत्त ही है, भले ही उसे इस तरह झुकाया गया हो कि वह एक अंडाकार (oval) जैसी दिखे?
    • परीक्षण: AI एक दरवाजे को देखता है जो थोड़ा खुला और झुका हुआ है, जिससे वह एक समलंब (trapezoid) जैसा दिखता है, और उसे यह समझना होता है कि वह वास्तव में एक आयत (rectangle) है।

2. परिणाम: कौन पास हुआ?

शोधकर्ताओं ने 155 अलग-अलग AI मॉडल का परीक्षण किया, जिनमें छोटे, हल्के मॉडल से लेकर विशाल, अत्यंत बुद्धिमान मॉडल (जैसे GPT-4o) तक शामिल थे। यहाँ उन्हें क्या पता चला:

  • "शेप" कौशल आसान है: AI मॉडल शेप कॉन्स्टेंसी (आकार की स्थिरता) में आश्चर्यजनक रूप से अच्छे थे। ऐसा लगता है जैसे वे चीजों की "आउटलाइन" पहचानने में माहिर हैं। छोटे मॉडल भी यह समझने में सक्षम थे कि एक झुका हुआ आयत अभी भी एक आयत ही है।
  • "कलर" और "साइज" कौशल कठिन हैं: मॉडल कलर (रंग) और साइज (आकार) के मामले में बहुत संघर्ष करते हैं। वे अक्सर रोशनी या दूरी से चकमा खा जाते हैं। ऐसा लगता है जैसे वे एक सपाट तस्वीर देख रहे हैं और भूल जाते हैं कि दुनिया 3D है और इसमें बदलती रोशनी होती है।
  • बड़े दिमाग बेहतर प्रदर्शन करते हैं: एक स्पष्ट नियम था: AI मॉडल जितना बड़ा होगा, वह इन परीक्षणों में उतना ही बेहतर होगा।
    • छोटे मॉडल अक्सर विफल हो जाते हैं, और सरल ट्रिक्स से भ्रमित हो जाते हैं।
    • विशाल मॉडल (AI जगत के "दिग्गज") इन परीक्षणों में बहुत बेहतर प्रदर्शन करते हैं, विशेष रूप से आकार और दूरी को समझने में। ऐसा लगता है कि जैसे-जैसे आप AI को अधिक "ब्रेन पावर" (पैरामीटर्स) देते हैं, वह 3D दुनिया को समझने में बेहतर होता जाता है।

3. मुख्य निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि AI के पास अभी तक एक एकल, पूर्ण "मानव जैसा" विजन नहीं है। इसके बजाय, इसके पास एक स्तरीकृत (stratified) दृष्टि है:

  • यह सरल ज्यामिति (आकार) में अच्छा है।
  • यह दुनिया के पैमाने और रोशनी को समझने में बेहतर हो रहा है (आकार और रंग), लेकिन केवल तभी जब मॉडल बहुत बड़ा हो।

लेखकों का सुझाव है कि हालांकि ये AI मॉडल स्मार्ट होते जा रहे हैं, लेकिन वे दुनिया को उस तरह से "देख" नहीं रहे हैं जैसे इंसान देखते हैं। इसके बजाय, वे शायद केवल उन पैटर्न्स के आधार पर अनुमान लगाने में बहुत अच्छे हैं जिन्हें उन्होंने अपने प्रशिक्षण डेटा में देखा है, न कि भौतिक विज्ञान (physics) की वास्तविक समझ के आधार पर।

संक्षेप में: यदि आप AI से किसी आकार को पहचानने के लिए कहते हैं, तो वह आमतौर पर स्मार्ट होता है। यदि आप उससे यह पूछने के लिए कहते हैं कि रोशनी या दूरी के कारण किसी चीज़ का वास्तविक रंग या आकार क्या है, तो वह अभी भी सीख रहा है। और AI जितना बड़ा होगा, उसके धोखा खाने की संभावना उतनी ही कम होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →