← नवीनतम पेपर
🤖 AI

MindSet: Vision. A toolbox for testing DNNs on key psychological experiments

यह शोध पत्र "MindSet: Vision" को प्रस्तुत करता है, जो एक बहुमुखी टूलबॉक्स है जिसमें व्यवस्थित रूप से हेरफेर किए गए इमेज डेटासेट और कोड शामिल हैं, जिसे मानव दृश्य धारणा (human visual perception) के 30 विशिष्ट मनोवैज्ञानिक निष्कर्षों के विरुद्ध डीप न्यूरल नेटवर्क का परीक्षण करने के लिए डिज़ाइन किया गया है, जो अवलोकन संबंधी बेंचमार्क से आगे बढ़कर परिकल्पना-संचालित वस्तु पहचान (hypothesis-driven object recognition) का कठोरता से मूल्यांकन करता है।

मूल लेखक: Valerio Biscione, Milton L. Montero, Marin Dujmovic, Gaurav Malhotra, Dong Yin, Guillermo Puebla, Federico Adolfi, Rachel F. Heaton, John E. Hummel, Benjamin D. Evans, Karim Habashy, Jeffrey S. Bowers

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Valerio Biscione, Milton L. Montero, Marin Dujmovic, Gaurav Malhotra, Dong Yin, Guillermo Puebla, Federico Adolfi, Rachel F. Heaton, John E. Hummel, Benjamin D. Evans, Karim Habashy, Jeffrey S. Bowers

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को दुनिया देखना सिखाने की कोशिश कर रहे हैं। आप उसे बिल्लियों, कुत्तों और कारों की लाखों तस्वीरें दिखाते हैं, और वह उन्हें नाम देने में बहुत माहिर हो जाता है। आप शायद कहेंगे, "वाह, यह रोबोट बिल्कुल इंसानों की तरह देख रहा है!"

लेकिन यहाँ एक पेंच है: रोबोट शायद बेईमानी कर रहा है।

वह बिल्ली को उसके आकार या मूंछों से नहीं, बल्कि उसके बालों की बनावट (texture) या फोटो के विशिष्ट बैकग्राउंड से पहचान सकता है। यदि आप उसे किसी अजीब बैकग्राउंड वाली बिल्ली या बिल्ली के रेखाचित्र (drawing) के साथ दिखाएंगे, तो रोबोट भ्रमित हो सकता है, जबकि एक इंसान कहेगा, "यह तो स्पष्ट रूप से एक बिल्ली है!"

यही वह समस्या है जिसे "MindSet: Vision" नामक शोध पत्र हल करने की कोशिश कर रहा है।

समस्या: "अवलोकन" का जाल (The "Observation" Trap)

वर्तमान में AI विजन के अधिकांश परीक्षण वास्तविक जीवन की तस्वीरों पर आधारित 'पॉप क्विज़' की तरह हैं। आप AI को कुत्ते की तस्वीर दिखाते हैं, और वह कहता है "कुत्ता"। यदि वह सही पहचान लेता है, तो आप उसे एक स्टार देते हैं।

लेखकों का तर्क है कि यह एक छात्र के गणित कौशल का परीक्षण करने जैसा है जिसमें केवल उन विशिष्ट समस्याओं के उत्तर रटने के लिए पूछा जाता है जिन्हें उसने पहले देखा है। इससे यह पता नहीं चलता कि क्या वह वास्तव में गणित समझता है।

मनोविज्ञान में, वैज्ञानिकों ने यह पता लगाने के लिए कि इंसान वास्तव में कैसे देखते हैं, 100 वर्षों से प्रयोग (experiments) किए हैं। वे केवल चित्र नहीं दिखाते; वे यह देखने के लिए कि हमारे मस्तिष्क कैसे प्रतिक्रिया करते हैं, उन्हें चालाकी से बदलते हैं।

  • उदाहरण: यदि आप एक बॉक्स के अंदर एक रेखा रखते हैं, तो क्या वह लंबी दिखाई देती है? (मुलर-लियर भ्रम/Müller-Lyer illusion)।
  • उदाहरण: यदि आप एक वृत्त (circle) के कुछ हिस्से को एक वर्ग (square) के पीछे छिपा देते हैं, तो क्या हम अभी भी पूरे वृत्त को "देखते" हैं? (एमोडल कम्प्लीशन/Amodal completion)।

शोध पत्र कहता है: "आइए केवल AI को फोटो दिखाना बंद करें। इसके बजाय, उन्हें ये पेचीदा मनोवैज्ञानिक पहेलियाँ दें।"

समाधान: "MindSet: Vision" टूलबॉक्स

लेखकों ने एक विशाल डिजिटल टूलबॉक्स (AI शोधकर्ताओं के लिए एक स्विस आर्मी नाइफ की तरह) बनाया है जिसमें 30 अलग-अलग मनोवैज्ञानिक प्रयोग शामिल हैं।

इस टूलबॉक्स को AI की आँखों के लिए एक जिम के रूप में सोचें। केवल भारी वजन उठाने (प्राकृतिक फोटो पहचानने) के बजाय, AI को विशिष्ट और अजीब व्यायाम करने होंगे:

  1. "क्राउडिंग" (Crowding) टेस्ट: क्या AI एक अक्षर को पहचान सकता है जब वह अन्य अक्षरों के अराजक ढेर से घिरा हो? (इंसान इसमें संघर्ष करते हैं, और AI भी)।
  2. "भ्रम" (Illusion) टेस्ट: क्या AI ऑप्टिकल इल्यूजन (दृष्टि भ्रम) से धोखा खा सकता है? यदि कोई AI अपने पड़ोसियों के कारण एक वृत्त को बड़ा देखता है (एबिंगहॉस इल्यूजन/Ebbinghaus illusion), तो वह इंसानों की तरह सोच रहा है। यदि ऐसा नहीं है, तो वह कुछ महत्वपूर्ण समझने में चूक रहा है।
  3. "आकार बनाम बनावट" (Shape vs. Texture) टेस्ट: यदि आप कुत्ते की फोटो को एक रेखाचित्र (line drawing) में बदल देते हैं, तो क्या AI अभी भी उसे पहचान सकता है? इंसान यह तुरंत कर सकते हैं; कई AI नहीं कर पाते।

उन्होंने इसका परीक्षण कैसे किया

लेखकों ने 15 सबसे स्मार्ट, प्रसिद्ध AI मॉडलों (कंप्यूटर विजन के "ओलंपिक एथलीटों") को लिया और उन्हें इन 30 में से 9 परीक्षणों से गुजारा।

परिणाम?
यह AI के लिए थोड़ा आपदा जैसा था।

  • अच्छा: कुछ मॉडल सरल आकृतियों और सिलुएट (silhouettes) को संभाल सकते थे।
  • बुरा: अधिकांश मॉडल "चालाकी भरे" परीक्षणों में विफल रहे।
    • वे इंसानों की तरह ऑप्टिकल इल्यूजन (दृष्टि भ्रम) का शिकार नहीं हुए।
    • वे पहचान नहीं सके यदि चित्र केवल एक रेखाचित्र या सिलुएट था।
    • वे यह नहीं समझ पाए कि किसी वस्तु के भाग एक-दूसरे से कैसे संबंधित होते हैं (जैसे कि कप से हैंडल कैसे जुड़ा होता है)।

बड़ा सबक

यह शोध पत्र यह नहीं कह रहा है कि "AI बेकार है।" यह कह रहा है कि, "हम गलत चीजों को माप रहे हैं।"

वर्तमान में, हम AI का जश्न तब मनाते हैं जब वह मानक फोटो परीक्षणों पर 99% सटीकता प्राप्त करता है। लेकिन यह शोध पत्र दिखाता है कि सर्वश्रेष्ठ AI भी उन "मनोविज्ञान 101" के परीक्षणों में विफल हो रहे हैं जिन्हें मानव शिशु आसानी से पास कर लेते हैं।

उपमा (Analogy):
कल्पना कीजिए कि आप एक ड्राइवर का परीक्षण कर रहे हैं।

  • पुराना तरीका: आप उन्हें धूप वाले दिन एक परिचित हाईवे पर गाड़ी चलाने देते हैं। वे बेहतरीन गाड़ी चलाते हैं। आप कहते हैं, "शानदार ड्राइवर!"
  • MindSet तरीका: आप उन्हें धुंधले तूफान में, एक नकली गड्ढे वाले रास्ते पर डालते हैं, और उनसे एक डायवर्जन (मार्ग परिवर्तन) नेविगेट करने को कहते हैं। वे दुर्घटनाग्रस्त हो जाते हैं।

यह शोध पत्र तर्क देता है कि एक वास्तव में "मानव-समान" AI बनाने के लिए, हमें उन्हें धूप वाले हाईवे पर टेस्ट करना बंद करना होगा और उन्हें धुंधले तूफान में टेस्ट करना शुरू करना होगा।

यह क्यों महत्वपूर्ण है

इस टूलबॉक्स का उपयोग करके, शोधकर्ता:

  1. दरारें ढूंढ सकते हैं: देख सकते हैं कि मानव दृष्टि की तुलना में AI विजन कहाँ टूट जाता है।
  2. मॉडल्स को ठीक कर सकते हैं: बेहतर AI बना सकते हैं जो केवल बनावट (textures) को याद नहीं करता, बल्कि वास्तव में आकार, गहराई और संबंधों को समझता है।
  3. इंसानों को समझ सकते हैं: यह देखकर कि AI कहाँ विफल होता है, हम यह भी सीखते हैं कि हमारा अपना मस्तिष्क कैसे काम करता है।

संक्षेप में, MindSet: Vision "ट्रिक सवालों" का एक नया सेट है जिसे AI को बेईमानी करने से रोकने और इसे वास्तव में यह समझने के लिए मजबूर करने के लिए डिज़ाइन किया गया है कि हम दुनिया को कैसे देखते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →