← नवीनतम पेपर
🤖 machine learning

MentalBlackboard: Evaluating Spatial Visualization via Mathematical Transformations

यह शोध पत्र मेंटलब्लैकबोर्ड (MentalBlackboard) को पेश करता है, जो पेपर फोल्डिंग और होल पंचिंग कार्यों के माध्यम से विजन-लैंग्वेज मॉडल्स में स्थानिक दृश्यीकरण (spatial visualization) का मूल्यांकन करने के लिए एक बेंचमार्क है, जो यह प्रकट करता है कि अत्याधुनिक मॉडल भी सममित रूपांतरणों (symmetrical transformations) और बहु-चरणीय नियोजन (multi-stage planning) के साथ काफी संघर्ष करते हैं, और मुख्य भविष्यवाणी कार्यों पर अधिकतम 25% सटीकता प्राप्त करते हैं।

मूल लेखक: Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang

प्रकाशित 2026-02-24
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nilay Yilmaz, Maitreya Patel, Naga Sai Abhiram Kusumba, Yixuan He, Yezhou Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके हाथों में कागज का एक टुकड़ा है। आप इसे आधा मोड़ते हैं, फिर दोबारा आधा, शायद तिरछा भी। फिर, आप ढेर सारे कागजों के उस गुच्छे के बीच में एक छेद कर देते हैं। अब, बड़ा सवाल यह है: जब आप उस कागज को खोलेंगे, तो उसमें छेद कहाँ-कहाँ होंगे?

यह स्थानिक दृश्यीकरण (spatial visualization) का एक क्लासिक परीक्षण है—यानी मानसिक रूप से वस्तुओं को घुमाने, मोड़ने और खोलने की क्षमता। यह उसी तरह की सोच है जिसका उपयोग इंजीनियर पुलों को डिजाइन करने के लिए करते हैं और आर्किटेक्ट गगनचुंबी इमारतों को बनाने के लिए करते हैं।

यह शोध पत्र, जिसका शीर्षक "MentalBlackboard" है, एक बहुत ही आधुनिक प्रश्न पूछता है: क्या आर्टिफिशियल इंटेलिजेंस (AI) यह कर सकता है?

यहाँ शोधकर्ताओं ने क्या किया, उन्हें क्या मिला, और यह क्यों महत्वपूर्ण है, इसका सरल विवरण दिया गया है, जिसमें कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग किया गया है।

1. "मेंटल ब्लैकबोर्ड" (परीक्षण)

शोधकर्ताओं ने MentalBlackboard नामक एक नया गेम बनाया। इसे AI के दिमाग के लिए एक डिजिटल जिम की तरह समझें।

  • सेटअप: उन्होंने हजारों ऐसी स्थितियाँ बनाईं जहाँ कागज के एक आभासी टुकड़े को मोड़ा जाता है, घुमाया (spin) जाता है, और उसमें छेद किए जाते हैं।
  • दो चुनौतियाँ:
    • अनुमान लगाना (जादुई ट्रिक - Prediction): AI फोल्डिंग के चरणों और छेद को देखता है। उसे यह अनुमान लगाना होता है कि अंत में खुला हुआ कागज कैसा दिखेगा।
    • योजना बनाना (रिवर्स इंजीनियरिंग - Planning): AI अंत में छेद वाला कागज देखता है और उसे समझना होता है: "मैंने इसे कैसे मोड़ा था? मैंने छेद कहाँ किया था?"

उन्होंने यह परीक्षण आज के सबसे स्मार्ट AI मॉडल्स (जैसे o3, Claude Opus, और GPT-5) पर किया, और उन्हें यह कार्य तीन तरीकों से दिया: एक वीडियो के रूप में, एक 2D चित्र के रूप में, या टेक्स्ट (शब्दों) के रूप में।

2. परिणाम: AI मोड़ों में खो गया

परिणाम आश्चर्यजनक थे। भले ही ये AI कविताएँ लिख सकते हैं, सॉफ्टवेयर कोड कर सकते हैं और धाराप्रवाह बातचीत कर सकते हैं, वे इस सरल कागज वाले खेल में बुरी तरह संघर्ष करते रहे।

  • "दर्पण" की समस्या (The Mirror Problem): जब आप कागज मोड़ते हैं, तो छेद एक दर्पण की छवि (mirror image) की तरह प्रतिबिंबित होते हैं। AI अक्सर छेदों की संख्या तो सही बताता है, लेकिन उन्हें गलत स्थानों पर रख देता है, जैसे कि वह भूल गया हो कि दर्पण कैसे काम करते हैं।
  • "घूमने" की समस्या (The Spin Problem): जब कागज को घुमाया (90 डिग्री) गया, तो AI भ्रमित हो गया। यह वैसा ही है जैसे कि आप उल्टा चश्मा पहनकर पहेली सुलझाने की कोशिश कर रहे हों; AI यह ट्रैक नहीं रख सका कि "ऊपर" की दिशा क्या थी।
  • "परत" की समस्या (The Layer Problem): जब कागज मुड़ा होता है, तो आपके पास परतों के ऊपर परतें होती हैं। AI अक्सर भूल जाता था कि ऊपरी परत पर किया गया छेद नीचे की परत तक नहीं पहुँच पाएगा यदि बीच में कोई गैप हो। उसने कागज को कागज के ढेर के बजाय कांच की एक सपाट शीट की तरह माना।

स्कोरकार्ड:

  • प्लानिंग (रिवर्स इंजीनियरिंग): सबसे अच्छा AI केवल 10% सही था। यह अनुमान लगाने से भी बहुत कम है!
  • प्रेडिक्शन (फॉरवर्ड थिंकिंग): सबसे अच्छा AI लगभग 25% सही था।
  • मानव तुलना: मनुष्यों ने समान सरल कार्यों पर लगभग 75% स्कोर किया। AI अभी भी स्थानिक सोच (spatial thinking) के मामले में मानव स्तर से बहुत दूर है।

3. वे क्यों असफल हुए? (उपमाएँ)

शोधकर्ताओं ने पाया कि AI की विफलता केवल "जानकारी की कमी" के बारे में नहीं थी। यह इस बारे में थी कि वे "सोचते" कैसे हैं।

  • "रोबोट शेफ" की उपमा: एक रोबोट शेफ की कल्पना करें जो रेसिपी (टेक्स्ट) को पूरी तरह पढ़ सकता है लेकिन उसने कभी चाकू पकड़ा नहीं है या यह नहीं देखा है कि आटा कैसे खिंचता है। AI फोल्डिंग के निर्देशों को पढ़ने में तो माहिर है, लेकिन फोल्डिंग की भौतिक क्रिया को मानसिक रूप से देखने में बहुत खराब है।
  • "मेमोरी गैप": इसे हल करने के लिए आपको याद रखना होगा: "मैंने इसे बाईं ओर मोड़ा, फिर घुमाया, फिर नीचे की ओर मोड़ा।" AI जैसे ही कार्य जटिल होता है, क्रम को ट्रैक करना खो देता है, जैसे जुग्लिंग (juggling) करते समय फोन नंबर याद रखने की कोशिश करना।
  • "टेक्स्ट बनाम इमेज" का आश्चर्य: दिलचस्प बात यह है कि AI ने चित्रों (images) की तुलना में टेक्स्ट (शब्दों) के माध्यम से कार्य को थोड़ा बेहतर ढंग से किया। ऐसा लगता है जैसे AI किसी तस्वीर को देखने के बजाय लिखित मानचित्र का पालन करने में बेहतर है।

4. "जनरलाइजेशन" टेस्ट (चीट कोड)

शोधकर्ताओं ने एक चाल भी आजमाई। उन्होंने AI को एक हल की हुई पहेली दिखाई और पूछा, "यदि मैं सिर्फ एक चीज़ बदल दूँ (जैसे छेद को हिलाना), तो क्या होगा?"

  • परिणाम: AI इसमें बहुत बेहतर था (~70%)।
  • क्यों? क्योंकि इसके लिए AI को मानसिक रूप से कागज को "मोड़ने" की आवश्यकता नहीं थी। उसे बस एक पैटर्न को कॉपी करना था। यह साबित करता है कि AI पैटर्न मैचिंग में अच्छा है लेकिन मानसिक हेरफेर (mental manipulation) में बुरा है।

5. यह क्यों मायने रखता है?

आप पूछ सकते हैं, "किसको फर्क पड़ता है अगर एक AI कागज नहीं मोड़ सकता?"

यह एक बड़ी बात है क्योंकि स्थानिक दृश्यीकरण (spatial visualization) इन चीजों का आधार है:

  • रोबोटिक्स: यदि एक रोबोट मानसिक रूप से यह नहीं देख सकता कि कंबल कैसे मोड़ना है या कार का हिस्सा कैसे जोड़ना है, तो वह वे काम नहीं कर सकता।
  • चिकित्सा: सर्जनों को शरीर के अंदर 3D अंगों को विज़ुअलाइज़ करने की आवश्यकता होती है।
  • इंजीनियरिंग: जटिल मशीनों को डिजाइन करने के लिए यह देखना आवश्यक है कि पुर्जे 3D स्पेस में एक-दूसरे में कैसे फिट होते हैं।

निष्कर्ष

MentalBlackboard पेपर हमें बताता है कि जबकि हमारा AI बात करने और पढ़ने में स्मार्ट हो रहा है, यह अभी भी अपने मन में भौतिक दुनिया को "देखने" और "हेरफेर करने" के लिए संघर्ष कर रहा है।

यह एक ऐसे प्रतिभाशाली छात्र की तरह है जो भौतिकी के नियमों को रट सकता है लेकिन उसने कभी लेगो (Lego) सेट नहीं बनाया है। अगली पीढ़ी के रोबोट और स्मार्ट मशीनें बनाने के लिए, हमें उन्हें केवल कागज मोड़ने के बारे में पढ़ना ही नहीं, बल्कि उसे महसूस करना और देखना भी सिखाना होगा। तब तक, AI गलत जगहों पर छेद करने की कोशिश करता रहेगा!

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →