← नवीनतम पेपर
💻 computer science

GIQ: Benchmarking 3D Geometric Reasoning of Vision Foundation Models with Simulated and Real Polyhedra

यह शोध पत्र GIQ प्रस्तुत करता है, जो विजन और विजन-लैंग्वेज फाउंडेशन मॉडल्स का मूल्यांकन करने के लिए विविध सिंथेटिक और वास्तविक बहुफलकीय (polyhedra) का उपयोग करने वाला एक व्यापक बेंचमार्क है, जो 3D पुनर्निर्माण, सममिति (symmetry) पहचान और आकार वर्गीकरण जैसे कार्यों में उनकी ज्यामितीय तर्क क्षमताओं में महत्वपूर्ण कमियों को उजागर करता है।

मूल लेखक: Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

प्रकाशित 2026-02-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mateusz Michalkiewicz, Anekha Sokhal, Tadeusz Michalkiewicz, Piotr Pawlikowski, Mahsa Baktashmotlagh, Varun Jampani, Guha Balakrishnan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास बहुत बुद्धिमान रोबोटों का एक समूह है जिन्हें दुनिया की लाखों तस्वीरें दिखाई गई हैं। वे बिल्लियों, कारों को पहचानने और यहाँ तक कि कविताएँ लिखने में भी माहिर हैं। लेकिन इस शोध पत्र के लेखकों ने एक सरल प्रश्न पूछना चाहा: क्या ये रोबोट वास्तव में 3D दुनिया को समझते हैं, या वे केवल पैटर्न को याद कर रहे हैं?

यह पता लगाने के लिए, उन्होंने GIQ (जियोमेट्रिक आईक्यू टेस्ट) नामक एक परीक्षण बनाया। GIQ को रोबोट के लिए "ड्राइवर लाइसेंस परीक्षा" के रूप में समझें, लेकिन ड्राइविंग के बजाय, उन्हें क्यूब्स, पिरामिड्स और जटिल तारे के आकार जैसी आकृतियों को समझना होगा।

यहाँ शोध पत्र को कुछ रोजमर्रा के उपमाओं का उपयोग करके समझाया गया है:

1. परीक्षण के विषय: "पॉलीहेड्रा" (Polyhedra)

शोधकर्ताओं ने सेब या कुर्सियों जैसी यादृच्छिक वस्तुओं का उपयोग नहीं किया। उन्होंने पॉलीहेड्रा का उपयोग किया—ज्यामितीय आकृतियाँ जो सपाट सतहों से बनी होती हैं, जैसे पासा (dice), सॉकर बॉल, या जटिल तारे जैसे क्रिस्टल।

  • रेंज: उन्होंने सरल आकृतियों (जैसे एक सटीक क्यूब) से शुरुआत की और अविश्वसनीय रूप से जटिल आकृतियों (जैसे एक "मिलर का मॉन्स्टर," जिसमें 124 चेहरे होते हैं और जो उलझे हुए तारों के जाल जैसा दिखता है) की ओर बढ़े।
  • सेटअप: उन्होंने रोबोटों का परीक्षण दो तरीकों से किया:
    • वीडियो गेम की दुनिया: इन आकृतियों की सटीक, कंप्यूटर-जनरेटेड छवियां।
    • वास्तविक दुनिया: उन्होंने इन आकृतियों के वास्तविक कागज के मॉडल बनाए, उन्हें बाहर रखा और बर्फ, धूप और बिखरे हुए लिविंग रूम में उनकी तस्वीरें लीं। यह ऐसा है जैसे यह परीक्षण करना कि क्या एक रोबोट वीडियो गेम में खिलौने को पहचान सकता है और एक धूल भरी रसोई की मेज पर रखे असली खिलौने को भी।

2. चार चुनौतियाँ

शोधकर्ताओं ने रोबोटों को चार विशिष्ट परीक्षणों के माध्यम से यह देखने के लिए रखा कि वे वास्तव में कितने "ज्यामितीय रूप से स्मार्ट" हैं।

A. "वन-शॉट" पुनर्निर्माण (क्या वे फोटो से बना सकते हैं?)

कार्य: रोबोट को एक 3D आकार की एक एकल तस्वीर दिखाएं और उससे पूर्ण 3D मॉडल बनाने के लिए कहें।
परिणाम: पूर्ण विफलता। लाखों 3D वस्तुओं पर प्रशिक्षित सबसे अच्छे रोबोट भी इसे सही ढंग से नहीं कर सके।

  • उपमा: कल्पना करें कि किसी को एक आदर्श क्यूब की फोटो दिखाकर उसे बनाने के लिए कहना। सीधे किनारों और तीखे कोनों वाले क्यूब के बजाय, रोबोट एक डगमगाता हुआ, टेढ़ा-मेढ़ा ढेर बनाता है। वह एक क्यूब के बुनियादी "समकोण" (right angles) को भी सही नहीं कर सका। जब आकृतियाँ अधिक जटिल हुईं, तो रोबोट के "निर्माण" पूरी तरह से बिखर गए।

B. सिमेट्री स्पॉटर (क्या वे पैटर्न देख सकते हैं?)

कार्य: रोबोट को एक आकृति दिखाएं और पूछें, "क्या इसमें एक केंद्र बिंदु है जहाँ यह वैसा ही दिखता है यदि आप इसे पलट दें?" या "क्या इसमें 4-फोल्ड रोटेशन (जैसे एक क्रॉस) है?"
परिणाम: आश्चर्यजनक रूप से अच्छा।

  • उपमा: हालांकि रोबोट आकृतियों को बनाने में बहुत खराब थे, लेकिन वे सिमेट्री (सममिति) को पहचानने में काफी अच्छे थे। यह एक ऐसे व्यक्ति की तरह है जो एक सटीक वृत्त नहीं बना सकता लेकिन तुरंत बता सकता है कि कोई ड्राइंग सममित है या नहीं। शोधकर्ताओं ने पाया कि रोबरों की "आंखें" (उनके आंतरिक मस्तिष्क की परतें) इन 3D पैटर्न को स्वाभाविक रूप से पकड़ लेती थीं, भले ही उन्हें इसके लिए स्पष्ट रूप से सिखाया न गया हो।

C. मेंटल रोटेशन टेस्ट (क्या वे इसे घुमाकर कल्पना कर सकते हैं?)

कार्य: रोबोट को एक ही आकार की दो तस्वीरें दिखाएं, लेकिन एक घुमाई हुई है। पूछें: "क्या ये एक ही वस्तु हैं?"
परिणाम: संघर्ष कर रहे हैं।

  • उपमा: यह एक रुबिक क्यूब को हाथ में पकड़ने, मन में उसे घुमाने और यह देखने जैसा है कि क्या वह दूसरे क्यूब से मेल खाता है। रोबोट आसानी से भ्रमित हो जाते थे। जब आकृतियाँ सरल थीं, तो उन्होंने ठीक-ठाक प्रदर्शन किया। लेकिन जब आकृतियाँ कठिन थीं या फोटो वास्तविक दुनिया में ली गई थी (छाया और अजीब कोणों के साथ), तो रोबोट अनुमान लगाने लगे।
  • मानव तुलना: शोधकर्ताओं ने वास्तविक मनुष्यों को यह परीक्षण लेने के लिए कहा। जबकि सबसे अच्छे रोबोट का स्कोर औसत मानव स्कोर के बराबर था, 68% वास्तविक मनुष्यों ने सबसे अच्छे रोबोट से बेहतर प्रदर्शन किया। रोबोट सूक्ष्म अंतरों को संभालने में असमर्थ रहे।

D. नाम का खेल (जीरो-शॉट क्लासिफिकेशन)

कार्य: रोबोट को एक जटिल आकार की तस्वीर दिखाएं और पूछें, "इस आकार का नाम क्या है?" (जैसे, "क्या यह जॉनसन सॉलिड है या कैटलन सॉलिड?")।
परिणाम: भ्रमित और मतिभ्रम (Hallucinating)।

  • उपमा: कल्पना करें कि एक रोबोट को एक जटिल तारे के आकार का खिलौना दिखाया जाता है और उससे पूछा जाता है, "यह क्या है?" रोबोट कह सकता है, "यह एक तारा है!" लेकिन फिर वह विवरणों के बारे में झूठ बोल सकता है।
    • वह एक कॉन्केव (अवतल - अंदर की ओर धंसा हुआ) आकार को कॉन्वेक्स (उत्तल - बाहर की ओर निकला हुआ) आकार के साथ भ्रमित कर सकता है।
    • वह दो अलग-अलग जुड़ी हुई आकृतियों (कंपाउंड) को एक एकल जटिल आकार (स्टिलेशन) के साथ मिला सकता है।
    • यहाँ तक कि सबसे स्मार्ट AI सहायक (जैसे जो ChatGPT या Gemini को संचालित करते हैं) भी जटिल आकृतियों को 20% से भी कम सही पहचान पाए। उन्होंने अक्सर ऐसी विशेषताओं का "मतिभ्रम" (hallucinate) किया जो वहां मौजूद नहीं थीं, जैसे कि एक ऐसी आकृति पर षट्भुज (hexagon) चेहरा बनाना जो केवल त्रिकोणों से बनी थी।

3. मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि जबकि ये AI मॉडल बनावट (जैसे "यह एक बिल्ली जैसा दिखता है") या पैटर्न को पहचानने में अद्भुत हैं, उनमें वास्तविक ज्यामितीय समझ की कमी है।

  • "चीटिंग" बनाम "कौशल": रोबोट ऐसा व्यवहार करते हैं जैसे वे अपने प्रशिक्षण डेटा से चीजों के दिखने के तरीके को याद करके "चीटिंग" कर रहे हों, न कि इस गणित को समझ रहे हों कि आकृतियाँ कैसे बनती हैं।
  • अंतराल: इन मॉडलों के मानक परीक्षणों और वास्तविक ज्यामितीय तर्क के बीच एक बड़ा अंतर है। वे उस छात्र की तरह हैं जिसने गणित के टेस्ट के उत्तर रट लिए हैं लेकिन वास्तव में गणित करना नहीं जानते।

संक्षेप में: यदि आप इन रोबोटों को ब्लूप्रिंट के आधार पर घर बनाने के लिए कहते हैं, तो वे एक डगमगाता हुआ ढेर बना सकते हैं। लेकिन यदि आप उन्हें एक सममित खिड़की की ओर इशारा करने के लिए कहते हैं, तो वे इसे सही कर सकते हैं। शोध पत्र का तर्क है कि जब तक हम इस "ज्यामितीय अंधापन" को ठीक नहीं करते, तब तक ये रोबोट वास्तव में उस जटिल 3D दुनिया को नेविगेट करने या समझने के लिए तैयार नहीं हैं जिसमें हम रहते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →