← नवीनतम पेपर
🤖 AI

SpatialClaw: Rethinking Action Interface for Agentic Spatial Reasoning

यह शोधपत्र SpatialClaw को प्रस्तुत करता है, जो एक स्टेटफुल कोड निष्पादन इंटरफ़ेस (stateful code execution interface) का उपयोग करके विजन-लैंग्वेज मॉडल्स में ओपन-एंडेड 3D/4D स्थानिक तर्क (spatial reasoning) को बढ़ाता है, जिससे एजेंटों को धारणा संबंधी कार्यों (perception operations) को लचीले ढंग से संयोजित करने और मॉडल-विशिष्ट अनुकूलन के बिना 20 बेंचमार्क में अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम बनाया जाता है।

मूल लेखक: Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seokju Cho, Ryo Hachiuma, Abhishek Badki, Hang Su, Byung-Kwan Lee, Chan Hee Song, Sifei Liu, Subhashree Radhakrishnan, Seungryong Kim, Yu-Chiang Frank Wang, Min-Hung Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि केवल कुछ तस्वीरों या वीडियो को देखकर यह पता लगाना कि एक हीटर दरवाजे से कितनी दूर है।

लंबे समय तक, AI मॉडल (जिन्हें विजन-लैंग्वेज मॉडल्स कहा जाता है) किसी तस्वीर में क्या है यह पहचानने में बहुत अच्छे रहे हैं (जैसे, "वह एक हीटर है"), लेकिन वे इस बात में संघर्ष करते हैं कि चीजें 3D स्पेस में कहाँ हैं और उनके बीच कितनी दूरी है। वे एक ऐसे व्यक्ति की तरह हैं जो कमरे की हर वस्तु का नाम तो बता सकता है लेकिन उसे दूरी और ज्यामिति (geometry) का बिल्कुल भी अंदाजा नहीं है।

इसे ठीक करने के लिए, शोधकर्ताओं ने AI मॉडल्स को "टूल्स" (जैसे कि इंची टेप या 3D स्कैनर) देने की कोशिश की। लेकिन जिस तरह से उन्होंने इन टूल्स का उपयोग किया, वह बहुत ही अव्यवस्थित था। यह पेपर, SpatialClaw, तर्क देता है कि समस्या टूल्स में नहीं थी, बल्कि उस निर्देश पुस्तिका (इंटरफेस) में थी जिसका उपयोग AI मदद मांगने के लिए कर रहा था।

यहाँ तीन तरीकों का विवरण दिया गया है जिनसे AI ने इन पहेलियों को हल करने की कोशिश की है, जिसे एक सरल उपमा (analogy) के माध्यम से समझाया गया है:

1. "वन-शॉट" जुआरी (Single-Pass Code)

कल्पना कीजिए कि आप एक खेल खेल रहे हैं जहाँ आपको एक गणित की समस्या हल करनी है, लेकिन आपको उत्तर देखने से पहले निर्देशों का केवल एक एकल वाक्य लिखने की अनुमति है।

  • यह कैसे काम करता था: AI को दूरी मापने के लिए एक साथ पूरा कंप्यूटर प्रोग्राम लिखना पड़ता था। उसे यह अनुमान लगाना होता था कि उसकी पूरी रणनीति क्या होगी, इससे पहले कि वह देख पाता कि उसका पहला कदम (जैसे हीटर को खोजना) वास्तव में काम कर रहा है या नहीं।
  • समस्या: यदि AI पहले कदम में एक छोटी सी भी गलती करता, तो पूरा प्रोग्राम विफल हो जाता। वह यह नहीं कह सकता था, "रुको, मुझे हीटर मिल गया है, लेकिन मास्क गलत है। मुझे इसे ठीक करने से पहले इसे सुधार लेना चाहिए।" यह अपने पूरे वेतन पर एक ही बार में दांव लगाने जैसा था।

2. "स्ट्रिक्ट मेनू" डाइनर (Structured Tool-Call)

कल्पना कीजिए कि आप एक रेस्टोरेंट में हैं, लेकिन वेटर आपको केवल एक छोटे, पहले से छपे हुए मेनू से ऑर्डर करने की अनुमति देता है। आप कह सकते हैं, "मुझे 'दूरी मापें' वाला टूल चाहिए," और "मुझे 'हीटर खोजें' वाला टूल चाहिए।"

  • यह कैसे काम करता था: AI एक सूची से टूल्स चुन सकता था, लेकिन वह उन्हें रचनात्मक रूप से मिला (mix and match) नहीं सकता था। यदि समस्या के लिए ऐसे अजीब संयोजन की आवश्यकता थी जो मेनू में नहीं था, तो AI फंस जाता। यह एक कस्टम सैंडविच बनाने की कोशिश करने जैसा था जहाँ आपको केवल डिस्प्ले केस से एक पहले से बना हुआ आइटम चुनने की अनुमति दी गई हो।
  • समस्या: वास्तविक दुनिया की स्थानिक (spatial) समस्याएं जटिल होती हैं। कभी-कभी आपको किसी टूल का उपयोग उस तरीके से करने की आवश्यकता होती जिसकी उम्मीद मेनू ने नहीं की थी।

3. "मास्टर शेफ" (SpatialClaw)

अब, कल्पना कीजिए कि आप AI को एक पूरी तरह से सुसज्जित किचन (एक निरंतर चलने वाला पायथन कंप्यूटर प्रोग्राम) देते हैं और उसे कहते हैं: "आप शेफ हैं। आप कोई भी सामग्री उठा सकते हैं, उसे मिला सकते हैं, चख सकते हैं, और यदि स्वाद खराब है, तो उसे फेंक सकते हैं और एक नई रेसिपी आज़मा सकते हैं। आप तब तक स्टेप-बाय-स्टेप खाना बना सकते हैं जब तक कि डिश एकदम सही न हो जाए।"

  • यह कैसे काम करता है:
    • किचन: AI के पास एक "निरंतर किचन" है जहाँ वह अपनी सभी सामग्रियों (इमेज, 3D मैप्स, मास्क) को सुरक्षित रखता है।
    • स्टेप-बाय-स्टेप: वह एक साथ पूरी रेसिपी नहीं लिखता। वह एक छोटा निर्देश लिखता है (जैसे, "हीटर खोजें"), परिणाम देखता है (जैसे, "ओह, मैंने गलत वस्तु ढूंढ ली!"), और फिर सुधार करने के लिए अगला निर्देश लिखता है।
    • चखना: वह अपने काम को देख सकता है (विजुअल फीडबैक) और कह सकता है, "यह माप अजीब लग रहा है, मुझे एक अलग गणितीय ट्रिक आज़मानी चाहिए।"
    • स्वतंत्रता: वह जब चाहे मानक गणितीय टूल्स (जैसे कैलकुलेटर या रूलर) का उपयोग कर सकता है, न कि केवल उन टूल्स का जो एक पूर्व-निर्धारित मेनू में हैं।

परिणाम

शोधकर्ताओं ने 3D दूरी, चलती हुई वस्तुओं और विभिन्न कैमरा एंगल्स से जुड़ी 20 अलग-अलग पहेलियों पर इस "मास्टर शेफ" दृष्टिकोण (SpatialClow) का परीक्षण किया। उन्होंने इसका उपयोग विभिन्न AI "मस्तिष्क" (छोटे से लेकर विशाल मॉडल्स तक) के साथ किया।

  • स्कोर: SpatialClaw का औसत स्कोर 59.9% रहा, जिसने पिछले सर्वश्रेष्ठ "AI शेफ" को एक बड़े अंतर (11.2 अंक) से पीछे छोड़ दिया।
  • रहस्य: सबसे बड़े सुधार सबसे कठिन पहेलियों में हुए—जैसे कि वीडियो में चीजें कैसे चलती हैं या अलग-अलग कोणों से दूरी मापना। ऐसा इसलिए है क्योंकि इन कार्यों के लिए AI को लगातार अपने काम की जांच करने, गलतियों को सुधारने और टूल्स को नए तरीकों से मिलाने की आवश्यकता होती है, जो केवल "मास्टर शेफ" दृष्टिकोण ही संभव बनाता है।

यह क्यों महत्वपूर्ण है (पेपर के अनुसार)

पेपर का दावा है कि सबसे बड़ी सफलता AI को नए टूल्स देने या AI को अधिक स्मार्ट बनाने में नहीं थी। यह केवल इंटरफेस को बदलने में थी ताकि AI एक लूप में सोच सके, कार्य कर सके, जांच सके और खुद को सुधार सके, ठीक वैसे ही जैसे एक इंसान कठिन स्थानिक समस्या को हल करते समय करता है।

यह ऐसा है जैसे यह महसूस करना कि घर बनाने के लिए आपको एक बेहतर हथौड़े की नहीं, बल्कि एक बिल्डर को रुकने, दीवार को देखने, यह महसूस करने की आवश्यकता है कि वह टेढ़ी है, और अगले कदम पर बढ़ने से पहले उसे ठीक करने की अनुमति देने की आवश्यकता है। SpatialClaw AI को यह अनुमति देता है कि वह रुक सके, जांच सके और सुधार सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →