← नवीनतम पेपर
💻 computer science

SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL

यह शोध पत्र SpaceTools को प्रस्तुत करता है, जो एक ऐसा फ्रेमवर्क है जो विजन लैंग्वेज मॉडल्स (Vision Language Models) को कई स्थानिक तर्क उपकरणों (spatial reasoning tools) को स्वायत्त रूप से समन्वित करने में सक्षम बनाने के लिए डबल इंटरएक्टिव रीइन्फोर्समेंट लर्निंग (Double Interactive Reinforcement Learning - DIRL) का उपयोग करता है, जिससे स्थानिक बेंचमार्क पर अत्याधुनिक प्रदर्शन और वास्तविक दुनिया के रोबोटिक हेरफेर (robotic manipulation) में विश्वसनीयता प्राप्त होती है।

मूल लेखक: Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, Jonathan Tremblay

प्रकाशित 2026-06-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyi Chen, Mikaela Angelina Uy, Chan Hee Song, Faisal Ladhak, Adithyavairavan Murali, Qing Qu, Stan Birchfield, Valts Blukis, Jonathan Tremblay

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट असिस्टेंट है जो चित्रों को देख सकता है और सवालों के जवाब दे सकता है। यह असिस्टेंट बातचीत करने और वस्तुओं को पहचानने (जैसे "वह एक बिल्ली है!") में बहुत माहिर है, लेकिन यह स्थान (space) को समझने में बहुत बुरा है। इसे नहीं पता कि एक डिब्बा कप के पीछे है, या कोई दीवार कितनी दूर है, या हैंडल को ठीक कहाँ से पकड़ना है। यह बिल्कुल वैसा ही है जैसे आपका कोई ऐसा दोस्त हो जिसे टूलबॉक्स के सभी औजारों के नाम तो पता हैं, लेकिन उसने कभी उनमें से किसी को हाथ में लिया नहीं है या उन्हें एक साथ उपयोग करना नहीं सीखा है।

"SpaceTools" नामक शोध पत्र (paper) एक नया तरीका पेश करता है जिससे आप इस रोबोट असिस्टेंट को स्थानिक विशेषज्ञ (spatial genius) बनाने के लिए सिखा सकते हैं। उन्होंने इसे कैसे किया, इसका सरल विवरण यहाँ दिया गया है:

समस्या: "टूलबॉक्स" बहुत बड़ा है

शोधकर्ता चाहते थे कि रोबोट विशेष कंप्यूटर प्रोग्रामों (टूल्स/औजारों) का उपयोग करने के लिए विशेष प्रोग्रामों का उपयोग करे। उदाहरण के लिए:

  • एक डेप्थ टूल (Depth Tool) यह मापने के लिए कि चीजें कितनी दूर हैं।
  • एक सेगमेंटेशन टूल (Segmentation Tool) किसी अव्यवस्थित बैकग्राउंड से विशिष्ट वस्तुओं को अलग करने के लिए।
  • एक 3D बॉक्स टूल (3D Box Tool) किसी वस्तु के सटीक आकार और माप को समझने के लिए।

समस्या यह है कि यदि आप बस रोबोट को कह दें, "इस समस्या को हल करने के लिए ये 10 टूल्स इस्तेमाल करो," तो वह घबरा जाता है। यह एक बच्चे को एक विशाल टूलबॉक्स देने जैसा है जिसमें 50 अलग-अलग रिंच, हथौड़े और आरी हैं और फिर कहने जैसा है, "इस कुर्सी को ठीक करो!" बच्चा नहीं जानता कि पहले कौन सा टूल चुनना है, या उनका सही क्रम क्या होना चाहिए। वह बस भ्रमित हो जाता है और असफल हो जाता है।

समाधान: "डबल इंटरएक्टिव रीइन्फोर्समेंट लर्निंग" (DIRL)

लेखकों ने एक दो-चरणीय प्रशिक्षण पद्धति बनाई जिसे DIRL कहा जाता है। इसे एक बहुत ही स्मार्ट प्रशिक्षु कार्यक्रम (apprenticeship program) के रूप में समझें।

चरण 1: "शिक्षण" चरण (प्रशिक्षु बुनियादी बातें सीखता है)

रोबोट को सीधे कठिन काम में झोंकने के बजाय, वे एक "शिक्षक" के साथ शुरुआत करते हैं।

  1. विशेषज्ञ शिक्षक (Specialist Teacher): सबसे पहले, वे रोबोट के एक सरल संस्करण को केवल एक टूल (जैसे चीजों की ओर इशारा करना) में महारत हासिल करने के लिए प्रशिक्षित करते हैं। एक बार जब वह इसमें बहुत अच्छा हो जाता है, तो वह एक "शिक्षक" बन जाता है।
  2. मास्टर शिक्षक (Master Teacher): वे एक अत्यंत बुद्धिमान, पहले से मौजूद AI (जैसे एक शीर्ष-स्तरीय व्यावसायिक मॉडल) का भी उपयोग करते हैं जो एक साथ सभी टूल्स का उपयोग करना जानता है।
  3. पाठ: वे विशेषज्ञ शिक्षक और मास्टर शिक्षक के पाठों को मिलाते हैं। वे रोबोट को चरण-दर-चरण समस्याओं को हल करने के उदाहरण दिखाते हैं। "पहले डेप्थ देखो। फिर वस्तु की ओर इशारा करो। फिर उसका आकार मापें।"

यह रोबोट को एक ठोस आधार देता है। यह टूल्स की शब्दावली और उन्हें उपयोग करने के बुनियादी व्याकरण को सीख जाता है।

चरण 2: "एक्सप्लोरेशन" चरण (रोबोट खुद अभ्यास करता है)

अब जब रोबोट बुनियादी बातें जान गया है, तो वे उसे अपने आप अभ्यास करने के लिए स्वतंत्र छोड़ देते हैं। यह "इंटरएक्टिव" हिस्सा है।

  • रोबोट एक समस्या को हल करने की कोशिश करता है।
  • वह एक टूल को कॉल करता है (जैसे, "गहराई मापें")।
  • टूल एक उत्तर देता है।
  • रोबोट उस उत्तर का उपयोग यह तय करने के लिए करता है कि आगे क्या करना है।
  • रिवॉर्ड सिस्टम (पुरस्कार प्रणाली): यदि रोबट पहेली को सही ढंग से हल करता है, तो उसे एक "गोल्ड स्टार" (पुरस्कार) मिलता है। यदि वह गलती करता है, तो उसे कोई स्टार नहीं मिलता।
  • जादू: क्योंकि रोबोट टूल्स का उपयोग करते हुए अभ्यास कर रहा है, इसलिए वह अपनी गलतियों को सुधारना सीख जाता है। यदि कोई टूल अजीब उत्तर देता है, तो रोबोट यह कहना सीख जाता है, "हम्म, यह सही नहीं लग रहा है, मुझे एक अलग टूल आज़माना चाहिए," बजाय इसके कि वह केवल एक स्क्रिप्ट का आँख मूंदकर पालन करे।

द "टूल्सहेड" (द गैरेज)

इसे काम करने योग्य बनाने के लिए, शोधकर्ताओं ने Toolshed नामक एक विशेष प्रणाली बनाई।
कल्पना कीजिए कि रोबोट एक गैरेज में है। आमतौर पर, यदि रोबोट को हथौड़े की आवश्यकता होती है, तो उसे किसी के द्वारा उसे लाने का इंतजार करना पड़ता है। Toolshed एक जादुई गैरेज की तरह है जहाँ हर टूल (डेप्थ कैमरा, सेगमेंटेशन सॉफ्टवेयर, रोबोटिक आर्म) तुरंत एक कन्वेयर बेल्ट पर उपलब्ध होता है। रोबोट मिलीसेकंड में एक टूल उठा सकता है, उसका उपयोग कर सकता है, और उसे वापस रख सकता है बिना किसी प्रतीक्षा के। यह रोबोट को दिन में हजारों बार अभ्यास करने की अनुमति देता है, जिससे वह टूल्स लोड होने का इंतजार करने की तुलना में बहुत तेजी से सीखता है।

परिणाम: अनाड़ी से मास्टर तक

शोधकर्ताओं ने इस नए रोबोट, जिसका नाम SpaceTools है, का कई चुनौतियों पर परीक्षण किया:

  • सबसे छोटी वस्तु खोजना: यह गिटार पेडल की एक तस्वीर देख सकता है, डेप्थ टूल का उपयोग करके देख सकता है कि कौन सा सबसे करीब है, और आकार मापने वाले टूल का उपयोग करके सबसे छोटा ढूंढ सकता है।
  • रोबोटिक्स: उन्होंने SpaceTools को एक वास्तविक रोबोटिक आर्म से जोड़ा। जब इसे "फ्लैशलाइट उठाओ और उसे बिन में डालो" कहा गया, तो इसने केवल अनुमान नहीं लगाया। इसने:
    1. इमेज को देखा।
    2. फ्लैशलाइट खोजने के लिए एक टूल का उपयोग किया।
    3. गहराई मापने के लिए एक टूल का उपयोग किया।
    4. पकड़ने के लिए एकदम सही कोण की गणना की।
    5. फ्लैशलाइट उठाई और उसे बिन में रख दिया।

मुख्य बात:
SpaceTools ने केवल उत्तर याद नहीं किए। इसने डिजिटल सहायकों की एक टीम का उपयोग करके सोचना सीखा। इसने उन कार्यों पर मौजूदा सबसे महंगे, प्रसिद्ध AI मॉडलों को भी पीछे छोड़ दिया जिनमें 3D स्पेस, गहराई और भौतिक दुनिया के साथ बातचीत करने की समझ की आवश्यकता होती है। यह पेपर सिद्ध करता है कि यदि आप एक AI को इंटरएक्टिव तरीके से टूल्स का उपयोग करना सिखाते हैं (जैसे एक इंसान टूलबॉक्स का उपयोग करना सीखता है), तो यह भौतिक दुनिया को समझने में बहुत बेहतर हो जाता है, बजाय इसके कि आप केवल उस सारी जानकारी को उसके दिमाग में भरने की कोशिश करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →