← नवीनतम पेपर
🤖 machine learning

Geometric Action Model for Robot Policy Learning

यह शोध पत्र ज्योमेट्रिक एक्शन मॉडल (GAM) को प्रस्तुत करता है, जो एक भाषा-सशर्त हेरफेर नीति (language-conditioned manipulation policy) है जो एक पूर्व-प्रशिक्षित ज्योमेट्रिक फाउंडेशन मॉडल को एक कॉज़ल फ्यूचर प्रेडिक्टर (causal future predictor) को एकीकृत करने के लिए विभाजित करके उसे पुन: उपयोग करती है, जिससे समृद्ध ज्योमेट्रिक प्रायर्स (geometric priors) को संरक्षित करते हुए रोबोट नियंत्रण के लिए कुशल, सटीक और सुदृढ़ 3D तर्क को सक्षम बनाया जा सके।

मूल लेखक: Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

प्रकाशित 2026-06-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jisang Han, Seonghu Jeon, Jaewoo Jung, René Zurbrügg, Honggyu An, Tifanny Portela, Marco Hutter, Marc Pollefeys, Seungryong Kim, Sunghwan Hong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे ब्लॉक्स को एक के ऊपर एक रखना या चूल्हे पर बर्तन रखना। एक रोबोट के लिए इसे अच्छी तरह से करने के लिए, उसे एक साथ तीन चीजों को समझना होगा: आपने उसे क्या करने के लिए कहा (भाषा), वह अभी क्या देख रहा है (दृष्टि/विज़न), और जब वह हिलता है तो दुनिया कैसे बदलेगी (भौतिकी/ज्यामिति)।

वर्तमान के अधिकांश रोबोट "दिमाग" उन लोगों की तरह हैं जो केवल सपाट, 2D तस्वीरों को देखते हैं। वे वस्तुओं को पहचानने में माहिर हैं लेकिन गहराई, दूरी, या किसी चीज़ के धक्का दिए जाने पर कैसे गिर सकती है, यह समझने में संघर्ष करते हैं। उन्हें एक सपाट तस्वीर देखकर दुनिया के 3D आकार का अनुमान लगाना पड़ता है, जो बिल्कुल वैसा ही है जैसे किसी पोस्टकार्ड को देखकर पहाड़ के आकार का अंदाजा लगाना।

यह शोध पत्र एक नया रोबोट दिमाग पेश करता है जिसे GAM (जियोमेट्रिक एक्शन मॉडल) कहा जाता है। यह कैसे काम करता है, इसके लिए यहाँ सरल उपमाएँ दी गई हैं:

1. "पूर्व-प्रशिक्षित वास्तुकार" (द फाउंडेशन मॉडल)

शोधकर्ताओं ने शून्य से रोबोट का दिमाग नहीं बनाया। इसके बजाय, उन्होंने एक विशाल, पूर्व-प्रशिक्षित "जियोमेट्रिक फाउंडेशन मॉडल" (GFM) लिया। इस GFM को एक सुपर-आर्किटेक्ट (महा-वास्तुकार) के रूप में सोचें जिसने वर्षों तक ब्लूप्रिंट और 3D संरचनाओं का अध्ययन किया है। यह आर्किटेक्ट पहले से ही जानता है कि सपाट तस्वीरों को विस्तृत 3D मानचित्रों में कैसे बदला जाए। यह गहराई, पैमाने और यह समझता है कि वस्तुएं स्थान को कैसे घेरती हैं।

2. "स्प्लिट एंड इंसर्ट" (विभाजित और सम्मिलित) रणनीति

आमतौर पर, लोग इस सुपर-आर्किटेक्ट का उपयोग केवल कमरे को देखने और उसका वर्णन करने के लिए करते हैं, और फिर वह विवरण एक अलग "करने वाले" रोबोट को सौंप देते हैं। GAM इस खेल को बदल देता है क्योंकि यह आर्किटेक्ट को दो हिस्सों में बांटता है और बीच में एक नया "प्लानर" (योजनाकार) डाल देता है।

  • ऊपरी हिस्सा (आंखें): आर्किटेक्ट का पहला भाग वर्तमान कैमरा फोटो को देखता है और उन्हें एक 3D मानसिक मानचित्र में बदल देता है।
  • मध्य भाग (समय-यात्री): आर्किटेक्ट के ठीक बीच में, शोधकर्ताओं ने एक विशेष "कॉज़ल फ्यूचर प्रेडिक्टर" (कारण-भविष्य भविष्यवक्ता) डाला है। इसे एक समय-यात्रा करने वाला योजनाकार मान लें। यह वर्तमान 3D मानचित्र लेता है, आपके निर्देशों को सुनता है ("कप को यहाँ रखो"), और पूछता है: "यदि मैं अपने हाथ को इस तरह हिलाता हूँ, तो एक सेकंड बाद 3D दुनिया कैसी दिखेगी?"
  • निचला हिस्सा (हाथ): आर्किटेक्ट का दूसरा भाग उस भविष्य के 3D अनुमान को लेता है और यह पता लगाता है कि रोबोट को उस भविष्य को सच करने के लिए अपने हाथ को ठीक से कैसे हिलाना चाहिए।

3. यह एक बड़ी बात क्यों है

अधिकांश अन्य रोबोट मॉडल भविष्य की भविष्यवाणी 2D में (जैसे एक वीडियो गेम में) करने या अंत में 3D आकार का अनुमान लगाने की कोशिश करते हैं। GAM इसे अलग तरह से करता है:

  • यह शुरुआत से ही 3D में सोचता है: क्योंकि यह हर चीज़ के लिए आर्किटेक्ट के 3D ज्ञान का उपयोग करता है, इसलिए रोबोट को यह अनुमान लगाने की ज़रूरत नहीं है कि कोई वस्तु दूर है या पास। वह जानता है।
  • यह एक "वन-पास वंडर" है: अन्य मॉडलों को अक्सर एक एकल चाल को समझने के लिए एक जटिल, धीमी प्रक्रिया (जैसे एक डिफ्यूजन मॉडल) को कई बार चलाना पड़ता है, जो एक चित्रकार द्वारा पूरी कैनवास को बार-बार फिर से पेंट करके अपनी गलती सुधारने के प्रयास जैसा है। GAM एक स्केच आर्टिस्ट (रेखाचित्रकार) की तरह है जो एक ही बार में, एक त्वरित और आत्मविश्वासी स्ट्रोक में पूरी योजना बना लेता है।
  • यह तेज़ और हल्का है: क्योंकि यह इतना कुशल है, यह सबसे बड़े और सबसे धीमे मॉडलों में से कुछ की तुलना में 55 गुना तेज़ चलता है और बहुत कम कंप्यूटर मेमोरी का उपयोग करता है।

4. परिणाम: मजबूती (Robustness)

शोधकर्ताओं ने इस रोबोट का दो तरीकों से परीक्षण किया:

  1. सिमुलेशन: एक कंप्यूटर दुनिया में जहाँ उन्होंने लाइटिंग बदली, कैमरों को हिलाया और बैकग्राउंड को अस्त-व्यस्त कर दिया।
  2. वास्तविक जीवन: एक वास्तविक कमरे में एक वास्तविक रोबोटिक हाथ पर।

"पर्टरबेशन" (अशांति) की उपमा:
कल्पना कीजिए कि आप एक कमरे में चल रहे हैं। यदि लाइट झपकाती है या कोई कुर्सी हटा देता है, तो केवल 2D फोटो देखने वाला रोबोट भ्रमित हो सकता है और सोच सकता है कि कुर्सी गायब हो गई या अपनी जगह बदल ली।

  • पुराने रोबोट: जब कैमरा एंगल थोड़ा सा भी बदलता था, तो उनकी सफलता दर नाटकीय रूप रूप से गिर जाती थी (जैसे एक ड्राइवर जो GPS सिग्नल कमजोर होने पर रास्ता भटक जाता है)।
  • GAM: क्योंकि यह कमरे की वास्तविक 3D ज्यामिति को समझता है, इसे इस बात से फर्क नहीं पड़ता कि कैमरा हिला या रोशनी बदली। इसे पता है कि स्थान में वस्तुएं कहाँ हैं। उन परीक्षणों में जहाँ कैमरे को एक अजीब कोण पर ले जाया गया था, GAM सफल रहा जबकि अन्य विफल हो गए।

सारांश

GAM एक रोबोट पॉलिसी है जो एक "3D विशेषज्ञ" (एक जियोमेट्रिक फाउंडेशन मॉडल) को लेती है, उसे बीच से काटती है, और उसके अंदर एक "फ्यूचर प्लानर" डाल देती है। यह रोबोट को एक ही समय में 3D में देखने, 3D में भविष्य की भविष्यवाणी करने और 3D में कार्य करने में सक्षम बनाता है। परिणाम स्वरूप, यह एक ऐसा रोबोट है जो वर्तमान अत्याधुनिक रोबोटों की तुलना में तेज़, छोटा और वास्तविक दुनिया की अव्यवस्था (जैसे चलते हुए कैमरे या बदलती रोशनी) को संभालने में बहुत बेहतर है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →