← नवीनतम पेपर
💻 computer science

PointAction: 3D Points as Universal Action Representations for Robot Control

पॉइंटएक्शन (PointAction) एक ऐसा फ्रेमवर्क है जो वीडियो प्रेडिक्शन और रोबोट कंट्रोल के बीच एक सेतु का कार्य करता है, जो एक फाउंडेशन वीडियो मॉडल को टेम्पोरल रूप से सुसंगत 3D पॉइंट डायनेमिक्स उत्पन्न करने के लिए फाइन-ट्यून करता है, जो एक डिफ्यूजन-आधारित डिकोडर के लिए एक एम्बॉडिमेंट-अग्नोस्टिक इंटरफेस के रूप में कार्य करता है ताकि निष्पादन योग्य क्रियाएं (executable actions) उत्पन्न की जा सकें, जिससे RGB-ओनली दृष्टिकोणों की तुलना में बेहतर सामान्यीकरण और कम अस्पष्टता प्राप्त होती है।

मूल लेखक: Mutian Tong, Han Jiang, Qiao Feng, Lingjie Liu, Jiatao Gu

प्रकाशित 2026-06-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mutian Tong, Han Jiang, Qiao Feng, Lingjie Liu, Jiatao Gu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक बर्तन से मक्का उठाना। आप रोबोट को एक इंसान द्वारा यह काम करने का वीडियो दिखाते हैं।

सिर्फ वीडियो देखने के साथ समस्या
वर्तमान रोबोट "शिक्षक" (जिन्हें वीडियो-एक्शन मॉडल कहा जाता है) वीडियो देखने और अगले फ्रेम का अनुमान लगाने में माहिर होते हैं। वे भविष्यवाणी कर सकते हैं, "ठीक है, हाथ मक्के की ओर बढ़ रहा है।" लेकिन यहाँ एक पेंच है: एक वीडियो केवल एक सपाट, 2D तस्वीर है। यह एक सेब की ओर बढ़ते हाथ की पेंटिंग देखने जैसा है। पेंटिंग आपको यह तो बताती है कि हाथ कैसा दिखता है, लेकिन यह रोबोट को यह नहीं बताती कि उसे बिल्कुल कितनी दूर जाना है, कितनी ताकत से पकड़ना है, या 3D स्पेस में सेब कहाँ है।

चूंकि वीडियो सपाट है, इसलिए रोबोट को तस्वीर के पीछे के 3D गणित का अनुमान लगाना पड़ता है। यह एक कार चलाने जैसा है जहाँ आप केवल एक सपाट मानचित्र देख रहे हैं, बिना यह जाने कि अगली मोड़ तक की गति या सटीक दूरी क्या है। रोबोट भ्रमित हो जाता है, और यदि आप रोबोट के शरीर को बदलते हैं (जैसे मानव हाथ की जगह एक अलग रोबोटिक हाथ लगा देते हैं), तो रोबोट अक्सर विफल हो जाता है क्योंकि उसने तस्वीर की नकल करना सीखा था, न कि भौतिकी (physics) को।

समाधान: पॉइंट-एक्शन (PointAction)
शोधकर्ताओं ने पॉइंट-एक्शन नामक एक नया सिस्टम बनाया है। केवल अगली सपाट तस्वीर की भविष्यवाणी करने के बजाय, उन्होंने AI को अगली तस्वीर और बिंदुओं (points) का एक 3D "कंकाल" (skeleton) प्रेडिक्ट करने के लिए प्रशिक्षित किया है जो वस्तुओं के साथ चलते हैं।

इसे इस तरह सोचें:

  • पुराना तरीका: AI एक मूवी के अगले फ्रेम की भविष्यवाणी करता है।
  • पॉइंट-एक्शन: AI मूवी के अगले फ्रेम की भविष्यवाणी करता है और बिंदुओं का एक तैरता हुआ 3D क्लाउड भी दिखाता है जो ठीक से दर्शाता है कि अंतरिक्ष में रोबोट और वस्तुओं का हर हिस्सा कहाँ है।

यह कैसे काम करता है (दो-चरणीय नृत्य)
यह सिस्टम दो भागों में विभाजित है, जैसे एक निर्देशक और एक अभिनेता:

  1. निर्देशक (यूनिवर्सल वीडियो मॉडल): इस भाग को कई अलग-अलग रोबोटों और कार्यों के हजारों घंटों के वीडियो पर प्रशिक्षित किया गया है। यह एक सामान्य नियम सीखता है: "जब आप किसी चीज़ को उठाना चाहते हैं, तो हाथ का प्रतिनिधित्व करने वाले 3D डॉट्स को एक विशिष्ट चाप (arc) में चलना चाहिए।" इसे इस बात से फर्क नहीं पड़ता कि कौन सा रोबोट यह कर रहा है; यह केवल क्रिया की 3D ज्यामिति (geometry) को समझता है। यह चलते हुए 3D डॉट्स का एक "स्क्रिप्ट" आउटपुट करता है।
  2. अभिनेता (रोबोट-विशिष्ट डिकोडर): यह एक छोटा, विशिष्ट भाग है जो उस रोबोट के शरीर को जानता है जिसे वह नियंत्रित कर रहा है। यह निर्देशक के "स्क्रिप्ट" (चलते हुए 3D डॉट्स) को लेता है और इसे उन विशिष्ट मांसपेशियों की गतिविधियों (मोटर कमांड) में अनुवादित करता है जिनकी आवश्यकता इस रोबोट को उन डॉट्स से मेल खाने के लिए होती है।

यह एक बड़ी बात क्यों है

  • यह "बॉडी-अग्नोस्टिक" (शरीर-निरपेक्ष) है: क्योंकि निर्देशक केवल 3D डॉट्स की परवाह करता है, आप इसे एक फ्रैंका (Franka) रोबोट आर्म पर प्रशिक्षित कर सकते हैं, और फिर आसानी से एक पूरी तरह से अलग रोबोट, जैसे कि विडोएक्स (WidowX) आर्म को वही कार्य सिखा सकते हैं। आपको बस नए रोबोट को वही "डॉट स्क्रिप्ट" देनी होगी, और उसका विशिष्ट "अभिनेता" यह समझ जाएगा कि उन डॉट्स से मेल खाने के लिए अपने शरीर को कैसे चलाना है।
  • यह अनुमान को हटा देता है: रोबोट को सटीक 3D निर्देशांक (X, Y, Z) देकर, बजाय केवल रंगों और आकृतियों के, रोबोट को यह अनुमान नहीं लगाना पड़ता कि वस्तु कितनी गहरी है या कितनी दूर तक पहुँचना है।
  • यह वास्तविक दुनिया में काम करता है: पेपर में उन्होंने इसे दो वास्तविक रोबोटों पर टेस्ट किया जिन्हें प्रशिक्षण के दौरान कभी नहीं देखा गया था। सिस्टम ने उन्हें वस्तुएं उठाने और कपों को स्टैक करने में सफलतापूर्वक सिखाया, जो अन्य शीर्ष-स्तरीय रोबोट AI सिस्टम से बेहतर प्रदर्शन करता है जो केवल 2D वीडियो पर निर्भर करते हैं।

निष्कर्ष
पॉइंट-एक्शन "वीडियो देखने" और "क्रिया करने" के बीच के अंतर को 3D परत जोड़कर पाटता है। यह एक सपाट फिल्म को 3D ब्लूप्रिंट में बदल देता है, जिससे रोबोट के लिए नए कार्य सीखना और नए शरीरों के अनुकूल होना बहुत आसान हो जाता है।

उल्लिखित सीमाएँ
लेखकों ने उल्लेख किया है कि 3D वीडियो की भविष्यवाणी करने में समय लगता है, इसलिए वर्तमान में यह सिस्टम थोड़ा धीमा है। यह "ओपन-लूप" तरीके से काम करता है, जिसका अर्थ है कि यह पूरी क्रिया की योजना एक साथ बनाता है, बिना लगातार यह जांचे कि चीजें वास्तविक समय में गलत हो रही हैं या नहीं (जैसे एक ड्राइवर जो सड़क को हर सेकंड देखने के बजाय, यात्रा शुरू करने से पहले ही पूरी यात्रा की योजना बना लेता है)। वे सुझाव देते हैं कि भविष्य के कार्य इसे तेज़ और अधिक प्रतिक्रियाशील बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →