← नवीनतम पेपर
💻 computer science

DreamTrajectory: Trajectory-Guided Action Generation with World Model Alignment for Mobile Manipulation

DreamTrajectory एक प्रक्षेपवक्र-निर्देशित (trajectory-guided) ढांचा है जो मोबाइल मैनिपुलेशन के लिए मौजूदा विजन-लैंग्वेज-एक्शन नीतियों में सुधार करता है, जो समन्वित गति को निर्देशित करने के लिए एंड-इफेक्टर प्रक्षेपवक्र और होल-बॉडी क्रियाओं की संयुक्त रूप से भविष्यवाणी करता है, जबकि निष्पादित क्रियाओं को नियोजित प्रक्षेपवक्रों के साथ संरेखित करने के लिए टेस्ट-टाइम रिफाइनमेंट हेतु एक हल्के वर्ल्ड मॉडल का उपयोग करता है, जिससे सिमुलेशन और वास्तविक दुनिया के संपर्क-समृद्ध (contact-rich) कार्यों में सफलता दर में उल्लेखनीय वृद्धि होती है।

मूल लेखक: Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zheng Yang, Wenjie Zhang, Xiangyu Chen, Wenxuan Song, Xianpeng Wang, Yihang Kang, Wen Chen, Lujia Wang, Renjing Xu, Xiaowen Chu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसे रोबोट की कल्पना करें जो केवल एक मेज या फैक्ट्री के फर्श तक सीमित नहीं है, बल्कि आपके लिविंग रूम में घूम सकता है, कॉफी का मग उठा सकता है और उसे आपको थमा सकता है। यह मोबाइल मैनिपुलेशन (mobile manipulation) का सपना है। यह रोबics का एक कठिन कोना है क्योंकि रोबोट को एक साथ दो काम करने होते हैं: सही जगह पहुँचने के लिए अपने पहियों को चलाना और वस्तु को पकड़ने के लिए अपने हाथ को हिलाना, और यह सब करते समय उसके सिर पर लगी कैमरा दुनिया को घूमते और बदलते हुए देखती है। इसे एक यूनिसाइकिल (एक पहिये वाली साइकिल) चलाते समय करतब दिखाने जैसा समझें; यदि आप केवल करतबों पर ध्यान केंद्रित करते हैं, तो आप साइकिल से गिर सकते हैं, लेकिन यदि आप केवल साइकिल पर ध्यान केंद्रित करते हैं, तो आप गेंदें गिरा देंगे।

लंबे समय तक, रोबोटों ने यह करना सीखा कि वे एक तस्वीर देखते हैं और "संतरा उठाओ" जैसा कमांड पाते हैं और तुरंत हर पहिये और जोड़ के लिए मोटर निर्देशों की एक सूची निकाल देते हैं। लेकिन यह बिना किसी प्लॉट आउटलाइन के, एक ही बार में हर अक्षर का अनुमान लगाकर उपन्यास लिखने की कोशिश करने जैसा है। रोबलेट अक्सर विकल्पों की विशाल संख्या में खो जाता है, जिससे उसकी हरकतें अनाड़ी हो जाती हैं या वह टकरा जाता है। इसके अलावा, एक बार जब रोबोट तय कर लेता है कि उसे क्या करना है, तो वह बस अंधे होकर उसे करता है, इस उम्मीद में कि सब ठीक होगा। यदि फर्श फिसलन भरा है या वस्तु उम्मीद से भारी है, तो रोबोट को तब तक पता नहीं चलता कि उसकी योजना विफल हो गई है जब तक कि वह मग गिरा न दे। वैज्ञानिक इस समस्या को हल करने के लिए रोबोट को बेहतर योजना बनाने का तरीका और काम करने से पहले अपने काम की दोबारा जांच करने का तरीका देने की कोशिश कर रहे हैं।

यहाँ DreamTrajectory आता है, जो एक नया दृष्टिकोण है जो एक रोबोट के प्रदर्शन के लिए एक स्मार्ट निर्देशक की तरह काम करता है। केवल अंतिम मोटर कमांड का अनुमान लगाने के बजाय, यह सिस्टम पहले रोबोट के हाथ (एंड-इफेक्टर) के लिए एक "सपनों वाला" (dream) पथ रेखांकित करता है। यह एक कोरियोग्राफर द्वारा नर्तकों के हिलने से पहले व्हाइटबोर्ड पर नृत्य की दिनचर्या खींचने जैसा है। फिर रोबोट उस रेखाचित्र का अनुसरण करने के लिए आवश्यक विशिष्ट पहिया और हाथ की गतिविधियों को उत्पन्न करता है। लेकिन असली चतुराई यहाँ है: वास्तव में हिलने से पहले, यह एक त्वरित मानसिक सिमुलेशन (mental simulation) चलाता है। यह पूछता है, "यदि मैं इस विशिष्ट गति को आज़माता हूँ, तो क्या मेरा हाथ वास्तव में वहीं पहुँचेगा जहाँ मैंने योजना बनाई थी?" यह गति के कुछ अलग संस्करणों का परीक्षण करता है, उस संस्करण को चुनता है जो "सपनों वाले" पथ से सबसे अच्छी तरह मेल खाता है, और उसके बाद ही उसे निष्पादित करता है।

शोधकर्ताओं ने इस विचार का दो तरीकों से परीक्षण किया। पहले, उन्होंने इसे MS-HAB नामक एक कंप्यूटर सिमुलेशन में चलाया, जहाँ रोबट वर्चुअल मेजों और फ्रिज पर अभ्यास करते हैं। उन्होंने पाया कि इस अतिरिक्त योजना और जाँच के बिना, रोबोट केवल 32.3% बार सफल होते थे। "सपनों वाला" पथ जोड़ने पर, सफलता बढ़कर 47.5% हो गई। जब उन्होंने गतिविधियों को दोबारा जांचने के लिए मानसिक सिमुलेशन चरण जोड़ा, तो सफलता दर और भी बढ़ गई और 54.8% हो गई। यह सुधार विशेष रूप से संपर्क वाले कठिन कार्यों के लिए बहुत बड़ा था, जैसे फ्रिज का दरवाजा खोलना या काउंटर बंद करना, जहाँ रोबोट को अपनी गति के माध्यम से रास्ता बनाना पड़ता है।

वे कंप्यूटर स्क्रीन तक ही सीमित नहीं रहे। उन्होंने वास्तविक दुनिया में एक वास्तविक भौतिक रोबोट, ARX LIFT पर भी इसे आज़माया। इसके परिणाम और भी प्रभावशाली थे। फल उठाने और दराज खोलने जैसे कार्यों पर, रोबोट सफलता दर 63.3% से बढ़कर पथ योजना के साथ 81.7% हो गई, और अंततः मानसिक दोबारा जांच जोड़ने पर 90.0% तक पहुँच गई। यह सिस्टम एक हल्के वजन वाले "वर्ल्ड मॉडल" (world model) का उपयोग करके काम करता है—एक छोटा, तेज़ दिमाग जो यह भविष्यवाणी करता है कि आगे क्या होगा—ताकि विभिन्न क्रिया विकल्पों को स्कोर किया जा सके। इसे हर बार फिर से प्रशिक्षित करने की आवश्यकता नहीं है; यह बस मुख्य रोबोट को मौके पर बेहतर निर्णय लेने में मदद करने के लिए जुड़ जाता है।

यह शोध पत्र सुझाव देता है कि यह तरीका दो बड़ी समस्याओं को हल करता: यह रोबोट को संभावित गतिविधियों के विशाल स्थान में अंधे होकर अनुमान लगाने से रोकता है, और यह योजना के विरुद्ध जांच करके बुरे विचारों को निष्पादित करने से रोकता है। लेखक नोट करते हैं कि यह प्रणाली बहुत कुशल है, जो इन बड़ी बढ़त पाने के लिए बहुत कम अतिरिक्त कंप्यूटिंग पावर (प्रति चरण लगभग 11.75 मिलीसेकंड का विलंब) जोड़ती है। हालाँकि परिणाम उत्साहजनक हैं, लेकिन वे विशिष्ट सिमुलेशन और वास्तविक दुनिया के कार्यों के एक सीमित सेट पर आधारित हैं, जो यह संकेत देते हैं कि हालांकि यह दृष्टिकोण प्रभावी है, यह इस प्रकार के मोबाइल रोबोट के लिए एक विशिष्ट उपकरण है, न कि अस्तित्व में मौजूद हर रोबोटिक समस्या के लिए एक जादुई समाधान।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →