← नवीनतम पेपर
💻 computer science

CrossTracer: Cross-Embodiment Navigation via VLA Model Reasoning and Trace Residuals Adapting

CrossTracer एक पदानुक्रमित ढांचा (hierarchical framework) है जो एक VLA-आधारित ट्रेस प्रपोजर को ऑटोमेटेड CE-RRT* के माध्यम से प्रशिक्षित एक एम्बॉडमेंट-कंडीशन्ड रेसिडुअल एडैप्टर के साथ जोड़कर क्रॉस-एम्बॉडमेंट रोबोट नेविगेशन को सक्षम बनाता है, जिससे भौतिक रूप से व्यवहार्य, पिक्सेल-स्पेस नेविगेशन प्लान उत्पन्न होते हैं जो अत्याधुनिक बेसलाइनों की तुलना में काफी बेहतर प्रदर्शन करते हैं।

मूल लेखक: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

प्रकाशित 2026-08-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yao Wang, Siyuan Wang, Zhirui Sun, Wenzheng Chi, Liang Lin, Jiankun Wang, Wenjun Xu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक भीड़भाड़ वाले, बिखरे हुए कमरे में चलना सिखा रहे हैं। आप उसे कह सकते हैं, "मेज पर रखे लाल कप को ले आओ।" एक सुपर-स्मार्ट रोबोट दिमाग (जिसे विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) उस वाक्य को पूरी तरह समझ सकता है। वह जानता है कि "लाल कप" क्या है, "मेजें" आमतौर पर कहाँ होती हैं, और "लेने" का क्या मतलब है। लेकिन यहाँ पेचीदा बात यह है कि उस रोबोट के दिमाग को यह नहीं पता कि रोबोट एक डगमगाता हुआ दो पैरों वाला चलने वाला यंत्र है, एक चिकना चार पहियों वाला कार्ट है, या एक उछलने वाला कुत्ते जैसा मशीन है। एक स्मार्ट दिमाग के लिए, फुटपाथ के ऊपर एक छोटा सा कदम चढ़ना एक सरल पथ जैसा दिखता है। लेकिन एक पहिये वाले रोबोट के लिए, वह फुटपाथ एक दीवार है; एक पैरों वाले रोबोट के लिए, वह एक मज़ेदार छलांग है। यदि रोबोट उस पथ का अनुसरण करने की कोशिश करता है जो उसके शरीर के अनुकूल नहीं है, तो वह टकराकर गिर जाएगा। यह शोध पत्र ठीक इसी समस्या पर काम करता है: हम एक स्मार्ट, सामान्य विचार वाले पथ को कैसे बदल सकते हैं ताकि वह वास्तव में उस विशिष्ट रोबोट के लिए काम करे जो उस पर चलने की कोशिश कर रहा है?

इस शोध पत्र के पीछे के शोधकर्ताओं ने महसूस किया कि इसे ठीक करने का सबसे अच्छा तरीका यह नहीं है कि स्मार्ट दिमाग को एक ही बार में हर रोबोट के शरीर को सिखाने के लिए मजबूर किया जाए। इसके बजाय, उन्होंने एक दो-चरणीय टीम बनाई। पहले, एक "विजन-लैंग्वेज ट्रेस प्रोपोज़र" (आइए इसे "ड्रीमर" कहें) कमरे और लक्ष्य को देखता है और कागज पर एक मोटा, आदर्श पथ खींचता है। यह पथ यात्रा के विचार के लिए तो उत्तम है लेकिन इसे इस बात की परवाह नहीं है कि रोबोट के पास पहिये हैं या पैर। फिर, टीम का दूसरा सदस्य, "सीई-एडैप्टर" (द रियलिटी चेकर), उस मोटे रेखाचित्र और विशिष्ट रोबोट के शरीर को देखता है। यह कहता है, "हे, ड्रीमर भूल गया कि पहिये सीढ़ियाँ नहीं चढ़ सकते," और पथ को सीढ़ियों से दूर और समतल फर्श पर धकेलने के लिए छोटे लाल तीर बनाता है। वे इन धक्कों को "ट्रेस रेसिडुअल्स" कहते हैं।

रियलिटी चेकर को यह सिखाने के लिए कि वह इंसानों द्वारा हाथ से हजारों सटीक पथ बनाए बिना यह कैसे करे, टीम ने एक चतुर प्रशिक्षण तकनीक विकसित की जिसे "सीई-आरआरटी*" कहा जाता है। कल्पना कीजिए कि एक आभासी रोबोट है जो तुरंत पूरे कमरे को देख सकता है और ठीक जानता है कि पहियों के लिए कौन सा फर्श सुरक्षित है और पैरों के लिए कौन सा सुरक्षित है। यह आभासी रोबोट एक तेज़, कंप्यूटरीकृत खोज चलाता है ताकि प्रत्येक रोबोट प्रकार के लिए सबसे सुरक्षित पथ पाया जा सके और उन कंप्यूटर-जनित पथों का उपयोग रियलिटी चेकर को सिखाने के लिए "सही उत्तरों" के रूप में करता है। यह एक सुपर-फास्ट सिम्युलेटर की तरह है जो भौतिकी (फिजिक्स) का कठिन काम करता है, ताकि एआई अपनी गलतियों से सीख सके बिना वास्तव में किसी असली रोबोट को टकराए।

जब उन्होंने इस प्रणाली का परीक्षण किया, तो परिणाम काफी प्रभावशाली थे। एक मानक परीक्षण, नेविट्रेस (NaviTrace) बेंचमार्क पर, क्रॉसट्रेसर (CrossTracer) ने 45.68 अंक प्राप्त किए। इसने तुलना किए गए सबसे मजबूत सामान्य-उद्देश्य वाले एआई मॉडल (जेमिनी-2.5-प्रो) को एक बड़े अंतर से मात दी—लगभग 10 अंक, जो कि 28% का सुधार है। शोध पत्र का सुझाव है कि यह बड़ी छलांग ड्रीमर की गलतियों को सुधारने की रियलिटी चेकर की क्षमता के कारण आई है। जब उन्होंने रियलिटी चेकर को हटा दिया और केवल ड्रीमर को पथ बनाने दिया, तो स्कोर नाटकीय रूप रूप से गिरकर 22.56 हो गया, जिससे सिद्ध होता है कि "धकेलने" वाला चरण अनिवार्य है।

उन्होंने केवल कंप्यूटर परीक्षणों तक ही सीमित नहीं रहे; उन्होंने वास्तविक दुनिया में वास्तविक रोबोटों पर भी इसे आजमाया। उन्होंने इस प्रणाली को एक पहिये वाले रोबोट और एक पैरों वाले रोबोट, दोनों पर लगाया। परिणामों ने दिखाया कि क्रॉसट्रेसर ने रोबोटों को अपने लक्ष्यों तक अधिक बार और तेज़ी से पहुँचने में मदद की। पहिये वाले रोबोट के लिए, सफलता दर 40% से बढ़कर 65% हो गई, और पैरों वाले रोबोट के लिए, यह 45% से बढ़कर 70% हो गई। शोध पत्र संकेत देता है कि यह विधि रोबोटों को बहुत अधिक विश्वसनीय बनाती है, जिससे उन्हें टकराने से बचने और अपने विशिष्ट शरीरों के अनुकूल सुचारू मार्ग खोजने में मदद मिलती है। हालाँकि यह प्रणाली अभी भी कंप्यूटर की फर्श को सही ढंग से "देखने" की क्षमता पर निर्भर करती है (यदि कंप्यूटर एक कालीन को दीवार के रूप में गलत पहचान लेता है, तो रोबोट भ्रमित हो सकता है), यह दृष्टिकोण सुझाव देता है कि "क्या करना है" को "कैसे करना है" से अलग करना रोबोटों को अधिक स्मार्ट और सुरक्षित बनाने का एक शक्तिशाली तरीका है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →