← नवीनतम पेपर
💻 computer science

TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces

TraceFlow एक टेस्ट-टाइम गाइडेंस विधि पेश करता है जो TraceBank में संग्रहीत सफल और असफल रोलआउट ट्रेसेस से प्राप्त प्रोग्रेस-अलाइन्ड करेक्शन फील्ड का लाभ उठाकर फ्रोजन फ्लो-मैचिंग रोबोट पॉलिसियों को उन्नत करता है, जिससे बिना किसी मॉडल वेट अपडेट के वास्तविक दुनिया के पैकिंग और विशिष्ट सिमुलेशन बेंचमार्क पर कार्य सफलता दरों में महत्वपूर्ण सुधार होता है।

मूल लेखक: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

प्रकाशित 2026-09-18
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट जो देख सकते हैं, भाषा समझ सकते हैं और जटिल कार्यों को पूरा करने के लिए अपने हाथों को हिला सकते हैं, वे अब विज्ञान कथा (साइंस फिक्शन) नहीं रहे; वे एक वास्तविकता हैं जिन्हें आज प्रयोगशालाओं में बनाया जा रहा है। ये मशीनें एक प्रकार के सॉफ्टवेयर पर निर्भर करती हैं जिसे विजन-लैंग्वेज-एक्शन पॉलिसी (vision-language-action policy) कहा जाता है। इस पॉलिसी को एक ऐसे मस्तिष्क के रूप में सोचें जो कैमरा फीड देखता है, मानव निर्देश पढ़ता है, और फिर यह निर्णय लेता है कि अगला शारीरिक मूवमेंट क्या करना है। सुरक्षित और विश्वसनीय होने के लिए, इंजीनियर अक्सर इन 'मस्तिष्कों' को प्रशिक्षित करने के बाद "फ्रीज" (freeze) कर देते हैं, जिसका अर्थ है कि आंतरिक सेटिंग्स को एक जगह लॉक कर दिया जाता है ताकि रोबोट काम करते समय अनजाने में वह सब कुछ न भूल जाए जो वह जानता है। हालांकि, एक फ्रीज किए गए मस्तिष्क की एक कमी होती है: यदि रोबोट किसी कार्य के दौरान गलती करता है, तो वह अपने अगले कदम को बदलने के लिए उस विफलता का उपयोग नहीं कर सकता, क्योंकि उसके निर्देश निश्चित होते हैं। यह एक ऐसे ड्राइवर की तरह है जिसने मार्ग को पूरी तरह से याद कर लिया है लेकिन अचानक गड्ढा दिखने पर वह अपने स्टीयरिंग को समायोजित नहीं कर सकता, क्योंकि उसके हाथ एक पूर्व-लिखित स्क्रिप्ट से बंधे हुए हैं। शोधकर्ता जिस प्रश्न का सामना कर रहे हैं, वह यह है कि रोबोट को अपने पूरे मस्तिष्क को पुन: प्रशिक्षित किए बिना या जटिल नए सेंसर जोड़े बिना, वास्तविक समय में अपनी गलतियों से कैसे सीखने दिया जाए।

हांगकांग विश्वविद्यालय और सदर्न यूनिवर्सिटी ऑफ साइंस एंड टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने इस समस्या को हल करने के लिए 'ट्रेसफ्लो' (TraceFlow) नामक एक विधि विकसित की है। रोबोट के फ्रीज किए गए मस्तिष्क को पुन: प्रशिक्षित करने के बजाय, उन्होंने एक ऐसा सिस्टम बनाया है जो एक अस्थायी मार्गदर्शक के रूप में कार्य करता है, जो रोबोट के पिछले प्रयासों के एक सरल रिकॉर्ड का उपयोग करके उसके वर्तमान कार्यों को निर्देशित करता है। यह प्रणाली रोबोट द्वारा प्रत्येक प्रयास को दर्ज करके, यह नोट करके कि वह सफल रहा या विफल, और उस दौरान किए गए आंदोलनों का एक विस्तृत लॉग रखकर काम करती है। जब रोबोट एक नया प्रयास शुरू करता है, तो ट्रेसफ्लो उसकी वर्तमान स्थिति को देखता है और तेजी से इस लॉग में अतीत के समान क्षणों की खोज करता है। यदि इसे अतीत का कोई सफल प्रयास मिलता है, तो यह रोबोट के वर्तमान मूवमेंट प्लान को उस दिशा में खींचता है जो पहले सफल रहा था। यदि इसे कोई असफल प्रयास मिलता है, तो यह रोबोट के प्लान को उस विशिष्ट गलती से दूर धकेलता है। महत्वपूर्ण बात यह है कि यह मार्गदर्शन "बाउंडेड" (bounded) है, जिसका अर्थ है कि यह इतना मजबूत है कि रास्ता सुधार सके, लेकिन इतना कमजोर है कि कभी भी रोबोट के मूल प्रशिक्षण को ओवरराइड न करे, जिससे यह सुनिश्चित होता है कि मशीन सुरक्षित और स्थिर बनी रहे।

शोधकर्ताओं ने एक अव्यवस्थित कमरे में एक वास्तविक रोबोटिक आर्म पर इस दृष्टिकोण का परीक्षण किया, और उसे विशिष्ट कार्यों का एक क्रम करने के लिए कहा, जैसे कि टेप का एक टुकड़ा हिलाना और फिर कैबिनेट पर हथौड़ा रखना। बिना मार्गदर्शन प्रणाली के, रोबोट 50 प्रयासों में से केवल 21 बार ही पूरा क्रम सफलतापूर्वक पूरा कर पाया, और अक्सर चरणों का क्रम गलत कर देता था। ट्रेसफ्लो सक्रिय होने के साथ, रोबोट 50 में से 39 बार सफल हुआ। सुधार और भी नाटकीय था जब शोधकर्ताओं ने रोबोट को कार्यों का एक और दौर चलाने दिया, और उसके अपने नए सफलताओं और विफलताओं को सिस्टम में वापस डाला। दूसरे दौर में, रोबोट ने 50 में से 47 बार अनुक्रम को सही ढंग से पूरा किया, और उसने चरणों के क्रम में शून्य त्रुटियां कीं। इस प्रणाली ने केवल प्रत्येक पिछले प्रयास के लिए एक सरल "हाँ" या "नहीं" लेबल का उपयोग करके यह हासिल किया, जो सफलता या विफलता को दर्शाता है, जिसके लिए यह विश्लेषण करने की आवश्यकता नहीं थी कि रोबोट वास्तव में कहाँ गलत हुआ।

कंप्यूटर सिमुलेशन में, परिणाम अधिक चयनात्मक थे, जो दिखाते हैं कि यह विधि उन कार्यों के लिए सबसे अच्छी है जिनमें चरणों के सही क्रम को याद रखने या किसी नए ऑब्जेक्ट पर कौशल को स्थानांतरित करने की आवश्यकता होती है। उदाहरण के लिए, ब्लॉक स्टैकिंग (ब्लॉक को एक के ऊपर एक रखने) के एक सिमुलेशन में, सफलता दर लगभग 54% से बढ़कर 62% हो गई जब सिस्टम को अपनी विफलताओं से सीखने की अनुमति दी गई। हालांकि, शोधकर्ताओं ने पाया कि यह मार्गदर्शन हर प्रकार के कार्य में मदद नहीं करता है। जब रोबोट को वस्तुओं को गिनने या दूसरों के पीछे छिपी वस्तुओं को खोजने की आवश्यकता होती है, तो सिस्टम ने प्रदर्शन में सुधार नहीं किया और कभी-कभी इसे थोड़ा खराब भी कर दिया। यह सुझाव देता है कि यह विधि विशेष रूप से कार्यों के क्रम में त्रुटियों को ठीक करने के लिए अच्छी है, लेकिन यह उन समस्याओं को ठीक नहीं कर सकती जहाँ रोबोट के पास दृश्य को देखने या समझने के लिए आवश्यक जानकारी की कमी होती है।

इस अध्ययन ने यह भी पता लगाया कि रोबोट अपने इतिहास से कितनी देर तक सीख सकता है। शोधकर्ताओं ने दस दौर के कार्य चलाए, प्रत्येक दौर के बाद सिस्टम में नए अनुभव जोड़े। उन्होंने पाया कि रोबм का प्रदर्शन शुरू में तेजी से सुधरा लेकिन फिर स्थिर हो गया, जो कार्य के आधार पर दूसरे या सातवें दौर के आसपास चरम पर पहुँचा। यह इंगित करता कि अपने मूल मस्तिष्क को बदले बिना एक रोबोट अपने हालिया इतिहास से कितना लाभ उठा सकता है, इसकी एक सीमा है। इसके अलावा, टीम ने पाया कि सफल और विफल पिछले प्रयासों का अनुपात यह भविष्यवाणी नहीं करता था कि सिस्टम कितनी अच्छी तरह काम करेगा; रोबोट अपनी मेमोरी में सफलताओं की तुलना में बहुत अधिक विफलताएं होने के बावजूद भी सुधार कर सकता था। यह खोज इस विचार को चुनौती देती है कि एक रोबोट को अपने अतीत से सीखने के लिए एक आदर्श ट्रैक रिकॉर्ड की आवश्यकता होती है।

अंततः, ट्रेसफ्लो फ्रीज की गई रोबोटिक पॉलिसियों को अधिक अनुकूल बनाने का एक व्यावहारिक तरीका प्रदान करता है। जीत और हार के इतिहास के आधार पर एक सरल, बाउंडेड सुधार का उपयोग करके, रोबोट अधिक विश्वसनीयता के साथ जटिल, क्रमिक कार्यों को नेविगेट कर सकता है, बिना शून्य से पुन: प्रशिक्षित हुए। शोधकर्ताओं ने दिखाया कि यह दृष्टिकोण वास्तविक हार्डवेयर पर प्रभावी ढंग से काम करता है, एक ऐसे रोबोट को जो चरणों के क्रम में संघर्ष कर रहा था, उसे एक ऐसे रोबोट में बदल देता है जो क्रियाओं के अनुक्रम कोreliably (विश्वसनीयता से) पूरा कर सकता है। हालांकि यह हर रोबोटिक चुनौती के लिए जादुई समाधान नहीं है, विशेष रूप से उन कार्यों के लिए जिनमें गिनती या छिपी हुई वस्तुओं का मामला हो, लेकिन यह रोबोट को वास्तविक समय में अपनी गलतियों से सीखने देकर वास्तविक दुनिया में उन्हें अधिक मजबूत बनाने का एक स्पष्ट मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →