← नवीनतम पेपर
💻 computer science

Improving Robotic Generalist Policies via Flow Reversal Steering

यह शोध पत्र फ्लो रिवर्सल स्टीयरिंग (FRS) प्रस्तुत करता है, जो एक ऐसी विधि है जो उप-इष्टतम (suboptimal) क्रियाओं को उलटकर उन लेटेंट नॉइज़ (latent noises) का अनुमान लगाने के माध्यम से फ्लो मैचिंग-आधारित रोबोटिक जनरलिस्ट पॉलिसियों को बेहतर बनाती है जो उच्च-गुणवत्ता वाले व्यवहारों से मेल खाते हैं, जिससे ज़ीरो-शॉट कंट्रोल में महत्वपूर्ण सुधार होता है, तीव्र व्यवहार क्लोनिंग सक्षम होती है, और जटिल हेरफेर कार्यों के लिए सुदृढीकरण शिक्षण (reinforcement learning) बूटस्ट्रैपिंग की सुविधा मिलती है।

मूल लेखक: Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Andy Tang, William Chen, Andrew Wagenmaker, Chelsea Finn, Sergey Levine

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक शानदार, उच्च प्रशिक्षित रोबोट शेफ है। इस शेफ ने लाखों कुकिंग वीडियो देखे हैं और वह पूरी सटीकता के साथ काटने, चलाने और पलटने का काम जानता है। हालांकि, यदि आप इसे कुछ ऐसा करने के लिए कहते हैं जो इसने पहले नहीं देखा है—जैसे "उस अजीब नए ब्रेड के साथ सैंडविच बनाना जो हमने अभी खरीदा है"—तो यह भ्रमित होकर रुक सकता है या पीनट बटर फैलाने के लिए चाकू का उपयोग करने की कोशिश कर सकता है क्योंकि यह उलझन में है।

आमतौर पर, इसे ठीक करने के लिए, आपको उस विशिष्ट सैंडविच को बनाने वाले किसी व्यक्ति के घंटों के नए वीडियो रिकॉर्ड करने होंगे और रोबोट को शुरू से फिर से प्रशिक्षित करना होगा। यह धीमा और महंगा है।

यह पेपर एक चतुर ट्रिक पेश करता है जिसे फ्लो रिवर्सल स्टीयरिंग (FRS) कहा जाता है। इसे एक "जादुई अनुवादक" के रूप में समझें जो आपके रोबोट शेफ को बिना पूर्ण पुनरप्रशिक्षण (retraining) के अपनी मौजूदा मानसिक शक्ति का उपयोग करके नई समस्याओं को हल करने में मदद करता है।

यह कैसे काम करता है, इसे सरल चरणों में यहाँ दिया गया है:

1. समस्या: "अस्पष्ट बॉस" बनाम "सटीक शेफ"

कल्पना कीजिए कि आपका एक बॉस है (एक इंसान या एक स्मार्ट AI जैसे विजन-लैंग्वेज मॉडल) जो जानता है कि क्या किया जाना है लेकिन यह नहीं जानता कि इसे शारीरिक रूप से कैसे करना है।

  • बॉस कहता है: "ब्रेड को प्लेट पर ले जाओ।"
  • रोबोट की समस्या: यदि रोबोट सीधे बॉस की बात सुनने की कोशिश करता है, तो वह अपने हाथ को झटकेदार, भद्दे तरीके से हिला सकता है जिससे ब्रेड गिर सकती है। बॉस के निर्देश बहुत "कोर्स" (खुरदरे/अस्पष्ट) हैं, लेकिन रोबोट को "फाइन" (सटीक) गतिविधियों की आवश्यकता है।

2. समाधान: "रिवर्स इंजन"

रोबोट का मस्तिष्क (जिसे "फ्लो पॉलिसी" कहा जाता है) एक मशीन की तरह है जो रैंडम स्टैटिक नॉइज़ (शोर) को सुचारू, पूर्ण गतिविधियों में बदल देता है।

  • सामान्य मोड: रोबोट स्टैटिक नॉइज़ से शुरू होता है और उसे "डिनोइज़" (शोर हटाना) करके एक सुचारू क्रिया बनाता है।
  • नई ट्रिक (FRS): नॉइज़ से शुरू करने के बजाय, टीम ने इस मशीन को उल्टा (backwards) चलाने का तरीका खोज निकाला है।
    1. बॉस एक खुरदरा निर्देश देता है (जैसे, "दाएं बढ़ो")।
    2. रोबोट उस खुरदरे निर्देश को लेता है और अपने मस्तिष्क के माध्यम से उसे उल्टा चलाता है।
    3. यह "रिवर्स रन" एक विशिष्ट टुकड़े के "स्टैटिक नॉइज़" को ढूंढ निकालता है, जो यदि आगे की ओर चलाया जाए, तो एक सुचारू, पूर्ण गति पैदा करेगा जो बॉस के खुरदरे निर्देश जैसा दिखेगा लेकिन वास्तव में बहुत बेहतर होगा।
    4. रोबोट फिर उस शोर को आगे की ओर चलाकर एक सटीक, सुचारू क्रिया प्राप्त करता है।

उपमा (Analogy): कल्पना कीजिए कि आपके पास घोड़े की एक मूर्ति है।

  • बॉस कहता है, "इसे दौड़ते हुए घोड़े जैसा बनाओ।"
  • पुराना तरीका: रोबोट अंदाज़ा लगाने की कोशिश करता है कि उसे कैसे तराशना है, जिससे अक्सर गलतियाँ होती हैं।
  • FRS वाला तरीका: रोबोट "दौड़ते हुए घोड़े" के विचार को लेता है, उसे एक "रिवर्स मूर्तिकार" के माध्यम से उल्टा चलाता है ताकि उस सटीक संगमरमर के ब्लॉक (नॉइज़) को खोजा जा सके, जो सामान्य रूप से तराशे जाने पर एक पूर्ण दौड़ते हुए घोड़े में बदल जाएगा। यह एक खुरदरे विचार के भीतर छिपे ब्लूप्रिंट को खोजने जैसा है।

3. इस जादू का उपयोग करने के तीन तरीके

यह पेपर दिखाता है कि यह ट्रिक रोबोट को सीखने में तीन तरह से मदद करती है:

  • तत्काल सहायता (Zero-Shot): आप इस ट्रिक का उपयोग अभी कर सकते हैं। एक इंसान या AI एक खुरदरा निर्देश देता है, रोबोट इसे परफेक्ट मूव खोजने के लिए रिवर्स करता है, और पफ—रोबोट कार्य को सफलतापूर्वक पूरा कर लेता है, भले ही उसने वह कार्य पहले कभी न देखा हो।
  • तेजी से सीखना (Behavioral Cloning): यदि रोबोट इस ट्रिक का उपयोग करके कार्य को कुछ बार सफलतापूर्वक करता है, तो हम एक छोटे, तेज़ "सहायक" रोबोट को उस नॉइज़ की नकल करने के लिए सिखा सकते हैं जिसे उसने खोजा था। यह सहायक एक मिनट से भी कम समय में सीख जाता है और बाद में अपने आप इस कार्य को पूरी तरह से कर सकता है। यह एक मास्टर शेफ से कुछ नोट्स लेने और तुरंत एक सु-शेफ (sous-chef) बन जाने जैसा है।
  • रीइन्फोर्समेंट लर्निंग को सुपरचार्ज करना: आमतौर पर, रोबोट को प्रयास-और-त्रुटि (Reinforcement Learning) द्वारा सिखाना घास के ढेर में सुई खोजने जैसा है। रोबोट हजारों बार प्रयास करता है और विफल होता है। FRS रोबोट को एक "संकेत" (एक अच्छा शुरुआती नॉइज़) देता है ताकि उसे शून्य से शुरुआत न करनी पड़े। यह रोबोट को उन कठिन कार्यों को सीखने में मदद करता है जिनमें वह पूरी तरह से विफल हो जाता।

4. वास्तविक दुनिया के परिणाम

टीम ने वास्तविक रोबोट और सिमुलेशन पर इसका परीक्षण किया:

  • उन्होंने ब्रेड हिलाने, तौलिये लटकाने और कप रखने में मदद करने के लिए इसका उपयोग किया।
  • कुछ मामलों में, रोबोट केवल एक मिनट के प्रशिक्षण के बाद 99% बार विफल होने से बढ़कर 95% बार सफल होने तक पहुँच गया।
  • यह तब भी काम आया जब "बॉस" (इंसान या AI) ने केवल "दाएं बढ़ो" या "ऊपर बढ़ो" जैसे बहुत सरल, अस्पष्ट निर्देश दिए।

सारांश

फ्लो रिवर्सल स्टीयरिंग एक तरीका है जिससे आप एक इंसान या AI के खुरदरे, अस्पष्ट विचार को तुरंत एक पूर्ण, सुचारू रोबोट मूवमेंट में अनुवादित कर सकते हैं। यह रोबोट को नई समस्याओं को तेज़ी से हल करने, तेज़ी से सीखने और उन कार्यों को संभालने के लिए अपने मौजूदा ज्ञान का उपयोग करने की अनुमति देता है जिन्हें वे पहले करने में बहुत भ्रमित थे। यह अनिवार्य रूप से एक "स्मार्ट फिल्टर" है जो खुरदरे रेखाचित्रों को उत्कृष्ट कृतियों (masterpieces) में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →