← नवीनतम पेपर
💻 computer science

RedFlow: Redirect Failure into Action-Level Corrections for Flow-matching VLA Policy

रेडफ्लो (RedFlow) एक फाइन-ग्रेंड ऑफलाइन रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है जो विफलता के अनुभवों को एक्शन-लेवल सुधारात्मक पर्यवेक्षण में बदलकर फ्लो-मैचिंग विजन-लैंग्वेज-एक्शन पॉलिसियों को बेहतर बनाता है, जिससे मौजूदा तरीकों की तुलना में वास्तविक दुनिया की सफलता दर और सैंपल दक्षता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo

प्रकाशित 2026-07-31
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhengyang Yan, Junhao Li, Fangqi Zhu, Zijun Wang, Quanxin Shou, Yikun Miao, Xiaoyi Pang, Zicong Hong, Song Guo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखा रहे हैं, जैसे शर्ट मोड़ना या फर्श पर झाड़ू लगाना। आप उसे काम करने के बेहतरीन वीडियो दिखाते हैं और रोबोट उनकी नकल करने की कोशिश करता है। इसे "इमिटेशन लर्निंग" (Imitation Learning) कहा जाता है। यह तब बहुत अच्छा काम करता है जब रोबोट एक परिचित कमरे में हो, लेकिन वास्तविक जीवन अस्त-व्यस्त होता है। कभी-कभी रोबोट शर्ट गिरा देता है, या झाड़ू फंस जाती है। अतीत में, जब रोबोट कोई गलती करता था, तो वह बार-बार वही गलत कदम दोहराता रहता था, और तब तक बिगड़ता जाता था जब तक कि वह पूरी तरह हार न मान दे। ऐसा इसलिए था क्योंकि रोबोट को केवल यह बताया गया था कि क्या नहीं करना है (यह कहकर कि "यह विफल रहा"), लेकिन उसे यह नहीं बताया गया था कि इसे कैसे ठीक करना है।

यहाँ आता है "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning - RL), एक ऐसी विधि जहाँ रोबोट सफलता के लिए पुरस्कार और विफलता के लिए दंड प्राप्त करके चीजें सीखता है। आमतौर पर, इसके लिए रोबोट को वास्तविक दुनिया में लाखों बार अभ्यास करने की आवश्यकता होती है, जो धीमा, महंगा और जोखिम भरा है (कल्पना कीजिए कि सफाई सीखते समय एक रोबोट फूलदान तोड़ देता है)। हाल ही में, एक नया प्रकार का रोबोट मस्तिष्क जिसे "फ्लो-मैचिंग VLA" (Vision-Language-Action) कहा जाता है, उभरा है। इसे एक सुपर-स्मार्ट कलाकार के रूप में सोचें जो एक अव्यवस्थित शुरुआती बिंदु से एक पूर्ण अंत तक एक सुचारू, निरंतर पथ पेंट कर सकता है। हालाँकि, यहाँ तक कि ये स्मार्ट कलाकार भी तब संघर्ष करते हैं जब वे ऐसी स्थिति का सामना करते हैं जो उन्होंने पहले नहीं देखी है, जिससे वही "कंपाउंडिंग एरर्स" (compounding errors) पैदा होते हैं जहाँ एक छोटी सी गलती एक बड़ी आपदा में बदल जाती है।

यहीं पर नया पेपर, RedFlow, काम आता है। शोधकर्ताओं ने एक सरल लेकिन कठिन प्रश्न पूछा: क्या हम एक रोबोट को बिना किसी इंसान के हस्तक्षेप के अपनी गलतियों से सीखना सिखा सकते हैं? वे केवल यह नहीं चाहते थे कि रोबोट को पता हो कि "यह बुरा था"; वे चाहते थे कि उसे पता हो कि कौन सा कदम बुरा था और उसके बदले में क्या कदम उठाना चाहिए।

समस्या: "बुरा कदम" का ब्लैक बॉक्स

कल्पना कीजिए कि आप साइकिल चलाना सीख रहे हैं। आप गिर जाते हैं। एक पारंपरिक रोबोट लर्निंग सिस्टम केवल यह कह सकता है, "ठीक है, गिरना बुरा है। ऐसा मत करो।" लेकिन यह आपको यह नहीं बताता कि आप क्यों गिरे। क्या आप बहुत अधिक बाईं ओर झुक गए थे? क्या आपने बहुत ज़ोर से पैडल मारा? क्या आपने किसी गिलहरी को देख लिया था?

रोबोट लर्निंग की दुनिया में, एक "विफल प्रक्षेपवक्र" (failed trajectory) पूरी साइकिल यात्रा के वीडियो की तरह है जो दुर्घटना के साथ समाप्त होती है। पुराने तरीके पूरे वीडियो को देखते थे और कहते थे, "यह पूरी सवारी एक विफलता थी।" वे उस सवारी जैसा कुछ भी करने से बचने की कोशिश करते थे। लेकिन समस्या यह है: शायद सवारी का पहला 90% हिस्सा एकदम सही था, और केवल अंतिम 10% (दुर्घटना) खराब था। यदि आप रोबोट को वह पूरी सवारी करने से मना करते हैं, तो वह पैडल मारने या स्टीयरिंग करने का तरीका भी भूल सकता है, भले ही वे हिस्से ठीक थे। यह एक छात्र को यह कहने जैसा है, "वह निबंध मत लिखो," क्योंकि आखिरी वाक्य में एक टाइपो (लिखने की गलती) थी, भले ही बाकी का निबंध शानदार था।

अन्य तरीकों ने यह पूछकर इसे ठीक करने की कोशिश की, "हे, वह कदम गलत था, इसके बजाय यह वाला प्रयास करो।" लेकिन हर असफल प्रयास को देखने और विशिष्ट सलाह देने के लिए इंसान से पूछना धीमा है और इसे बड़े पैमाने पर लागू करना कठिन है। हमें एक ऐसे रोबोट की आवश्यकता है जो अपनी गलतियों को खुद समझ सके।

समाधान: RedFlow का "स्मार्ट डिटेक्टिव"

लेखक इस पेपर में RedFlow (Redirect Failure into Action-Level Corrections) का प्रस्ताव देते हैं। RedFlow को एक सुपर-स्मार्ट जासूस के रूप में सोचें जो रोबोट के असफल प्रयासों को देखता है और पता लगाता है कि रोबोट कहाँ से पटरी से उतरा।

यह कैसे काम करता है, इसके दो मुख्य तरीके यहाँ दिए गए हैं:

1. "कॉन्टेक्स्ट-अवेयर करेक्टिव मैचिंग" (जासूस की नोटबुक)
जब रोबोट विफल होता है, तो RedFlow केवल दुर्घटना को नहीं देखता। यह दुर्घटना से ठीक पहले के क्षण को देखता है। यह पूछता है: "रोबोट क्या कर रहा था? वह कहाँ था? वह कार्य में कितना आगे था?"

  • उदाहरण: कल्पना कीजिए कि आप एक शर्ट मोड़ने की कोशिश कर रहे हैं, और आप उसे गिरा देते हैं। RedFlow उस क्षण को देखता है जब आपने उसे गिराया और कहता है: "आह, आप अपने दाहिने हाथ से शर्ट पकड़े हुए थे, और यह आधा मुड़ा हुआ था।"
  • फिर, यह अपने मेमोरी बैंक (पिछले प्रयासों का डेटाबेस, जिसमें सफल प्रयास भी शामिल हैं) में जाता है और उन अन्य स्थितियों की तलाश करता है जब रोबोट ठीक उसी स्थिति में था (दाहिने हाथ से आधा मुड़ी हुई शर्ट पकड़े हुए) लेकिन सफल रहा था।
  • यह उस समान स्थिति से एक सफल कदम ढूँढता है—शायद शर्ट को पकड़ने के लिए बाएं हाथ का उपयोग करना। यह केवल यह नहीं कहता कि "इसे मत गिराओ"; यह कहता है, "जब आप इस विशिष्ट स्थान पर हों, तो अपने बाएं हाथ का उपयोग करें।" इसे "करेक्टिव टारगेट" (corrective target) खोजना कहा जाता है।

2. "एडेप्टिव रिडायरेक्शन ऑब्जेक्टिव" (कोच की सीटी)
एक बार जब RedFlow सही "सुधार" (बाएं हाथ से पकड़ना) ढूँढ लेता है, तो उसे रोबोट को यह सिखाने की आवश्यकता होती है। यह तीन अलग-अलग आवाजों के साथ एक विशेष प्रशिक्षण पद्धति का उपयोग करता है:

  • चीयरलीडर (प्रोत्साहित करने वाला): यह कहता है, "बहुत बढ़िया उन हिस्सों के लिए जो काम कर रहे थे! और अधिक ऐसा ही करें!" (सफल कार्यों को सुदृढ़ करना)।
  • स्टॉप साइन (रोकने का संकेत): यह कहता है, "हे, वह विशिष्ट कदम जिसने शर्ट गिरा दी? वह मत करो!" (बुरे कार्यों को रोकना)।
  • गाइड (मार्गदर्शक): यह कहता है, "और इसे गिराने के बजाय, अपने बाएं हाथ से इसे खींचने की कोशिश करें, जैसा कि हमने मेमोरी बैंक में पाया था!" (विफलता को सुधार की ओर मोड़ना)।

यह पुराने तरीकों से अलग है जो केवल यह कहते थे कि "बुरी चीज़ मत करो।" RedFlow सक्रिय रूप से रोबोट को एक बेहतर क्रिया की ओर धकेलता है, जैसे एक कोच खिलाड़ी के हाथ को सही स्थिति में लाने के लिए शारीरिक रूप से निर्देशित करता है।

उन्होंने क्या पाया: अनाड़ी से सक्षम तक

शोधकर्ताओं ने इस विचार का दो तरीकों से परीक्षण किया: एक कंप्यूटर सिमुलेशन में कई विभिन्न कार्यों के साथ (जैसे LIBERO बेंचमार्क) और एक वास्तविक, दो हाथों वाले भौतिक रोबोट पर।

  • सिमुलेशन में: उन्होंने RedFlow की तुलना अन्य स्मार्ट रोबोट लर्निंग विधियों से की। परिणामों ने दिखाया कि RedFlow गलतियों को ठीक करने में बहुत बेहतर था। औसतन, इसने रोबोट की सफलता दर को लगभग 56.2% से बढ़ाकर 68.2% कर दिया। यह उन कार्यों में विशेष रूप से अच्छा था जहाँ रोबोट को एक विशिष्ट लक्ष्य तक पहुँचना था, जिससे सफलता 51.8% से बढ़कर 71.2% हो गई।
  • वास्तविक रोबोट पर: उन्होंने RedFlow को एक वास्तविक रोबोट पर तीन कठिन कार्यों पर लगाया: कपड़े मोड़ना, वस्तुओं पर झाड़ू लगाना और मेज साफ करना।
    • RedFlow से पहले, रोबोट केवल 36.0% बार कपड़े मोड़ पाता था।
    • RedFlow का उपयोग करने के बाद, सफलता दर बढ़कर 67.0% हो गई।
    • कुल मिलाकर, सभी वास्तविक कार्यों में, सफलता दर 56.7% से बढ़कर 74.7% हो गई।

सबसे रोमांचक हिस्सा यह देखना था कि रोबोट "रिकवर" (सुधार) करना कैसे सीखता है। एक वीडियो में, रोबोट एक टी-शर्ट मोड़ रहा था। शर्ट उसके दाहिने हाथ से फिसल गई। एक सामान्य रोबोट बस दाहिने हाथ से उसे पकड़ने की कोशिश करता रहता और विफल हो जाता। लेकिन RedFlow-प्रशिक्षित रोबोट ने महसूस किया, "रुको, मैं इसे दाहिने हाथ से नहीं पकड़ सकता।" फिर उसने शर्ट को वापस पहुंच में लाने के लिए अपने बाएं हाथ का उपयोग किया, और फिर फोल्डिंग जारी रखी। यह किसी इंसान द्वारा प्रोग्राम नहीं किया गया था; रोबोट ने अपने पिछले असफलताओं का विश्लेषण करके और अपनी मेमोरी में एक सफल विकल्प ढूँढकर इसे खुद सीखा।

यह क्यों महत्वपूर्ण है

RedFlow की सबसे अच्छी बात यह है कि यह अविश्वसनीय रूप से कुशल है। आमतौर पर, रोबोट को गलतियों से उबरना सिखाने के लिए, आपको इसे लाखों बार "ऑनलाइन" (वास्तविक दुनिया में) अभ्यास करने की आवश्यकता हो सकती है, जिसमें बहुत समय लगता है और चीजें टूटने का जोखिम होता है। RedFlow ने उन "ऑनलाइन" तरीकों के समान परिणाम प्राप्त किए, लेकिन इसके लिए लगभग 10 गुना कम ट्रेनिंग सैंपल्स का उपयोग किया। इसने यह कुशलता से किया क्योंकि इसने अपने पास मौजूद "बुरे" डेटा का चतुराई से पुन: उपयोग किया, असफलताओं को सीखने के सुनहरे अवसरों में बदल दिया।

यह पेपर सुझाव देता है कि विफलताओं को कचरे के रूप में फेंकने के बजाय, उन्हें बेहतर समाधान खोजने के एक मानचित्र के रूप में उपयोग करके, हम रोबथों को वास्तविक दुनिया में बहुत अधिक मजबूत और सक्षम बना सकते हैं। यह एक ऐसे रोबोट की ओर एक कदम है जो केवल हमारी नकल नहीं करता, बल्कि अपनी ठोकरों से सीखकर अपने काम में बेहतर बनता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →