← नवीनतम पेपर
🤖 machine learning

FlowCorrect: Efficient Interactive Correction of Generative Flow Policies for Robotic Manipulation

FlowCorrect एक मॉड्यूलर, इंटरैक्टिव इमिटेशन लर्निंग फ्रेमवर्क है जो स्पार्स ह्यूमन पोज़ करेक्शन्स (sparse human pose corrections) के माध्यम से जनरेटिव फ्लो-मैचिंग रोबोटिक पॉलिसियों के रियल-टाइम, सैंपल-एफिशिएंट एडाप्टेशन को सक्षम बनाता है, जो अंतर्निहित मॉडल को फिर से प्रशिक्षित किए बिना पहले विफल हुए कार्यों पर सफलता दर में महत्वपूर्ण सुधार करता है।

मूल लेखक: Edgar Welte, Yitian Shi, Rosa Wolf, Maximillian Gilles, Rania Rayyes

प्रकाशित 2026-03-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Edgar Welte, Yitian Shi, Rosa Wolf, Maximillian Gilles, Rania Rayyes

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक रोबोट को कोई जटिल कार्य करना सिखाया है, जैसे कॉफी का कप भरना या किसी नाजुक वस्तु को उठाना। आपने उसे सैकड़ों उदाहरण दिखाए हैं, और वह इसमें काफी कुशल हो गया है। लेकिन फिर, आप उसे वास्तविक दुनिया में ले जाते हैं, और अचानक, कॉफी का कप थोड़ा छोटा हो जाता है, या मेज थोड़ी डगमगा रही होती है। रोबोट अपनी पूरी कोशिश करता है, लगभग सफल होने ही वाला होता है, लेकिन तभी वह कॉफी गिरा देता है या वस्तु को हाथ से छोड़ देता है। यह एक "नियर-मिस" (लगभग चूक जाना) है।

अतीत में, इसे ठीक करने का अर्थ होता रोबोट को वापस लैब भेजना, उसे हजारों नए उदाहरण खिलाना, और उसके पूरे मस्तिष्क को फिर से प्रशिक्षित करना। यह महंगा है, धीमा है, और अक्सर इससे रोबोट उन चीजों को भूल जाता है जिनमें वह पहले से ही अच्छा था।

FlowCorrect इसे ठीक करने का एक नया, स्मार्ट तरीका है। इसे एक रोबोट को उसका पूरा दिमाग फिर से बनाने के बजाय एक जीपीएस नेविगेशन अपडेट देने की तरह समझें।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. "फ्लो" (रोबोट की सहज बुद्धि)

रोबोट एक "फ्लो पॉलिसी" का उपयोग करता है। कल्पना कीजिए कि रोबोट का मस्तिष्क नियमों की कोई कठोर सूची नहीं है, बल्कि एक नदी है। यह नदी शुरुआती बिंदु से लक्ष्य तक स्वाभाविक रूप से बहती है। अधिकांश समय, पानी पूरी तरह से बहता है। लेकिन कभी-कभी, एक चट्टान (एक नई, कठिन स्थिति) नदी को रोक देती है, जिससे कॉफी गिर जाती है।

2. "नज" (मानवीय सहायता)

रोबोट को तैरने का बिल्कुल नया तरीका सिखाने के बजाय, एक मानव ऑपरेटर (VR कंट्रोलर का उपयोग करके) बस एक हल्का सा नज (धक्का या संकेत) देता है।

  • पुराना तरीका: "यहाँ वह सटीक रास्ता है जिसे आपको शुरू से अंत तक लेना है।" (इसे करना कठिन है, इसके लिए विशेषज्ञ ज्ञान की आवश्यकता होती है)।
  • FlowCorrect तरीका: "हे, तुम उस चट्टान से टकराने वाले हो। बस कप को थोड़ा सा बाईं ओर धकेलो।" (यह सहज और आसान है, जैसे किसी दोस्त के बैठने के तरीके को सुधारना)।

3. "स्टिकी नोट" (एडैप्टर)

यही जादुई हिस्सा है। FlowCorrect रोबोट के पूरे 'नदी' (मुख्य पॉलिसी) को दोबारा नहीं लिखता है। इसके बजाय, यह रोबोट के मस्तिष्क पर एक छोटा, हल्का "स्टिकी नोट" चिपका देता है।

  • यह नोट केवल इतना कहता है: "जब आप इस विशिष्ट कठिन स्थिति को देखें, तो अपने बहाव में यह छोटा सा 'नज' जोड़ दें।"
  • हर अन्य स्थिति के लिए (जहाँ नदी सामान्य रूप से बह रही है), इस नोट को अनदेखा कर दिया जाता है, और रोबм अपनी मूल, अत्यधिक कुशल सहज बुद्धि का उपयोग करता है।

4. "ट्रैफिक लाइट" (गेटिंग सिस्टम)

यह सुनिश्चित करने के लिए कि रोबोट भ्रमित न हो, FlowCorrect में एक छोटा ट्रैफिक लाइट सिस्टम है।

  • यदि रोबोट ऐसी स्थिति में है जिसे वह अच्छी तरह जानता है, तो लाइट लाल (Red) है (नज को रोकें, अपनी मूल ट्रेनिंग पर भरोसा करें)।
  • यदि रोबोट उस विशिष्ट "नियर-मिस" ज़ोन में है जहाँ इंसान ने 'नज' दिया था, तो लाइट हरी (Green) हो जाती है (नज लागू करें)।

यह एक बड़ी बात क्यों है?

  • गति: आपको पूरे रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। आपको बस उस छोटे से "स्टिकी नोट" को अपडेट करना है। इसमें मिनट लगते हैं, दिन नहीं।
  • सुरक्षा: क्योंकि रोबोट का मुख्य मस्तिष्क स्थिर रहता है, वह आसान कार्यों को करना नहीं भूलता है। वह केवल उन विशिष्ट समस्याओं के लिए अपना व्यवहार बदलता है जिनका वह सामना कर रहा है।
  • मानव-अनुकूल: आपको रोबोट को ठीक करने के लिए रोबोटिक्स विशेषज्ञ होने की आवश्यकता नहीं है। आपको बस इतना कहने में सक्षम होना चाहिए, "ओह, थोड़ा बाईं ओर मुड़ो," और रोबोट इससे सीख जाता है।

वास्तविक दुनिया का परीक्षण

शोधकर्ताओं ने एक वास्तविक रोबोटिक आर्म पर चार कार्यों के साथ इसका परीक्षण किया: ब्लॉक उठाना, तरल पदार्थ डालना, कप को सीधा करना, और एक हिस्से को तंग छेद में डालना।

  • जब रोबोट विफल हुआ, तो एक इंसान ने उसे कुछ "नज" दिए।
  • FlowCorrect ने उन कुछ "नज" से सीखा।
  • परिणाम: रोबोट ने कठिन कार्यों में अपनी गलतियों को 80% बार ठीक किया, जबकि वह उन आसान कार्यों को भी पूरी तरह से करता रहा जिन्हें वह पहले से ही महारत हासिल कर चुका था।

संक्षेप में: FlowCorrect एक सह-पायलट की तरह है जो केवल तभी फुसफुसाता है, "बाएं मुड़ें," जब आप किसी गड्ढे से टकराने वाले होते हैं, बिना कभी स्टीयरिंग व्हील लेने या आपको फिर से गाड़ी चलाना सिखाने की आवश्यकता के। यह रोबोटों को अधिक अनुकूल, कुशल और वास्तविक, अनिश्चित दुनिया के लिए तैयार बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →