← नवीनतम पेपर
🤖 machine learning

ReGuide: From Test-Time Guidance to Self-Improving Diffusion Policies

ReGuide एक सेल्फ-इंप्रूविंग फ्रेमवर्क है जो बिहेवियर-क्लोन्ड डिफ्यूजन पॉलिसीज़ के लिए फेज़-कंडीशन्ड गाइडेंस का उपयोग करता है ताकि टेस्ट-टाइम डेविएशन के दौरान सुधारात्मक रोलआउट्स जनरेट किए जा सकें और इस रिकवर्ड डेटा के साथ पॉलिसी को इटरेटिवली फाइन-ट्यून किया जा सके, जो मौजूदा स्टैटिक या नॉन-रियूजेबल गाइडेंस मेथड्स की तुलना में टास्क सक्सेस रेट को काफी बढ़ा देता है।

मूल लेखक: Tzu-Hsiang Lin, Srinivas Shakkottai, Dileep Kalathil, P. R. Kumar

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tzu-Hsiang Lin, Srinivas Shakkottai, Dileep Kalathil, P. R. Kumar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल कार्य करना सिखा रहे हैं, जैसे ब्लॉक को एक के ऊपर एक रखना या किसी औज़ार को लटकाना, यह दिखाकर कि एक इंसान इसे पूरी तरह से कैसे करता है। इसे "इमिटेशन लर्निंग" (Imitation Learning) कहा जाता है।

समस्या यह है कि रोबोट अनाड़ी होते हैं। यदि रोबोट शुरुआत में एक छोटी सी गलती करता है—जैसे किसी ब्लॉक को थोड़ा सा झुका देना—तो वह ऐसी स्थिति में पहुँच जाता है जिसे उसने प्रशिक्षण वीडियो में नहीं देखा था। क्योंकि उसे उस "नई" स्थिति में क्या करना है, यह नहीं पता होता, इसलिए वह घबरा जाता है, एक और गलती करता है, और पूरा कार्य विफल हो जाता है। इसे कोवेरिएट शिफ्ट (covariate shift) की समस्या कहा जाता है: रोबोट भटक जाता है क्योंकि उसकी वास्तविकता उन उदाहरणों से दूर चली जाती है जिनसे उसे सिखाया गया था।

पुराने तरीके बनाम नया तरीका

पुराने तरीके:

  1. "एक्सपर्ट ट्यूटर" विधि: हर बार जब रोबोट भटक जाता है, तो आपको (मानव विशेषज्ञ को) हस्तक्षेप करना पड़ता है, गलती को ठीक करना पड़ता है, और उस सुधार को रिकॉर्ड करना पड़ता है। यह बहुत अच्छा है, लेकिन यह महंगा है और इसके लिए एक इंसान को 24/7 रोबोट पर नज़र रखने की आवश्यकता होती है।
  2. "टेस्ट-टाइम स्टीयरिंग" विधि: आप रोबोट को एक "जीपीएस" (मार्गदर्शन मॉडल) देते हैं जो चलते समय उसे वापस पटरी पर लाने के लिए हल्का सा धक्का देता है। लेकिन यहाँ एक पेच है: एक बार जब रोबोट कार्य पूरा कर लेता है, तो आप जीपीएस डेटा को फेंक देते हैं। आप सुधार से सीखते नहीं हैं; आपने उस एक बार के लिए बस उसका उपयोग किया।

नया तरीका (ReGuide):
इस शोध पत्र के लेखक, ReGuide, एक चतुर मध्य मार्ग प्रस्तावित करते हैं। वे कहते हैं: "जीपीएस डेटा को क्यों फेंक दिया जाए? आइए रोबोट के सफल सुधारों को नए प्रशिक्षण पाठों के रूप में उपयोग करें!"

इसे एक छात्र द्वारा अभ्यास परीक्षा देने की तरह समझें।

  • मानक लर्निंग: छात्र परीक्षा देता है, गलत करता है, और शिक्षक बस कहता है, "अगली बार कोशिश करना।"
  • ReGuide: छात्र फंस जाता है, एक स्मार्ट ट्यूटर उसे उसी क्षण समस्या हल करने में मदद करता है, और फिर छात्र उस विशिष्ट समाधान को अपनी अध्ययन पुस्तिका (नोटबुक) में लिख लेता है। अगली बार, वह उस नोटबुक का अध्ययन करता है। रोबोट केवल निर्देशित नहीं हो रहा है; वह अपने स्वयं के सुधारों से सीख रहा है

ReGuide कैसे काम करता है (3-चरणों का नुस्खा)

लेखक इसे तीन मुख्य सामग्रियों में विभाजित करते हैं:

1. फेज-कंडीशन्ड गाइडेंस (चेकपॉइंट्स वाला मैप)

लंबे कार्यों (जैसे खिलौना जोड़ना) के अलग-अलग चरण होते हैं: "पार्ट उठाना," "टेबल तक ले जाना," "पेच डालना।"

  • समस्या: यदि आप केवल रोबोट को "फिनिश लाइन की ओर जाओ" कहेंगे, तो वह भाग उठाने से पहले ही पेच डालने की कोशिश कर सकता है।
  • समाधान: ReGuide कार्य को फेज (एक किताब के अध्यायों की तरह) में तोड़ देता है। यह प्रत्येक फेज के लिए विशिष्ट "लक्ष्य क्षेत्र" बनाता है।
  • उपमा: कल्पना कीजिए कि आप न्यूयॉर्क से एलए जा रहे हैं। एक ग्लोबल जीपीएस केवल कह सकता है "पश्चिम की ओर बढ़ें।" ReGuide एक ऐसे जीपीएस की तरह है जो कहता है, "अभी, आप 'डेजर्ट क्रॉसिंग' फेज में हैं। आपका लक्ष्य अगला गैस स्टेशन है। अभी समुद्र की चिंता न करें।" यह रोबोट को तत्काल, सही कदम पर केंद्रित रखता है।

2. द "ड्रिफ्टेड-बट-रिकवरेबल" गेट (सेफ्टी स्विच)

रोबोट के पास एक "क्रिस्टल बॉल" (डायनेमिक्स मॉडल) है जो भविष्यवाणी करती है कि यदि वह एक निश्चित क्रिया करता है तो क्या होगा।

  • समस्या: यदि रोबोट पहले से ही परफेक्ट है, तो उसे धकेलना वास्तव में स्थिति बिगाड़ सकता है। यदि रोबोट पहले से ही बहुत अधिक रास्ते से भटक गया है (जैसे, उसने ब्लॉक फर्श पर गिरा दिया है), तो क्रिस्टल बॉल अब अनुमान नहीं लगा सकती कि क्या करना है।
  • समाधान: ReGuide केवल तभी "जीपीएस नजिंग" (हल्का धक्का) चालू करता है जब रोबोट थोड़ा सा भटक गया हो लेकिन अभी भी सुधारा जा सकता हो
  • उपमा: एक रस्सी पर चलने वाले (tightrope walker) के बारे में सोचें। यदि वे थोड़ा डगमगा रहे हैं, तो एक कोच उन्हें स्थिर करने के लिए हल्का सा धक्का देता है। यदि वे बिल्कुल स्थिर खड़े हैं, तो कोच शांत रहता है। यदि वे पहले ही रस्सी से नीचे गिर चुके हैं, तो कोच उन्हें रस्सी पर चलने में मदद नहीं कर सकता। ReGuide केवल तभी हस्तक्षेप करता है जब "डगमगाहट" सुधारी जा सकती है।

3. इटरेटिव सेल्फ-इम्प्रूवमेंट (स्टडी लूप)

यही असली जादू है।

  • चरण A: रोबोट कार्य करने की कोशिश करता है। जब वह भटकने लगता है, तो ReGuide उसे सफलता की ओर वापस ले जाता है।
  • चरण B: रोबोट उस "निर्देशित" पथ को एक नए प्रशिक्षण उदाहरण के रूप में सहेजता है।
  • चरण C: रोबोट इन नए उदाहरणों का उपयोग करके खुद को फिर से प्रशिक्षित करता है।
  • चरण D: रोबोट फिर से प्रयास करता है, लेकिन इस बार वह अधिक स्मार्ट है क्योंकि उसने पिछले "स्टीयरिंग" से सीखा है।

शोध पत्र दिखाता है कि आप इस लूप को दोहरा सकते हैं। रोबोट बेहतर होता जाता है, बेहतर "रिकवरी डेटा" उत्पन्न करता है, और और भी बेहतर होता जाता है। यह एक वीडियो गेम चरित्र की तरह है जो हर बार बॉस फाइट से बचने और बॉस के पैटर्न को सीखने के बाद और अधिक शक्तिशाली हो जाता है।

परिणाम

लेखकों ने चार अलग-अलग रोबोट कार्यों (कैन हिलाना, स्क्वॉयर्स को स्टैक करना, वस्तुओं को ले जाना और औजार लटकाना) पर इसका परीक्षण किया।

  • परिणाम: ReGuide का उपयोग करने वाले रोबोट मूल वीडियो से सीखने वाले रोबोट की तुलना में 1.3 से 7.7 गुना अधिक सफल हुए।
  • तुलना: इसने "टेस्ट-टाइम स्टीयरिंग" पद्धति (जो डेटा को फेंक देती है) को पछाड़ दिया और इसके लिए किसी मानव विशेषज्ञ को लगातार हस्तक्षेप करने की आवश्यकता नहीं पड़ी।

सारांश

ReGuide एक ऐसा सिस्टम है जो रोबोट की "बाल-बाल बची हुई गलतियों" (near-misses) को उसके सबसे अच्छे शिक्षक में बदल देता है। केवल गलती को ठीक करने और भूल जाने के बजाय, रोबोट सुधार को रिकॉर्ड करता है, उसका अध्ययन करता है, और गलतियों से उबरने में माहिर बन जाता है। यह एक स्व-सुधार लूप है जहाँ रोबोट खुद को बचाने के लिए खुद को प्रशिक्षित करता है, बार-बार।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →