← नवीनतम पेपर
🤖 machine learning

SERFN: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows

SERFN एक कुशल वास्तविक-दुनिया के फाइन-ट्यूनिंग फ्रेमवर्क को पेश करता है जो डेक्सट्रस मैनिपुलेशन (dexterous manipulation) के लिए सटीक मल्टीमॉडल लाइक्लीहुड्स हेतु नॉर्मलाइजिंग फ्लो पॉलिसियों को एक्शन-चंक्ड क्रिटिक्स के साथ जोड़ता है ताकि स्थिर, कंजर्वेटिव अपडेट और बेहतर लॉन्ग-होरिज़न क्रेडिट असाइनमेंट को सक्षम बनाया जा सके।

मूल लेखक: Chenyu Yang, Denis Tarasov, Davide Liconti, Hehui Zheng, Robert K. Katzschmann

प्रकाशित 2026-03-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chenyu Yang, Denis Tarasov, Davide Liconti, Hehui Zheng, Robert K. Katzschmann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक अत्यधिक कुशल रोबोटिक हाथ को एक नाजुक कार्य करना सिखाने की कोशिश कर रहे हैं, जैसे कि कैंची से टेप का एक टुकड़ा काटना या अपनी हथेली में एक क्यूब (घन) को घुमाना। आप रोबोट को वास्तविक दुनिया में वर्षों तक अभ्यास करने के लिए नहीं छोड़ सकते; हर बार जब वह कैंची गिराता है या क्यूब को लड़खड़ाता है, तो यह समय की बर्बादी और हार्डवेयर के लिए जोखिम है। आपके पास वास्तविक दुनिया के अभ्यास के प्रयास का केवल एक बहुत छोटा "बजट" है।

यह पेपर SERNF पेश करता है, जो रोबोट को सिखाने का एक नया तरीका है जो एक अत्यधिक कुशल, अति-जागरूक कोच की तरह काम करता है। यह इस समस्या को हल करता है कि कैसे एक रोबोट को "ठीक-ठाक" से "कार्य में महारत" तक बहुत कम वास्तविक दुनिया के प्रयासों में पहुँचाया जाए।

यह यहाँ कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "मल्टीमॉडल" (Multimodal) उलझन

कल्पना कीजिए कि आप एक रोबोट को कैंची पकड़ना सिखा रहे हैं। इसे पकड़ने का केवल एक सही तरीका नहीं है। आप हैंडल को बाईं ओर से, दाईं ओर से, थोड़ा झुकाकर, या सीधा पकड़ सकते हैं। ये सभी वैध समाधान हैं।

  • पुराने AI तरीके अक्सर कैंची पकड़ने के "औसत" तरीके का अनुमान लगाने की कोशिश करते हैं। यह एक छात्र को यह बताने जैसा है कि "कमरे के बीच में खड़े हो जाओ।" वे अंततः कैंची पकड़ने के लिए किसी विशिष्ट समाधान में फिट होने के बजाय अजीब ढंग से खड़े रह जाते हैं और असफल हो जाते हैं।
  • डिफ्यूजन मॉडल (Diffusion models) (एक लोकप्रिय नया AI प्रकार) इन सभी अलग-अलग तरीकों को देखने में माहिर हैं, लेकिन वे एक ब्लैक बॉक्स की तरह हैं। आप उनसे आसानी से नहीं पूछ सकते, "इस विशिष्ट चाल की संभावना कितनी है?" यह उन्हें सुदृढीकरण शिक्षण (Reinforcement Learning/ट्रायल एंड एरर) का उपयोग करके सुरक्षित रूप से सुधारना कठिन बना देता है क्योंकि आप जोखिम को सटीक रूप से माप नहीं सकते।

2. समाधान: "फ्लो" पॉलिसी (मानचित्र बनाने वाला)

SERNF एक नॉर्मलाइजिंग फ्लो (Normalizing Flow) का उपयोग करता है। इसे एक पूरी तरह से प्रतिवर्ती मानचित्र (reversible map) के रूप में सोचें।

  • कल्पना कीजिए कि आपके पास कैंची पकड़ने के विभिन्न तरीकों का एक अराजक ढेर (मल्टीमॉडल वितरण) है।
  • नॉर्मलाइजिंग फ्लो एक ऐसी मशीन है जो उस अराजक ढेर को बिना कोई जानकारी खोए एक व्यवस्थित, सरल कागज़ के ढेर (एक मानक गॉसियन वितरण) में बदल सकती है।
  • यह क्यों मायने रखता है: क्योंकि यह मानचित्र प्रतिवर्ती है, रोबोट किसी विशिष्ट चाल को देखकर कह सकता है, "मुझे पता है कि इस चाल की संभावना कितनी है।" यह रोबोट को रूढ़िवादी, सुरक्षित अपडेट करने की अनुमति देता है। वह कह सकता है, "मैं इस नई चाल को आज़माऊँगा, लेकिन मैं यह सुनिश्चित करूँगा कि मैं उस चीज़ से बहुत दूर न भटक जाऊँ जिसे मैं पहले से जानता हूँ कि काम करता है," जिससे रोबोट के टकराने या क्रैश होने से बचाव होता है।

3. "एक्शन चंक" (संगीत की एक धुन बनाम एक एकल नोट)

अधिकांश रोबोटों को एक समय में एक छोटा कदम उठाने के लिए सिखाया जाता है (जैसे एक गाने को एक समय में एक नोट बजाना)। लेकिन कुशल कार्यों के लिए, आपको एक पूरे संगीत वाक्यांश (phrase) की योजना बनानी होती है।

  • SERNF रोबोट को चंक्स (chunks) में सोचने के लिए प्रशिक्षित करता है। "उंगली 1 हिलाएं," फिर "उंगली 2 हिलाएं" तय करने के बजाय, वह निर्णय लेता है कि "कैंची पकड़ने और उठाने के लिए 10-चरणों का एक क्रम क्या है।"
  • द क्रिटिक (न्यायाधीश): यह परखने के लिए कि कोई योजना अच्छी है या नहीं, आपको एक ऐसे न्यायाधीश की आवश्यकता है जो केवल पहले नोट को नहीं, बल्कि पूरे प्लान को देखे। SERNF एक एक्शन-चंक्ड क्रिटिक (Action-Chunked Critic) का उपयोग करता है। यह एक संगीत आलोचक की तरह है जो केवल पहले सेकंड का न्याय करने के बजाय, पूरे 10 सेकंड के वाक्यांश को सुनने के बाद स्कोर देता है। यह रोबोट को समझने में मदद करता है कि एक डगमगाती शुरुआत ठीक हो सकती है यदि अंतिम परिणाम एक सटीक कट हो।

4. प्रशिक्षण रेसिपी (कोच की योजना)

SERNF केवल रोबोट को सीधे गहरे पानी में नहीं फेंकता। यह चार-चरणीय प्रशिक्षण रेसिपी का पालन करता है:

  1. इमिटेशन (छात्र): पहले, रोबोट मानव वीडियो (टेलीऑपरेशन) देखता है और उनकी नकल करने की कोशिश करता है। वह बुनियादी बातें सीखता है।
  2. ऑफलाइन वार्म-अप (अध्ययन सत्र): वास्तविक दुनिया को छूने से पहले, रोबलेट पिछले डेटा (अच्छे और बुरे दोनों प्रयासों) के एक विशाल पुस्तकालय का अध्ययन करता है ताकि यह सीखा जा सके कि क्या होना चाहिए। वह इस डेटा पर अपने "निर्णय लेने" के कौशल (क्रिटिक) का अभ्यास करता है।
  3. ऑफलाइन RL (सिमुलेशन): रोबोट बिना वास्तविक दुनिया में हिले-डुले, उस डेटा के आधार पर अपने व्यवहार को थोड़ा बेहतर बनाने के लिए खुद को तराशना शुरू करता है।
  4. ऑनलाइन फाइन-ट्यूनिंग (वास्तविक प्रदर्शन): अंत में, रोबोट वास्तविक दुनिया में जाता है। क्योंकि वह बहुत अच्छी तरह से तैयार था, उसे कार्य को पूर्ण करने के लिए केवल कुछ ही वास्तविक प्रयासों की आवश्यकता होती है। वह सुरक्षित रहने के लिए अपने "परफेक्ट मैप" (नॉर्मलाइजिंग फ्लो) का उपयोग करता है और नए, बेहतर तरीकों को खोजने के लिए प्रयोग करता है।

वास्तविक दुनिया के परिणाम

टीम ने इसे दो कठिन कार्यों पर परखा:

  • कैंची और टेप: रोबोट को एक केस में कैंची ढूँढनी थी, उसे उठाना था, और हवा में लटकते हुए टेप के एक टुकड़े को काटना था। यह अविश्वसनीय रूप से कठिन है क्योंकि कैंची फिसलन भरी होती है और टेप पतला होता है।
  • इन-हैंड क्यूब रोटेशन: रोबोट को अपनी हथेली में क्यूब को गिराए बिना उसे घुमाना था।

परिणाम:

  • मानक तरीके या तो अटक गए या टेप काटने में विफल रहे।
  • SERNF ने कैंची पकड़ने पर 50% सफलता दर के साथ शुरुआत की। वास्तविक दुनिया में कुछ घंटों के फाइन-ट्यूनिंग के बाद, इसने पूर्ण कार्य (पकड़ना और काटना) पर 70% सफलता प्राप्त की।
  • क्यूब के लिए, यह क्यूब को तुरंत गिरा देने से लेकर तेज़ गति से लगातार घुमाने तक पहुँच गया।

निचोड़ (The Bottom Line)

SERNF एक रोबोट को क्रिस्टल बॉल (नॉर्मलाइजिंग फ्लो) देने जैसा है जो उसे यह देखने की अनुमति देता है कि कोई चाल कितनी जोखिम भरी है, साथ ही एक रणनीतिकार (चंक्ड क्रिटिक) भी देता है जो आगे की योजना बनाता है। यह रोबोट को बहुत कम अभ्यास के साथ वास्तविक दुनिया में जटिल, नाजुक कौशल सीखने में सक्षम बनाता है, जिससे हमारी अव्यवस्थित, अप्रत्याशित दुनिया में रोबोट को तैनात करना अधिक सुरक्षित और कुशल हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →