← नवीनतम पेपर
💻 computer science

ReFPO: Reflow Regularization for Flow Matching Policy Gradients

ReFPO एक सरल, कुशल ऑनलाइन सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो एक स्पष्ट रिफ्लो (Reflow) नियमितीकरण पद को पेश करके फ्लो मैचिंग पॉलिसी ग्रेडिएंट्स को बेहतर बनाता है, जो प्रशिक्षण को स्थिर करता है, प्रॉक्सी-अनुपात स्पाइक्स को कम करता है, और बिना किसी अतिरिक्त कम्प्यूटेशनल ओवरहेड के उच्च-सटीकता वाले एक-चरण अनुमान (one-step inference) को सक्षम बनाता है।

मूल लेखक: Ge Wang, Yibo Peng, Fan Feng, Shenhao Yan, Chengsi Yao, Jiahao Yang, Honghao Cai, Yiming Zhao, Xi Li, Jinke Ren, Shuguang Cui, Yatong Han, Zhen Li

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ge Wang, Yibo Peng, Fan Feng, Shenhao Yan, Chengsi Yao, Jiahao Yang, Honghao Cai, Yiming Zhao, Xi Li, Jinke Ren, Shuguang Cui, Yatong Han, Zhen Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करके शोध पत्र ReFPO की व्याख्या दी गई है।

बड़ी तस्वीर: एक रोबोट को सुचारू रूप से चलना सिखाना

कल्पंतना कीजिए कि आप एक रोबोट को चलने या गेंद पकड़ने के लिए सिखा रहे हैं। अतीत में, रोबोट साधारण "गौसियन" (Gaussian) नीतियों का उपयोग करते थे, जो एक बेल कर्व (bell curve) के आधार पर अगले कदम का अनुमान लगाने जैसा है (जहाँ अधिकांश चालें औसत होती हैं, और कुछ ही चरम होती हैं)। लेकिन जटिल कार्यों के लिए, रोबोटों को अधिक रचनात्मक होने की आवश्यकता है। उन्हें मल्टीमॉडल डिस्ट्रीब्यूशन (multimodal distributions) को संभालने की आवश्यकता है—जिसका अर्थ है कि उन्हें यह पता होना चाहिए कि समस्या को हल करने के दो अच्छे तरीके हो सकते हैं (जैसे, "चट्टान के ऊपर से कूदें" या "चट्टान के चारों ओर से जाएँ")।

इसे करने के लिए, शोधकर्ता फ्लो मैचिंग (Flow Matching) का उपयोग करते हैं। इसे एक जादुई नदी के रूप में सोचें जो शोर के एक अराजक ढेर (रैंडम स्टैटिक) से एक आदर्श, साफ क्रिया (रोबोट की चाल) में बहती है।

समस्या:
आमतौर पर, यह "नदी" घुमावदार और टेढ़ी-मेढ़ी होती है। शोर से क्रिया तक पहुँचने के लिए, रोबोट को कई छोटे कदम उठाने पड़ते हैं (जैसे एक घुमावदार पहाड़ी रास्ते पर चलना)। यह धीमा है और इससे लेटेंसी (latency) यानी लैग (lag) पैदा होता है। यदि आप गंतव्य तक पहुँचने के लिए केवल एक बड़ी छलांग (एक कदम) लगाने की कोशिश करते हैं, तो आप चूक सकते हैं क्योंकि रास्ता बहुत अधिक घुमावदार है।

समाधान: ReFPO
लेखकों ने ReFPO (Reflow-regularized Flow Matching Policy Gradients) बनाया। उनका लक्ष्य उस नदी को सीधा बनाना है ताकि रोबोट बिना सटीकता खोए, एक एकल, बड़ी छलांग लगा सके और ठीक वहीं उतर सके जहाँ उसे होना चाहिए।


मुख्य खोज: "छिपा हुआ शॉर्टकट"

शोधकर्ताओं ने गौर किया कि ये रोबोट कैसे सीखते हैं, इसके बारे में कुछ दिलचस्प है।

  1. पुराना तरीका (FPO): जब रोबोट सीखता है, तो वह अपने रिवॉर्ड (इनाम) को अधिकतम करने की कोशिश करता है। इसे करने के लिए इस्तेमाल की जाने वाली गणित (जिसे FPO कहा जाता है) ने अनजाने में नदी को थोड़ा "सीधा" करना शुरू कर दिया था। यह एक ऐसे हाइकर (पहाड़ी यात्री) की तरह था जो, सबसे अच्छा दृश्य खोजने की कोशिश करते हुए, अनजाने में रास्ते को सीधा करने के लिए झाड़ियों को काट देता है।
  2. दोष: हालाँकि, यह अनजाने में हुआ सीधापन अव्यवस्थित था। इसने केवल "अच्छी" चालों (उच्च रिवॉर्ड) के लिए रास्ता सीधा किया, लेकिन "बुरी" चालों के लिए रास्ता और भी अधिक घुमावदार बना दिया। इससे रोबोट भ्रमित और प्रशिक्षण के दौरान अस्थिर हो गया।

ReFPO की अंतर्दृष्टि:
लेखकों ने महसूस किया कि वे उस "अनजाने में हुए सीधेपन" को स्पष्ट और नियंत्रित बना सकते हैं। उन्होंने एक सरल नियम जोड़ा: "चाहे चाल अच्छी हो या बुरी, शोर से क्रिया तक का रास्ता जितना संभव हो उतना सीधा होना चाहिए।"

वे इसे रिफ्लो रेगुलराइजेशन (Reflow Regularization) कहते हैं।


उपमा: "सीधी रेखा" वाला कोच

कल्पना कीजिए कि आप एक धावक को शुरुआती रेखा (शोर) से फिनिश लाइन (क्रिया) तक स्प्रिंट करने के लिए प्रशिक्षित कर रहे हैं।

  • मानक प्रशिक्षण (FPO): कोच धावक को बताता है, "तेज़ दौड़ो और स्वर्ण पदक जीतो!" धावक स्वाभाविक रूप से सबसे तेज़ रास्ता खोजने की कोशिश करता है। कभी-कभी यह रास्ता एक सीधी रेखा होता है; कभी-कभी यह टेढ़ा-मेढ़ा होता है क्योंकि धावक बाधाओं से विचलित होता है।
  • ReFPO कोच: कोच एक नया नियम जोड़ता है: "मुझे फर्क नहीं पड़ता कि आप पदक जीतते हैं या नहीं; आपको बिल्कुल सीधी रेखा में दौड़ना होगा।"
    • यदि धावक टेढ़ा-मेढ़ा दौड़ने की कोशिश करता है, तो कोच उसे धीरे से वापस सीधी रेखा पर धकेलता है।
    • यह उसे तेज़ दौड़ने (रिवॉर्ड पाने) से नहीं रोकता है; यह बस सुनिश्चित करता है कि रास्ता कुशल हो।

यह जादू क्यों है?
क्योंकि रास्ता अब एक सीधी रेखा है, धावक को फिनिश लाइन तक पहुँचने के लिए 10 छोटे कदम लेने की आवश्यकता नहीं है। वह एक बड़ी छलांग ले सकता है और फिर भी बिल्कुल सही जगह उतर सकता है।


उन्होंने क्या सिद्ध किया?

इस शोध पत्र ने तीन प्रकार की चुनौतियों पर इसका परीक्षण किया:

  1. ग्रिडवर्ल्ड (एक वीडियो गेम भूलभुलैया):

    • दृश्य: उन्होंने उन चित्रों को दिखाया जो "नदी" को दर्शाते हैं जिसे रोबोट ने सीखा था।
    • परिणाम: पुराने तरीके में नदी घुमावदार और अस्त-व्यset थी। ReFPO ने नदी को सीधा कर दिया। रोबोट अभी भी दो अलग-अलग रास्तों के बीच चयन कर सकता था (मल्टीमॉडल), लेकिन उसने ऐसा बिना भटके किया।
  2. मुजोको (MuJoCo) प्लेग्राउंड (रोबोट भौतिकी):

    • कार्य: रोबोट को चलना, दौड़ना या पोल पर संतुलन बनाना सिखाना।
    • परिणाम: ReFPO-प्रशिक्षित रोबोट अधिक स्थिर थे। वे प्रशिक्षण के दौरान अक्सर "क्रैश" नहीं हुए। सबसे महत्वपूर्ण बात यह है कि जब उन्होंने एक सिंगल स्टेप (एकल कदम) में चलने की कोशिश की (10 कदमों के बजाय), तो वे 10-स्टेप वाले संस्करणों जितने ही बेहतर प्रदर्शन कर रहे थे।
  3. ह्यूमनॉइड कंट्रोल (एक पूर्ण-शरीर वाला रोबोट):

    • कार्य: एक रोबोट को जटिल मानव नृत्य की मुद्राओं की नकल करने के लिए तैयार करना।
    • परिणाम: यह एक बहुत कठिन कार्य है जिसमें कई चलते-फिरते हिस्से होते हैं। ReFPO ने रोबोट को बहुत कम जानकारी मिलने पर भी नृत्य की मुद्राओं को सटीक रूप से दोहराने की अनुमति दी। इसने इन्फरेंस टाइम (inference time) (एक चाल सोचने में लगने वाला समय) को आधा करने से भी अधिक कम कर दिया क्योंकि इसे केवल एक स्टेप की आवश्यकता थी।

"सीक्रेट सॉस" (यह कुशल क्यों है)

आमतौर पर, किसी मॉडल को तेज़ बनाने के लिए "डिस्टिलेशन" (distillation) नामक एक लंबी, जटिल प्रक्रिया की आवश्यकता होती है (एक छोटे मॉडल को बड़े मॉडल की नकल करना सिखाना)। इसमें बहुत अधिक समय और कंप्यूटिंग पावर लगती है।

ReFPO अलग है।
लेखकों ने पाया कि वे कोड की एक एकल पंक्ति का उपयोग करके इस "सीधा करने" के नियम को जोड़ सकते हैं। उन्हें अतिरिक्त प्रशिक्षण चरणों या दूसरे शिक्षक मॉडल की आवश्यकता नहीं थी। उन्होंने बस उस गणित को थोड़ा बदल दिया जिसका रोबोट पहले से ही उपयोग कर रहा था।

दावों का सारांश

  • तेज़: रोबोट गुणवत्ता में लगभग बिना कोई कमी किए, दस के बजाय एक स्टेप में निर्णय ले सकते हैं।
  • स्थिर: प्रशिक्षण प्रक्रिया के क्रैश होने या अनियमित होने की संभावना कम है क्योंकि "रास्ते" जो रोबोट सीखता है, वे अधिक सुचारू हैं।
  • सरल: यह एक ज्यामितीय "रेगुलराइज़र" (चीजों को सीधा रखने का नियम) जोड़कर काम करता है जो उन गणनाओं का पुन: उपयोग करता है जो रोबोट पहले से ही कर रहा था।
  • बहुमुखी: यह सरल भूलभुलैया, मानक रोबोटिक भुजाओं और जटिल पूर्ण-शरीर वाले मानवॉइड्स पर काम करता है।

संक्षेप में, ReFPO उस जटिल, घुमावदार सड़क को एक सीधा हाईवे बना देता है जिसका उपयोग रोबट सीखने के लिए करते हैं, जिससे वे बिना नया इंजन लगाए तेज़ और सुरक्षित रूप से चल सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →