← नवीनतम पेपर
💻 computer science

OP-GRPO: Efficient Off-Policy GRPO for Flow-Matching Models

OP-GRPO फ्लो-मैचिंग मॉडल्स के लिए पहला ऑफ-पॉलिसी सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो उच्च-गुणवत्ता वाले प्रक्षेपवक्र चयन (trajectory selection), अनुक्रम-स्तरीय महत्व नमूनाकरण (sequence-level importance sampling) और विलंब-चरण ट्रंकेशन (late-step truncation) के साथ एक रिप्ले बफर का उपयोग करके प्रशिक्षण दक्षता को बढ़ाता है ताकि ऑन-पॉलिसी GRPO की तुलना में काफी कम प्रशिक्षण चरणों के साथ बेहतर प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Liyu Zhang, Kehan Li, Tingrui Han, Tao Zhao, Yuxuan Sheng, Shibo He, Chao Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली कलाकार (AI) को बेहतर चित्र बनाना सिखा रहे हैं। कलाकार पहले से ही पेंटिंग करना जानता है, लेकिन आप उसकी शैली को सुधारना चाहते हैं, उसे निर्देशों का अधिक बारीकी से पालन करना सिखाना चाहते हैं, और उसकी कला को अधिक सुंदर बनाना चाहते हैं।

AI की दुनिया में, इस प्रक्रिया को Reinforcement Learning कहा जाता है। आपके द्वारा साझा किया गया पेपर इस कलाकार को सिखाने का एक नया, सुपर-कुशल तरीका पेश करता है, जिसे OP-GRPO कहा जाता है।

यहाँ समस्या और समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है।

समस्या: "फिजूलखर्च छात्र" (The "Wasteful Student")

वर्तमान में, इन AI कलाकारों (जिन्हें Flow-Matching Models कहा जाता है) को सिखाने का मानक तरीका एक बहुत ही सख्त और फिजूलखर्च शिक्षक की तरह है।

  1. पुराना तरीका (On-Policy/Flow-GRPO):
    कल्पना कीजिए कि शिक्षक छात्र से 10 चित्र बनाने के लिए कहता है। शिक्षक उन्हें देखता है, सबसे अच्छा चित्र चुनता है, और कहता है, "बहुत अच्छा!" फिर, शिक्षक उन सभी 10 चित्रों को कूड़ेदान में फेंक देता है और छात्र से फिर से नए खाली कैनवास के साथ शुरू करने को कहता है।
  • समस्या: भले ही छात्र ने तीसरी कोशिश में अनजाने में एक उत्कृष्ट कृति (masterpiece) बना दी हो, उसे फेंक दिया जाता है। छात्र को हर बार शून्य से सब कुछ फिर से सीखना पड़ता है। इसमें बहुत समय लगता है और बहुत अधिक ऊर्जा (कंप्यूटिंग पावर) बर्बाद होती है।
  1. "हार्ड मोड" की समस्या:
    कभी-कभी कार्य वास्तव में कठिन होता है (जैसे किसी विशिष्ट टेक्स्ट के साथ एक जटिल दृश्य बनाना)। छात्र 99 बार विफल हो सकता है और केवल एक बार सफल हो सकता है। यदि शिक्षक उस एक सफलता को तुरंत फेंक देता है, तो छात्र हतोत्साहित हो जाता है और सीखना बंद कर देता है क्योंकि वह सोचता है, "मैं यह नहीं कर सकता।"

समाधान: "स्मार्ट म्यूजियम" (The "Smart Museum" - OP-GRPO)

लेखकों ने OP-GRPO बनाया है। इसे एक स्मार्ट म्यूजियम या रिप्ले बफर (Replay Buffer) के रूप में समझें।

चित्रों को फेंकने के बजाय, शिक्षक छात्र के सबसे अच्छे काम का एक विशेष संग्रहालय रखता है। यहाँ बताया गया है कि OP-GRPO तीन सरल चरणों में कैसे काम करता है:

1. "दोनों दुनियाओं का सर्वश्रेष्ठ" संग्रहालय (Replay Buffer)

  • यह कैसे काम करता है: जब छात्र चित्रों का एक समूह बनाता है, तो शिक्षक केवल उन्हें देखता और फेंकता नहीं है। इसके बजाय, शिक्षक सबसे अच्छे चित्रों को चुनता है और उन्हें म्यूजियम (संग्रहालय) में रख देता है।
  • जादू: अगले पाठ में, शिक्षक केवल नए चित्र बनाने के लिए नहीं कहता। वे कहते हैं, "9 नए चित्र बनाओ, लेकिन 10वें चित्र के लिए, इस म्यूजियम से इस उत्कृष्ट कृति को देखो और इसमें सुधार करने की कोशिश करो।"
  • परिणाम: छात्र हर बार शून्य से शुरू करने के बजाय अपनी पिछली सफलताओं से सीखता है। इससे बहुत समय बचता है।

2. "अनुवाद" सुधार (Sequence-Level Correction)

  • समस्या: यदि छात्र पिछले सप्ताह के चित्र से सीखने के लिए म्यूजियम से एक पेंटिंग देखता है, तो जोखिम होता है। छात्र की शैली थोड़ी बदल सकती है। यदि वे पुराने चित्र की बहुत सख्ती से नकल करने की कोशिश करते हैं, तो वे भ्रमित हो सकते हैं या गलतियाँ कर सकते हैं क्योंकि पुराने चित्र के "नियम" आज की शैली के साथ पूरी तरह से मेल नहीं खाते।
  • समाधान: शिक्षक एक विशेष अनुवादक (Translator) का उपयोग करता है। यह अनुवादक फीडबैक को इस तरह समायोजित करता है कि छात्र समझ सके: "यह पुराना चित्र महान है, लेकिन याद रखें, आप आज अपनी आज की कुशलता के साथ पेंट कर रहे हैं।"
  • यह क्यों महत्वपूर्ण है: इस अनुवादक के बिना, छात्र भ्रमित हो जाता है और प्रशिक्षण क्रैश हो जाता है। इसके साथ, छात्र पुराने उदाहरणों से सुरक्षित रूप से सीखता है।

3. "अंत को काटने" की ट्रिक (Trajectory Truncation)

  • समस्या: AI पेंटिंग में, प्रक्रिया चरणों में होती है।
    • चरण 1: एक धुंधला सा दृश्य।
    • चरण 50: लगभग पूरा हो गया।
    • चरण 100: अंतिम पिक्सेल-परफेक्ट छवि।
      उपलब्ध डेटा से पता चला कि पुराने चित्र के अंतिम चरणों (चरण 99 से 100) को देखना वास्तव में खतरनाक है। वहां गणित जटिल और अस्थिर हो जाता है, जैसे कि इसकी नोक पर पेंसिल को संतुलित करने की कोशिश करना।
  • समाधान: शिक्षक कहता है, "हम पुराने चित्र का चरण 90 तक उपयोग करेंगे। अंतिम 10 चरणों के लिए, आप उन्हें अभी ताज़ा तरीके से पेंट करेंगे।"
  • परिणाम: यह प्रशिक्षण को स्थिर रखता है और गणितीय त्रुटियों के कारण AI को "चक्कर" आने से रोकता है।

परिणाम: तेज़ और बेहतर

लेखकों ने छवियों (जैसे Stable Diffusion) और वीडियो बनाने के लिए इस नई पद्धति का परीक्षण किया।

  • गति: नए तरीके (OP-GRPO) ने पुराने तरीके का उपयोग करके केवल 34% समय में समान गुणवत्ता प्राप्त कर ली। यह एक मैराथन को 3 घंटे के बजाय 1 घंटे में पूरा करने जैसा है।
  • गुणवत्ता: चित्र और वीडियो उतने ही अच्छे या उससे भी बेहतर थे, विशेष रूप से इमेज के अंदर टेक्स्ट लिखने या जटिल निर्देशों का पालन करने जैसे कठिन कार्यों के लिए।

सारांश

OP-GRPO एक शिक्षक को "इसे कूड़े में फेंक दो" शैली से "संग्रहालय क्यूरेट करो" शैली में अपग्रेड करने जैसा है।

  1. सर्वश्रेष्ठ कार्य को सहेजें (इसे फेंकें नहीं)।
  2. फीडबैक को ट्रांसलेट करें ताकि छात्र पुराने उदाहरणों से भ्रमित न हो।
  3. गणितीय त्रुटियों से बचने के लिए पुराने उदाहरणों के बिल्कुल अंत को न देखें।

परिणाम? AI तेजी से सीखता है, कम ऊर्जा का उपयोग करता है, और रिकॉर्ड समय में एक मास्टर कलाकार बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →