← नवीनतम पेपर
🤖 machine learning

Stepwise Credit Assignment for GRPO on Flow-Matching Models

यह शोध पत्र Stepwise-Flow-GRPO को प्रस्तुत करता है, जो फ्लो-मैचिंग मॉडल्स के लिए एक सुदृढीकरण शिक्षण (reinforcement learning) विधि है जो समान अंतिम-छवि पुरस्कारों के बजाय रिवॉर्ड सुधारों के आधार पर व्यक्तिगत पीढ़ी चरणों को श्रेय देकर नमूना दक्षता और अभिसरण में सुधार करती है, जबकि मध्यवर्ती रिवॉर्ड अनुमान को बढ़ाने के लिए टवीडी के फॉर्मूला (Tweedie's formula) और एक DDIM-प्रेरित SDE का लाभ उठाती है।

मूल लेखक: Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Singh

प्रकाशित 2026-03-31
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yash Savani, Branislav Kveton, Yuchen Liu, Yilin Wang, Jing Shi, Subhojyoti Mukherjee, Nikos Vlassis, Krishna Kumar Singh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को एक विवरण के आधार पर चित्र बनाना सिखा रहे हैं, जैसे कि "एक नीला बेंच और एक सफेद बिल्ली।"

AI इमेज जनरेशन की दुनिया में, रोबोट केवल एक फोटो नहीं खींचता; वह शोर (static noise) से भरे एक कैनवास (जैसे टीवी का 'स्नो') से शुरुआत करता है और धीरे-धीरे कदम-दर-कदम उस शोर को साफ करता है जब तक कि चित्र उभर न आए। इस प्रक्रिया को डिफ्यूजन (diffusion) कहा जाता है।

पुराना तरीका: "फाइनल ग्रेड" की समस्या

पहले, शोधकर्ताओं ने इस रोबोट को सिखाने के लिए Flow-GRPO नामक एक विधि का उपयोग किया था। यह कैसे काम करता था:

  1. रोबोट एक ही शोर (noise) से 8 अलग-अलग पेंटिंग बनाता है।
  2. वे यह देखने के लिए अंत तक प्रतीक्षा करते हैं कि कौन सी पेंटिंग सबसे अच्छी दिखती है।
  3. वे केवल अंतिम चित्र के आधार पर एक "ग्रेड" (रिवॉर्ड) देते हैं।
  4. खामी: उन्होंने उस एक ही ग्रेड को रोबोट द्वारा उठाए गए हर एक कदम के लिए दिया।

उपमा (Analogy): कल्पना कीजिए कि एक छात्र 10-चरणों वाला गणित का टेस्ट दे रहा है।

  • चरण 1-3: वह बकवास लिखता है।
  • चरण 4-7: वह एक बड़ी गणना संबंधी गलती करता है।
  • चरण 8-10: वह जादुई रूप से गलती को ठीक कर देता है और सही उत्तर प्राप्त करता है।
  • पुराना शिक्षक: "बहुत बढ़िया! आपको अंतिम उत्तर पर 'A' मिला है, इसलिए आपके द्वारा लिया गया हर एक चरण एकदम सही था।"
  • परिणाम: छात्र ने सीखा कि बकवास लिखना और गलतियाँ करना ठीक है, जब तक कि वह अंत में उन्हें ठीक कर सके। वह शुरुआत में सावधान रहना नहीं सीखता।

AI के संदर्भ में, इसका मतलब था कि रोबोट को गलत शुरुआती निर्णय लेने (जैसे आसमान में बिल्ली रख देना) के लिए पुरस्कृत किया जा रहा था, सिर्फ इसलिए क्योंकि वह बाद में उसे ठीक कर सकता था। इसने गलत सबक सीखने में समय बर्बाद किया।

नया तरीका: Stepwise-Flow-GRPO

लेखकों ने एक स्मार्ट शिक्षक पेश किया: Stepwise-Flow-GRPO

अंतिम ग्रेड का इंतजार करने के बजाय, यह शिक्षक हर एक कदम के बाद छात्र की प्रगति को देखता है।

उपमा:

  • चरण 1: छात्र एक कच्चा खाका (outline) बनाता है। शिक्षक कहता है, "आकार पर अच्छी शुरुआत!" (रिवॉर्ड बढ़ जाता है)।
  • चरण 2: छात्र बिल्ली का सिर मिटा देता है। शिक्षक कहता है, "रुको, तुमने इसे अभी और खराब कर दिया!" (रिवॉर्ड घट जाता है)।
  • चरण 3: छात्र सिर को फिर से बनाता है। शिक्षक कहता है, "बहुत बेहतर! तुमने स्कोर में सुधार किया।"

हर कदम पर बदलाव (यानी "गेन") को देखकर, रोबोट सीखता है:

  1. शुरुआती चरण बड़े चित्र (संरचना, लेआउट) के लिए होते हैं। यदि आप इसमें गलती करते हैं, तो इसे बाद में ठीक करना कठिन होता है।
  2. बाद के चरण बारीकियों (फर की बनावट, रंग) के लिए होते हैं।
  3. यदि कोई चरण चित्र को बदतर बनाता है, भले ही उसे बाद में ठीक कर दिया जाए, तो रोबक यह सीखता है कि ऐसा कदम नहीं उठाना चाहिए।

"शोर" (Noise) की समस्या

एक दूसरी समस्या भी थी। रोबोट को सिखाने के लिए, शोधकर्ताओं को पेंटिंग की प्रक्रिया को थोड़ा "शोरयुक्त" (noisy/random) बनाना पड़ा ताकि रोबोट विभिन्न विचारों को खोज सके। लेकिन पुराने तरीके ने शोर को इतना अस्त-व्यस्त बना दिया कि "शिक्षक" (रिवॉर्ड मॉडल) चित्र को स्पष्ट रूप से देख भी नहीं पा रहा था ताकि एक अच्छा ग्रेड दे सके।

समाधान: लेखकों ने शोर जोड़ने का एक नया तरीका बनाया, जो DDIM नामक एक तकनीक से प्रेरित है।

  • उपमा: कल्पना कीजिए कि पुराना तरीका ऐसा था जैसे कोई मेज को बहुत जोर से हिला रहा हो और आप उस पर किताब पढ़ने की कोशिश कर रहे हों। नया तरीका मेज को बस इतना ही धीरे से हिलाने जैसा है जिससे चीजें दिलचस्प बनी रहें, लेकिन इतना भी नहीं कि आप शब्दों को पढ़ न सकें। यह "शिक्षक" को बेहतर, स्पष्ट फीडबैक देने में मदद करता है।

यह क्यों मायने रखता है?

  1. तेजी से सीखना: क्योंकि रोबोट को तुरंत फीडबैक मिलता है कि उसने क्या सही किया या गलत, वह बहुत तेजी से सीखता है। वह गलतियाँ दोहराने में समय बर्बाद नहीं करता।
  2. बेहतर कला: अंतिम चित्र अधिक सटीक होते हैं। यदि आप "चार बिल्लियाँ" मांगते हैं, तो इसकी संभावना बहुत कम है कि रोबोट तीन बिल्लियाँ बनाएगा और फिर आखिरी सेकंड में उसे ठीक करने की कोशिश करेगा। वह शुरुआत से ही गिनती सही रखता है।
  3. दक्षता (Efficiency): भले ही नया तरीका प्रक्रिया के बीच में थोड़ा अधिक गणितीय कार्य करता है, लेकिन यह पूरे प्रशिक्षण कार्य को बहुत अधिक कुशलता से सीखकर जल्दी समाप्त कर देता है।

सारांश

Flow-GRPO को एक ऐसे शिक्षक के रूप में सोचें जो केवल अंतिम परीक्षा का ग्रेड देता है, और होमवर्क की गड़बड़ियों को अनदेखा कर देता है।
Stepwise-Flow-GRPO एक ऐसे ट्यूटर की तरह है जो आपको काम करते हुए देखता है, आपकी गलतियों को सुधारता है, और बारीकियों तक पहुँचने से पहले एक ठोस आधार बनाने में आपकी मदद करता है।

परिणाम? AI बेहतर, तेज़ और कम असफल प्रयासों के साथ पेंट करना सीखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →