← नवीनतम पेपर
💻 computer science

MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation

यह शोधपत्र MAR-GRPO को प्रस्तुत करता है, जो एक स्टेबलाइज्ड रीइन्फोर्समेंट लर्निंग फ्रेमवर्क है, जिसे मास्क्ड ऑटोरेग्रेसिव-डिफ्यूजन हाइब्रिड इमेज जनरेशन के लिए विकसित किया गया है, और यह ग्रेडिएंट नॉइज़ को कम करने तथा विजुअल क्वालिटी और ट्रेनिंग स्टेबिलिटी में सुधार करने के लिए मल्टी-ट्रैजेक्टरी एक्सपेक्टेशन और अनसर्टेन्टी-अवेयर टोकन सिलेक्शन का उपयोग करता है।

मूल लेखक: Xiaoxiao Ma, Jiachen Lei, Tianfei Ren, Jie Huang, Siming Fu, Aiming Hao, Jiahong Wu, Xiangxiang Chu, Feng Zhao

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaoxiao Ma, Jiachen Lei, Tianfei Ren, Jie Huang, Siming Fu, Aiming Hao, Jiahong Wu, Xiangxiang Chu, Feng Zhao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट कलाकार को एक साधारण विवरण के आधार पर चित्र बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि "एक लकड़ी की मेज पर कॉफी का कप।"

यह शोध पत्र इस रोबोट को प्रशिक्षित करने का एक नया तरीका पेश करता है, जिसे MAR-GRPO कहा जाता है। इसे समझने के लिए कि यह क्यों खास है, आइए हम इस समस्या और इसके समाधान को कुछ रोजमर्रा के उदाहरणों (analogies) का उपयोग करके समझें।

समस्या: "अराजक जोड़ी" (The Chaotic Duo)

जिस रोबोट को वे प्रशिक्षित कर रहे हैं, वह दो अलग-अलग कलाकारों का एक हाइब्रिड (मिश्रण) है जो एक साथ काम कर रहे हैं:

  1. वास्तुकार (Architect - AR Model): यह हिस्सा एक मास्टर प्लानर की तरह है। यह बड़ी तस्वीर तय करता है: कप कहाँ जाएगा? कितनी कुर्सियाँ हैं? सामान्य आकार क्या है? यह बहुत ही तार्किक तरीके से, कदम-दर-कदम काम करता है।
  2. विवरण पेंटर (Detail Painter - Diffusion Head): यह हिस्सा एक अराजक, प्रतिभाशाली लेकिन अप्रत्याशित पेंटर की तरह है। एक बार जब वास्तुकार कहता है, "यहाँ एक कप रखो," तो विवरण पेंटर उसमें बनावट (texture), भाप, लकड़ी के रेशे और रोशनी जोड़ता है।

समस्या:
जब उन्होंने इस जोड़ी को एक मानक विधि (जिसे GRPO कहा जाता है) का उपयोग करके प्रशिक्षित करने की कोशिश की, तो यह उन्हें एक स्कोरकार्ड देने और यह कहने जैसा था, "अगली बार बेहतर करें!"

  • वास्तुकार एक योजना बनाता था।
  • विवरण पेंटर उसे पेंट करने की कोशिश करता था, लेकिन क्योंकि पेंटर थोड़ा "शोर भरा" (random/noisy) होता है, इसलिए परिणाम एक बार बहुत अच्छा हो सकता है और अगली बार बहुत बुरा। भले ही वास्तुकार की योजना वही रही हो।
  • वास्तुकार भ्रमित हो जाता था। "क्या मैंने एक खराब योजना बनाई, या पेंटर का बस आज का दिन खराब था?"
  • परिणाम: प्रशिक्षण अस्थिर हो गया। रोबोट कुछ समय के लिए अच्छा होता, फिर अचानक अजीब, विकृत चित्र बनाने लगता (जैसे कि कॉफी का कप कुर्सी में पिघल रहा हो) या सुधार करना पूरी तरह से बंद कर देता। इसे "डाइवर्सिटी कोलैप्स" (diversity collapse) या "अस्थिरता" कहा जाता है।

समाधान: MAR-GRPO

लेखकों ने इस साझेदारी को स्थिर करने के लिए तीन चतुर तरीके खोजे।

1. "स्वाद परीक्षण" रणनीति (Multi-Trajectory Expectation)

उदाहरण: कल्पना कीजिए कि वास्तुकार विवरण पेंटर को एक रेसिपी (नुस्खा) देता है। पेंटर को केवल एक व्यंजन बनाकर उसका निर्णय लेने देने के बजाय, वास्तुकार पेंटर से उसी व्यंजन के पाँच अलग-अलग संस्करण थोड़े अलग रैंडम अवयवों (ingredients) के साथ बनाने के लिए कहता है।

  • यदि चार संस्करण बेहतरीन स्वाद वाले हैं और एक अजीब है, तो वास्तुकार जानता है कि रेसिपी अच्छी है, और वह एक अजीब संस्करण बस एक इत्तेफाक था।
  • शोध पत्र में: केवल एक रैंडम इमेज के आधार पर रोबोट का निर्णय लेने के बजाय, वे एक ही योजना से कई चित्र बनाते हैं और उनके परिणामों का औसत (average) निकालते हैं। यह "शोर" को फ़िल्टर करता है और वास्तुकार को सटीक रूप से बताता है कि उसे क्या सुधारना है, जिससे सीखने की प्रक्रिया बहुत सहज हो जाती है।

2. "फोकस फिल्टर" (Uncertainty Selection)

उदाहरण: कल्पना कीजिए कि आप एक छात्र के निबंध का मूल्यांकन कर रहे हैं। आपको पूरा निबंध फिर से पढ़ने की आवश्यकता नहीं है यदि पहला पैराग्राफ एकदम सही है। आपको केवल उन पैराग्राफों पर ध्यान केंद्रित करने की आवश्यकता है जहाँ छात्र भ्रमित या अनिश्चित लगता है।

  • शोध पत्र में: रोबोट यह गणना करता है कि चित्र के कौन से हिस्से "अनिश्चित" हैं (जहाँ विवरण पेंटर सबसे अधिक संघर्ष कर रहा है)। यह केवल उन विशिष्ट भ्रमित करने वाले हिस्सों पर ही भारी "स्वाद परीक्षण" रणनीति लागू करता है। आसान हिस्सों के लिए (जैसे कि एक ठोस नीला आकाश), यह केवल मानक विधि का उपयोग करता है।
  • लाभ: यह कंप्यूटिंग पावर बचाता है और रोबोट को सरल चीजों पर बहुत अधिक सोचने से रोकता है, जिससे प्रशिक्षण तेज़ और कुशल रहता है।

3. "निरंतरता जांच" (Token Selection)

उदाहरण: कल्पना लीजिए कि यह एक रिले रेस है। यदि कोई धावक बैटन गिरा देता है या गलत दिशा में दौड़ता है, तो आप उसे उस विशेष भाग के लिए पदक नहीं देना चाहेंगे। आप केवल उन धावकों को पुरस्कृत करते हैं जिन्होंने वास्तव में टीम को आगे बढ़ाने में मदद की।

  • शोध पत्र में: कभी-कभी, वास्तुकार एक ऐसा कदम उठाता है जो वास्तव में अंतिम चित्र को खराब कर देता है। नई विधि जाँचती है: "क्या इस कदम ने वास्तव में चित्र को बेहतर बनाया?" यदि उत्तर 'नहीं' है, तो यह प्रशिक्षण के दौरान उस कदम को अनदेखा कर देती है। यह रोबोट को बुरी आदतें सीखने से रोकता है।

परिणाम

इन तीन तरीकों का उपयोग करके, रोबोट बहुत तेज़ी से और अधिक स्थिरता के साथ सीखता है।

  • पहले: रोबोट अच्छा होता, फिर गिर जाता (crash), फिर अजीब हो जाता।
  • बाद में: रोबोट लगातार सुधार करता है, जिससे बेहतर संरचना, स्पष्ट विवरण और अधिक विविधता वाले चित्र बनते हैं।

संक्षेप में: शोध पत्र ने यह पता लगाया कि रोबोट के "अराजक पेंटर" वाले हिस्से ने "प्लानर" वाले हिस्से को भ्रमित कर दिया था। पेंटर की यादृच्छिकता (randomness) को औसत निकालकर और केवल भ्रमित करने वाले हिस्सों पर ध्यान केंद्रित करके, उन्होंने रोबोट को बिना भ्रमित हुए लगातार सुंदर चित्र बनाना सिखाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →