← नवीनतम पेपर
💻 computer science

MoE-GRPO: Optimizing Mixture-of-Experts via Reinforcement Learning in Vision-Language Models

यह शोध पत्र MoE-GRPO का प्रस्ताव करता है, जो एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन (Group Relative Policy Optimization) और मोडैलिटी-अवेयर गाइडेंस (modality-aware guidance) का उपयोग करके विशेषज्ञ चयन को एक क्रमिक निर्णय लेने वाली समस्या के रूप में स्वरूपित करके मिक्सचर-ऑफ-एक्सपर्ट्स विजन-लैंग्वेज मॉडल्स में विशेषज्ञ रूटिंग को अनुकूलित करता है, जिससे विशेषज्ञ विविधता और कार्य विशिष्टता को बढ़ाते हुए ओवरफिटिंग को कम किया जा सके।

मूल लेखक: Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

प्रकाशित 2026-03-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dohwan Ko, Jinyoung Park, Seoung Choi, Sanghyeok Lee, Seohyun Lee, Hyunwoo J. Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास विशेषज्ञों की एक विशाल, सुपर-स्मार्ट टीम है (जैसे विशेषज्ञों का एक विशाल पुस्तकालय) जो चित्रों और वीडियो के बारे में सवालों के जवाब देने के लिए मिलकर काम करती है। इस टीम को विज़न-लैंग्वेज मॉडल (VLM) कहा जाता है।

अतीत में, इस टीम को तेज़ और कुशल बनाए रखने के लिए, मैनेजर (कंप्यूटर) एक बहुत ही सख्त नियम का उपयोग करता था: "हर एक सवाल के लिए, सूची में से टॉप 2 विशेषज्ञों को चुनो और बाकी सबको अनदेखा कर दो।" इसे टॉप-के रूटिंग (Top-K Routing) कहा जाता है।

समस्या: "बोरिंग मैनेजर"

इस सख्त नियम के साथ समस्या यह है कि मैनेजर थोड़ा आलसी और अनुमानित (predictable) है।

  • ओवरफिटिंग (Overfitting): मैनेजर हर तरह के सवाल के लिए हमेशा उन्हीं दो "पसंदीदा" विशेषज्ञों को चुनता है। यदि सवाल एक कुत्ते के बारे में है, तो मैनेजर हमेशा "एक्सपर्ट डॉग" और "एक्सपर्ट एनिमल" को ही चुनता है, भले ही "एक्सपर्ट आर्ट" या "एक्सपर्ट लॉजिक" बेहतर उत्तर दे सकते हों।
  • अवसरों की कमी (Missed Opportunities): क्योंकि मैनेजर कभी अलग-अलग संयोजनों (combinations) को आज़माता ही नहीं है, इसलिए टीम कभी यह सीख ही नहीं पाती कि कभी-कभी विशेषज्ञों का एक मिश्रण बेहतर काम कर सकता है। टीम एक ढर्रे में फंस जाती है, कुछ ही लोगों पर अत्यधिक निर्भर हो जाती है जबकि टीम के बाकी सदस्य खाली बैठे रहते हैं।

समाधान: MoE-GRPO (एक "स्मार्ट कोच")

लेखकों ने इस टीम को प्रबंधित करने का एक नया तरीका पेश किया है जिसे MoE-GRPO कहा जाता है। एक सख्त नियम के बजाय, यह एक रीइन्फोर्समेंट लर्निंग (Reinforcement Learning) कोच (जैसे एक स्पोर्ट्स कोच जो परीक्षण और त्रुटि से सीखता है) का उपयोग करता है।

यह कैसे काम करता है, यहाँ एक सरल उदाहरण दिया गया है:

1. "रोलआउट" गेम (परीक्षण और त्रुटि)

कल्पना कीजिए कि मैनेजर को एक सवाल का जवाब देना है: "आसमान नीला क्यों है?"

  • पुराना तरीका (Top-K): मैनेजर तुरंत उन दो विशेषज्ञों को चुनता है जिन्हें वह सबसे अच्छा समझता है और उत्तर लिख देता है। यदि उत्तर गलत है, तो वे उसी दो विशेषज्ञों के साथ फिर से प्रयास करते हैं।
  • नया तरीका (MoE-GRPO): मैनेजर एक साथ 8 अलग-अलग सिमुलेशन (जिन्हें "रोलआउट्स" कहा जाता है) चलाता है।
    • सिमुलेशन 1: "एक्सपर्ट फिजिक्स" और "एक्सपर्ट आर्ट" को चुनता है।
    • सिमुलेशन 2: "एक्सपर्ट एटमॉस्फियर" और "एक्सपर्ट हिस्ट्री" को चुनता है।
    • सिमुलेशन 3: "एक्सपर्ट लाइट" और "एक्सपर्ट मैथ" को चुनता है।
    • ...और इसी तरह।

2. रिवॉर्ड सिस्टम (स्कोरबोर्ड)

सभी 8 सिमुलेशन के बाद, कोच उत्तरों की जाँच करता है।

  • यदि सिमुलेशन 1 सही उत्तर देता है, तो कोच उसे उच्च स्कोर (रिवॉर्ड) देता है।
  • यदि सिमुलेशन 2 गलत उत्तर देता है, तो उसे कम स्कोर मिलता है।

3. सर्वश्रेष्ठ टीम सीखना (पॉलिसी ऑप्टिमाइज़ेशन)

कोच केवल विजेता को नहीं चुनता; वह विश्लेषण करता है कि विजेता क्यों जीता।

  • "सिमुलेशन 1 सफल हुआ क्योंकि हमने फिजिक्स और आर्ट को एक साथ चुना!"
  • "सिमुलेशन 2 विफल रहा क्योंकि हिस्ट्री इस सवाल के लिए उपयोगी नहीं है।"
  • कोच फिर मैनेजर के दिमाग को अपडेट करता है: "अगली बार, आसमान वाले सवालों के लिए फिजिक्स और आर्ट को प्राथमिकता दें।"

समय के साथ, मैनेजर अंदाज़ा लगाना बंद कर देता है और हर प्रकार के सवाल के लिए विशेषज्ञों का परफेक्ट कॉम्बिनेशन सीख जाता है।

सीक्रेट सॉस: "मोडैलिटी-अवेयर गाइडेंस"

वहाँ एक जोखिम था: क्या होगा यदि मैनेजर एक कार दुर्घटना के वीडियो के बारे में सवाल का जवाब देने के लिए "एक्सपर्ट कुकिंग" को चुनने की कोशिश करता है? यह समय की बर्बादी है।

इसे ठीक करने के लिए, लेखकों ने एक मोडैलिटी-अवेयर गाइड (Modality-Aware Guide) जोड़ा है।

  • इसे विशेषज्ञ कक्ष के प्रवेश द्वार पर एक ट्रैफिक पुलिसकर्मी के रूप में सोचें।
  • यदि इनपुट एक चित्र (picture) है, तो ट्रैफिक पुलिसकर्मी "टेक्स्ट-ओनली" विशेषज्ञों को कमरे में घुसने से रोकता है, उन्हें कहता है, "आज यह तुम्हारा काम नहीं है!"
  • यदि इनपुट टेक्स्ट है, तो ट्रैफिक पुलिसकर्मी "विजुअल" विशेषज्ञों को रोकता है।
  • यह मैनेजर को ऐसे रैंडम कॉम्बिनेशन आज़माने से रोकता है जिनका कोई अर्थ नहीं है, जिससे सीखने की प्रक्रिया बहुत तेज़ और स्थिर हो जाती है।

परिणाम: यह क्यों मायने रखता है

जब उन्होंने इस नए सिस्टम का परीक्षण किया:

  1. बेहतर उत्तर: मॉडल ने पुराने "Top-K" सिस्टम की तुलना में अधिक सवालों के सही जवाब दिए।
  2. कम बोरियत: विशेषज्ञों का उपयोग अधिक समान रूप से किया गया। केवल दो विशेषज्ञों द्वारा सारा काम किए जाने के बजाय, कार्य के आधार पर अलग-अलग विशेषज्ञों को चमकने का मौका मिला।
  3. जनरलाइजेशन (Generalization): मॉडल नए प्रकार के सवालों को संभालने में अधिक स्मार्ट हो गया, क्योंकि इसने केवल एक निश्चित सूची को याद करने के बजाय विशेषज्ञों को लचीले ढंग से मिलाने और जोड़ने का तरीका सीख लिया।

संक्षेप में

MoE-GRPO एक टीम मैनेजर को एक कठोर नियम का पालन करने वाले से बदलकर एक रणनीतिक कोच बनाने जैसा है। हर काम के लिए आँख बंद करके वही दो लोग चुनने के बजाय, कोच कई अलग-अलग टीम संयोजन आज़माता है, देखता है कि कौन जीतता है, और हर विशिष्ट चुनौती के लिए सबसे सटीक टीम तैयार करना सीखता है। यह AI को स्मार्ट, अधिक कुशल और एक ही ढर्रे में फंसने से कम संभावित बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →