← नवीनतम पेपर
🤖 machine learning

SMOPD: Multi-Reward Reinforcement Learning via Specialize-and-Merge Online Policy Distillation

यह शोध पत्र SMOPD का प्रस्ताव करता है, जो एक दो-चरणीय "स्पेशलाइज-एंड-मर्ज" (विशेषज्ञता-और-विलय) ऑनलाइन पॉलिसी डिस्टिलेशन फ्रेमवर्क है, जो विभिन्न स्तरों के बहु-पुरस्कार संकेतों (multi-reward signals) को प्रभावी ढंग से संतुलित करने के लिए रिवॉर्ड-स्पेशलाइज्ड टीचर मॉडल्स को प्रशिक्षित करता है और उन्हें एक एकल स्टूडेंट पॉलिसी में समेकित करता है, जो विभिन्न मॉडल बैकबोन पर GDPO जैसे मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Wen Wang, Jiahua Bao, Tu Yongsiqi, Yihao Liu, Haotian Zhou, Haoxuan Ma, Mengyu Zhou, Wenkui Fan, Junwei He, Xiaoxi Jiang, Guanjun Jiang

प्रकाशित 2026-08-05
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wen Wang, Jiahua Bao, Tu Yongsiqi, Yihao Liu, Haotian Zhou, Haoxuan Ma, Mengyu Zhou, Wenkui Fan, Junwei He, Xiaoxi Jiang, Guanjun Jiang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक आदर्श सहायक बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। आप चाहते हैं कि वह मददगार, हानिरहित हो, और साथ ही सख्त फॉर्मेटिंग नियमों का पालन करने में भी सक्षम हो, जैसे कि विशिष्ट टैग का उपयोग करना या सही टूल्स को कॉल करना। यह Reinforcement Learning from Human Feedback (RLHF) की दुनिया है। इसे एक कुत्ते को प्रशिक्षित करने जैसा समझें: जब वह कुछ अच्छा करता है, तो आप उसे एक इनाम (एक "रिवॉर्ड") देते हैं और वह उस व्यवहार को दोहराना सीख जाता है। लेकिन यहाँ पेचीदा हिस्सा यह है: क्या होगा अगर आप चाहते हैं कि कुत्ता एक साथ बैठ भी जाए और रुके भी और चीज़ें भी लाए? यदि आप उसे सब कुछ करने के लिए एक बड़ा इनाम देते हैं, तो कुत्ता भ्रमित हो सकता है। वह यह समझ सकता है कि इनाम पाने का सबसे आसान तरीका "चीज़ें लाना" है, इसलिए वह "बैठने" और "रुकने" को पूरी तरह से अनदेखा कर देता है। AI की दुनिया में, इसे रिवॉर्ड मास्किंग (reward masking) कहा जाता है, जहाँ एक मजबूत संकेत दूसरे को दबा देता है।

हाल ही में, वैज्ञानिकों ने प्रत्येक कार्य के लिए अलग-अलग स्कोर देकर इसे ठीक करने की कोशिश की, जिसे GDPO नामक एक विधि कहा जाता है। यह कुत्ते को बैठने के लिए एक स्कोरकार्ड, रुकने के लिए दूसरा, और चीज़ें लाने के लिए तीसरा देने जैसा था, और फिर उन्हें जोड़ देने जैसा था। लेकिन इसमें एक समस्या थी: कुछ कार्य मापने में आसान होते हैं (जैसे "क्या उसने गेंद वापस लाई?"), जबकि कुछ दुर्लभ और पहचान में कठिन होते हैं (जैसे "क्या वह 10 सेकंड तक बिल्कुल स्थिर रहा?")। यदि AI को लाखों "गेंद लाने" के स्कोर मिलते हैं लेकिन केवल एक "स्थिर रहने" का स्कोर मिलता है, तो "स्थिर रहने" का संकेत शोर में खो जाता है। AI चीज़ें लाने में तो माहिर हो जाता है लेकिन स्थिर रहना भूल जाता है। यह शोध पत्र, SMOPD, एक सरल प्रश्न पूछता है: हम यह कैसे सुनिश्चित करें कि AI आसान कौशल को भूले बिना दुर्लभ, कठिन-से-पहचानने योग्य कौशल सीख सके?

समस्या: "शोर भरा क्लासरूम"

कल्पना कीजिए कि एक कक्षा है जहाँ एक शिक्षक एक ही समय में छात्रों को दो चीजें सिखाने की कोशिश कर रहा है: जटिल गणित के सवाल हल करना (एक "डेंस" रिवॉर्ड क्योंकि इसमें सही होने के कई चरण होते हैं) और बोलने से पहले हाथ उठाना (एक "स्पार्स" रिवॉर्ड क्योंकि यह कक्षा में केवल एक बार होता है)।

यदि शिक्षक दिन के अंत में केवल एक कुल स्कोर चिल्लाकर बताता है, तो छात्र पूरी तरह से गणित पर ध्यान केंद्रित करेंगे। वे हाथ उठाने को अनदेखा कर देंगे क्योंकि सांख्यिकीय रूप से, गणित के अंक हर जगह मौजूद हैं, जबकि हाथ उठाने के अंक दुर्लभ हैं। भले ही शिक्षक हाथ उठाने को समान रूप से महत्व देने की कोशिश करे, छात्र गणित के स्कोर के शोर के ऊपर इसे स्पष्ट रूप से नहीं सुन पाएंगे। AI मॉडल इसी समस्या का सामना कर रहे थे: वे "डेंस" कार्यों में बहुत अच्छे थे लेकिन "स्पार्स" कार्यों में बहुत खराब थे, जैसे कि अपने उत्तरों को सही ढंग से फॉर्मेट करना या सबसे महत्वपूर्ण समय पर हानिरहित होना।

समाधान: विशेषज्ञता, फिर विलय (Specialize, Then Merge)

इस शोध पत्र के लेखक SMOPD (Specialize-and-Merge Online Policy Distillation) नामक एक चतुर दो-चरणीय रणनीति प्रस्तावित करते हैं। एक ही समय में एक छात्र को सब कुछ करने में परफेक्ट बनाने के बजाय, वे विशेषज्ञों की एक टीम बनाते हैं और फिर उनके कौशल को मिलाते हैं।

चरण 1: विशेषज्ञता (The "Specialist Teachers")
सबसे पहले, शोधकर्ता कई अलग-अलग "शिक्षक" मॉडल प्रशिक्षित करते हैं। लेकिन यहाँ एक मोड़ है: प्रत्येक शिक्षक को केवल एक विशिष्ट कौशल पर ध्यान केंद्रित करने के लिए कहा जाता है।

  • शिक्षक A को कहा जाता है: "गणित को भूल जाओ! तुम्हारा एकमात्र काम यह सुनिश्चित करना है कि छात्र हाथ उठाएं।" ऐसा करने के लिए, शिक्षक को हर बार हाथ उठाने पर एक भारी बोनस मिलता है, जिससे वह संकेत अनदेखा करना असंभव हो जाता है।
  • शिक्षक B को कहा जाता है: "हाथ उठाने को भूल जाओ! तुम्हारा एकमात्र काम गणित के सवाल हल करना है।"

क्योंकि प्रत्येक शिक्षक अपने विशिष्ट कार्य पर अत्यधिक केंद्रित है, वे अपने विशिष्ट काम के विशेषज्ञ बन जाते हैं। शिक्षक A "हाथ उठाने" के दुर्लभ कौशल को पूरी तरह से सीख लेता है क्योंकि वही उनके लिए एकमात्र महत्वपूर्ण चीज़ है। शिक्षक B गणित का जादूगर बन जाता है। वे दोनों के बीच संतुलन बनाने की कोशिश नहीं करते; वे बस एक पर पूरी तरह टूट पड़ते हैं।

चरण 2: विलय (The "Student" Model)
अब, शोधकर्ता एक नया "छात्र" मॉडल लाते हैं। यह छात्र केवल एक शिक्षक की बात नहीं सुनता; यह एक ही समय में सभी शिक्षकों को सुनता है।

  • जब छात्र अपना उत्तर लिख रहा होता है, तो वह देखता है कि शिक्षक A (हाथ उठाने वाला) क्या करेगा और शिक्षक B (गणित के जादूगर) क्या करेगा।
  • छात्र दोनों के सर्वोत्तम हिस्सों को कॉपी करना सीखता है। यदि शिक्षक A फॉर्मेटिंग के बारे में आश्वस्त है, तो छात्र उसे कॉपी करता है। यदि शिक्षक B गणित के बारे में आश्वस्त है, तो छात्र उसे भी कॉपी करता है।

महत्वपूर्ण रूप से, छात्र के पास एक "सुरक्षा जाल" (जिसे एंकर कहा जाता है) भी होता है जो अंतिम उत्तर की जाँच करता है ताकि यह सुनिश्चित हो सके कि यह केवल एक कॉपी-पेस्ट जॉब नहीं है, बल्कि एक अच्छा समग्र उत्तर है। यह सुनिश्चित करता है कि छात्र स्वाभाविक रूप से कौशल को संतुलित करना सीखे, न कि केवल दो अलग-अलग लोगों का एक भ्रमित मिश्रण।

उन्होंने क्या पाया

टीम ने अलग-अलग आकार के AI मॉडलों (1.5 बिलियन, 3 बिलियन, और 7 बिलियन पैरामीटर्स) पर दो बहुत अलग चुनौतियों का उपयोग करके इस विचार का परीक्षण किया:

  1. टूल कॉलिंग (Tool Calling): यह सुनिश्चित करना कि AI सही टूल्स (जैसे कैलकुलेटर या सर्च इंजन) का उपयोग करता है और अपने आउटपुट को बिल्कुल सही तरीके से फॉर्मेट करता है (जैसे विशिष्ट XML टैग का उपयोग करना)।
  2. सुरक्षा (Safety): यह सुनिश्चित करना कि AI मददगार हो लेकिन साथ ही हानिरहित भी हो।

परिणाम प्रभावशाली थे। "टूल कॉलिंग" टेस्ट में, पुराने तरीकों (GDPO) ने फॉर्मेटिंग को केवल लगभग 8.8% बार सही किया क्योंकि फॉर्मेटिंग सिग्नल बहुत स्पार्स था। लेकिन SMOPD के साथ, मॉडलों ने फॉर्मेटिंग को 97.5% बार सही किया! इससे भी अधिक आश्चर्यजनक बात यह थी कि इस प्रक्रिया में उन्होंने अपने गणित कौशल को नहीं खोया। 1.5 बिलियन वाले मॉडल ने पिछले सर्वश्रेष्ठ तरीके की तुलना में अपने समग्र स्कोर में 48% का सुधार देखा।

"सुरक्षा" परीक्षणों में, जहाँ मददगार होने और हानिरहित होने के लक्ष्य कभी-कभी आपस में टकराते हैं, SMOPD ने सभी मॉडल आकारों में अन्य तरीकों की तुलना में लगातार बेहतर प्रदर्शन किया। इसने मददगार होने की अपनी क्षमता को खोए बिना दुर्लभ "हानिरहित" व्यवहारों को सीखने में सफलता प्राप्त की।

यह क्यों महत्वपूर्ण है

यह शोध पत्र सुझाव देता है कि एक ही प्रशिक्षण सत्र में सभी पुरस्कारों को संतुलित करने का पुराना तरीका अब अपनी सीमा पर पहुँच गया है। आप सब कुछ परफेक्ट बनाने के लिए केवल वेट्स (weights) को ट्यून नहीं कर सकते; कभी-कभी, एक कौशल भीड़ में सीखना बहुत दुर्लभ होता है। AI को पहले "विशेषज्ञता" हासिल करने देने से—उसे अलगाव में एक चीज़ में बहुत अच्छा बनने देने से—और फिर उन कौशलों को "विलय" करने से, AI उन कठिन, दुर्लभ चीजों को सीख सकता है बिना आसान चीजों को भूले।

यह यह समझने जैसा है कि एक आदर्श ऑर्केस्ट्रा बनाने के लिए, आपको केवल सबको एक साथ सब कुछ बजाने के लिए नहीं कहना चाहिए। इसके बजाय, आप वायलिन वादकों को अपना हिस्सा अकेले अभ्यास करने देते हैं जब तक कि वे परफेक्ट न हो जाएं, ड्रम वादकों को भी वैसा ही करने देते हैं, और फिर उन्हें एक साथ मिलकर सिम्फनी बजाने के लिए लाते हैं। परिणाम एक ऐसा प्रदर्शन होता है जहाँ हर वाद्य यंत्र स्पष्ट रूप से सुनाई देता है, और संगीत उम्मीद से कहीं बेहतर लगता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →