← नवीनतम पेपर
🤖 machine learning

Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling

यह शोध पत्र एक स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स (MoE) रिवॉर्ड मॉडल प्रस्तावित करता है जो बाइनरी प्रेफरेंस डेटा से व्याख्या योग्य और विशिष्ट विशेषज्ञों को सीखने के लिए, बिना किसी अतिरिक्त एनोटेशन लागत के, मानव प्राथमिकता विविधता को प्रभावी ढंग से कैप्चर करने और व्यक्तिगत संरेखण को बढ़ाने के लिए है।

मूल लेखक: Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Ji-Ung Lee, Soyoung Oh, Isabel Valera, Vera Demberg

प्रकाशित 2026-06-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yifan Wang, Jinyi Mu, Mayank Jobanputra, Yu Wang, Ji-Ung Lee, Soyoung Oh, Isabel Valera, Vera Demberg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट (एक लार्ज लैंग्वेज मॉडल) को यह सिखाने की कोशिश कर रहे हैं कि मददगार कैसे बनना है। इसे करने के लिए, आपको एक "रिवॉर्ड मॉडल" (Reward Model) की आवश्यकता होगी—एक ऐसा शिक्षक जो रोबोट को बताए, "अच्छा काम किया!" या "फिर से कोशिश करो!" इस आधार पर कि इंसानों को क्या पसंद आया।

समस्या: एक ही आकार सबके लिए सही नहीं होता
वर्तमान में अधिकांश "शिक्षक" एक सख्त प्रिंसिपल की तरह हैं जो सोचते हैं कि सभी को एक जैसी चीज़ें पसंद हैं। यदि प्रिंसिपल को लगता है कि "मजाकिया चुटकुले" सबसे अच्छे हैं, तो वे रोबोट को गंभीर रिपोर्ट लिखने के लिए दंडित करेंगे, भले ही आप गंभीर रिपोर्ट पसंद करते हों। वास्तव में, इंसान अलग होते हैं; कुछ को हास्य पसंद है, कुछ को तथ्य, और कुछ को छोटे उत्तर चाहिए जबकि अन्य लंबी कहानियाँ चाहते हैं। एक अकेला शिक्षक सभी अलग-अलग व्यक्तित्वों को नहीं समझ सकता।

इसे ठीक करने के पिछले प्रयासों में शिक्षकों की एक टीम को काम पर रखा गया, लेकिन उनसे एक ही पूर्व-लिखित नियमों की सूची (जैसे "मजाकिया बनो," "सुरक्षित रहो," "रचनात्मक बनो") पर सहमत होने के लिए कहा गया। इसे सेटअप करना महंगा है और अक्सर यह उन बारीकियों को पकड़ने में विफल रहता है जो वास्तविक लोग वास्तव में चाहते हैं।

समाधान: "विशेषज्ञ विशेषज्ञों" की टीम
इस शोध पत्र के लेखक एक नए प्रकार के शिक्षक टीम का प्रस्ताव करते हैं जिसे स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (Sparse Mixture-of-Experts - MoE) कहा जाता है।

इसे एक ऐसी टीम के रूप में न सोचें जहाँ हर कोई एक साथ चिल्ला रहा हो, बल्कि इसे एक स्मार्ट स्विचबोर्ड ऑपरेटर (द राउटर) के रूप में देखें जो विशेषज्ञों की एक टीम से जुड़ा हुआ है।

  • द राउटर (The Router): जब कोई उपयोगकर्ता प्रश्न पूछता है, तो राउटर उस पर नज़र डालता है और निर्णय लेता है, "यह खाना पकाने का प्रश्न है, चलिए इसे शेफ विशेषज्ञ (Chef Expert) के पास भेजते हैं," या "यह गणित की समस्या है, इसे गणित विशेषज्ञ (Math Expert) के पास भेजें।"
  • विशेषज्ञ (The Experts): प्रत्येक विशेषज्ञ एक छोटा, विशिष्ट शिक्षक है जो एक विशिष्ट प्रकार के कार्य में बहुत अच्छा है।
  • स्पार्स (Sparse): मुख्य शब्द "स्पार्स" है। इसका अर्थ है कि राउटर को निर्णायक होने के लिए प्रशिक्षित किया गया है। वह यह नहीं कहता, "शायद शेफ और शायद गणित वाला।" वह एक (या बहुत कम) विशेषज्ञों को भारी काम करने के लिए चुनता है। यह सिस्टम को स्पष्ट और समझने में आसान बनाता है।

उन्होंने इसे कैसे काम करने के योग्य बनाया
शोधकर्ताओं ने इस सिस्टम को केवल सरल "A बनाम B" डेटा (जैसे, "लोगों ने प्रतिक्रिया B की तुलना में प्रतिक्रिया A को अधिक पसंद किया") का उपयोग करके प्रशिक्षित किया। उन्हें डेटा को जटिल टैग जैसे "मजाकिया" या "वैज्ञानिक" के साथ लेबल करने की आवश्यकता नहीं थी। इसके बजाय, उन्होंने प्रशिक्षण के दौरान तीन विशेष नियम जोड़े:

  1. निर्णायक बनें: राउटर को स्पष्ट रूप से एक विशेषज्ञ चुनने के लिए मजबूर करें (Sparsity)।
  2. संतुलित बनें: यह सुनिश्चित करें कि कोई एक विशेषज्ञ सारा काम न ले जाए; कामों को फैला दें (Balance)।
  3. विभिन्न बनें: यह सुनिश्चित करें कि विशेषज्ञ वास्तव में अलग-अलग चीजें सीखें और वे सभी एक-दूसरे की नकल न करें (Diversity)।

परिणाम: एक टीम जिसे आप वास्तव में समझ सकते हैं
इन नियमों के कारण, सिस्टम ने स्वाभाविक रूप से विशेषज्ञों की एक ऐसी टीम के रूप में खुद को व्यवस्थित किया जिसे इंसान वास्तव में समझ सकते हैं।

  • व्याख्यात्मकता (Interpretability): यदि आप देखते हैं कि "गणित विशेषज्ञ" किस चीज़ पर काम कर रहा है, तो आप देखेंगे कि वह केवल गणित की समस्याओं को हल कर रहा है। यदि आप "सुरक्षा विशेषज्ञ" को देखते हैं, तो वह केवल सुरक्षा संबंधी प्रश्नों को संभाल रहा है। शोधकर्ता यहाँ तक कि एक AI से प्रत्येक विशेषज्ञ के कार्यों का वर्णन करने वाला एक वाक्य लिखने के लिए भी कह सकते थे (जैसे, "यह विशेषज्ञ कानूनी सलाह के अनुरोधों को संभालता है"), और वह विवरण सटीक था।
  • वैयक्तिकरण (Personalization): जब वे इस सिस्टम को किसी विशिष्ट व्यक्ति की पसंद के अनुकूल बनाना चाहते थे, तो उन्हें पूरी टीम को फिर से प्रशिक्षित करने की आवश्यकता नहीं थी। उन्हें केवल राउटर को थोड़ा बदलना था। उदाहरण के लिए, यदि कोई उपयोगकर्ता "रचनात्मक लेखन" पसंद करता है, तो राउटर उनके लगभग सभी प्रश्नों को "क्रिएटिव एक्सपर्ट" के पास भेजने के लिए सीख जाता है।
  • प्रदर्शन: परीक्षणों में, इस पद्धति ने अन्य तरीकों की तुलना में वैयक्तिकरण में बहुत बड़े अंतर (25 अंक से अधिक) से सुधार किया, भले ही उन्होंने सिस्टम को उपयोगकर्ता की पसंद सीखने के लिए बहुत कम डेटा (50 उदाहरण) दिया हो।

यह क्यों महत्वपूर्ण है
यह शोध पत्र दिखाता है कि आप एक ऐसा रिवॉर्ड मॉडल बना सकते हैं जो स्मार्ट भी है (यह मानवीय प्राथमिकताओं के अनुरूप है) और पारदर्शी भी (हम जानते हैं कि इसने निर्णय क्यों लिया क्योंकि हम जानते हैं कि किस विशेषज्ञ को चुना गया था)। यह विशेषज्ञों की एक टीम की तरह है जहाँ आप देख सकते हैं कि कौन सा विशेषज्ञ आपके अनुरोध को संभाल रहा है, बजाय एक ब्लैक बॉक्स के जो केवल एक सामान्य उत्तर देता है।

उल्लिखित सीमाएँ
लेखक नोट करते हैं कि जबकि यह सिस्टम वैयक्तिकरण के लिए बहुत अच्छा है, यह एक एकल, सरल मॉडल की तुलना में यह अनुमान लगाने में थोड़ा कम सटीक है कि "औसत" मानव क्या चाहता है। इसके अलावा, सिस्टम को सेटअप करने के लिए विशेषज्ञों के बीच संतुलन बनाने के लिए कुछ नॉब्स (हाइपरपैरामीटर्स) को ट्यून करने की आवश्यकता होती है।

संक्षेप में, उन्होंने एक ऐसा रिवॉर्ड मॉडल बनाया है जो विशेषज्ञों की एक सुव्यवस्थित टीम के रूप में कार्य करता है, जिससे इसे अलग-अलग लोगों के लिए अनुकूलित करना आसान हो जाता है और प्रक्रिया को स्पष्ट और समझने योग्य बनाए रखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →