← नवीनतम पेपर
💬 NLP

PerMix-RLVR: Preserving Persona Expressivity under Verifiable-Reward Alignment

यह शोध पत्र PerMix-RLVR का प्रस्ताव करता है, जो एक प्रशिक्षण रणनीति है जो रोल-प्लेइंग कार्यों में हानिकारक व्यक्तित्व विविधताओं के विरुद्ध मॉडल की मजबूती को बढ़ाने और उच्च-सटीक व्यक्तित्व अभिव्यक्ति को बनाए रखने के लिए सत्यापन योग्य पुरस्कारों (verifiable rewards) के साथ व्यक्तित्व मिश्रण (persona mixing) को सुदृढीकरण लर्निंग (reinforcement learning) के साथ जोड़ती है।

मूल लेखक: Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun

प्रकाशित 2026-04-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jihwan Oh, Soowon Oh, Murad Aghazada, Minchan Jeong, Sungnyun Kim, Se-Young Yun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ PerMix-RLVR पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रचनात्मक उपमाओं (analogies) में विभाजित किया गया है।

बड़ी समस्या: "पर्सोना लॉटरी" (The Persona Lottery)

कल्पना कीजिए कि आपके पास एक बहुत ही स्मार्ट रोबोट सहायक है। आप चाहते हैं कि वह गणित की एक समस्या हल करे।

  • यदि आप उसे कहते हैं, "एक जीनियस गणित के प्रोफेसर की तरह व्यवहार करो," तो वह समस्या को पूरी तरह से हल करता है।
  • यदि आप उसे कहते हैं, "एक चिड़चिड़े बूढ़े बढ़ई की तरह व्यवहार करो," तो वह शायद इसे हल कर दे, लेकिन शायद एक अजीब लहजे के साथ।
  • यदि आप उसे कहते हैं, "एक भ्रमित किंडरगार्टन के बच्चे की तरह व्यवहार करो," तो वह पूरी तरह से विफल हो सकता है क्योंकि वह बहुत अधिक उस बच्चे की तरह दिखने की कोशिश कर रहा है जिसे गणित नहीं आता।

यह "पर्सोना लॉटरी" है। वर्तमान AI की दुनिया में, सही "चरित्र" (persona) चुनना एक जुआ है। कभी-कभी चरित्र मदद करता है; कभी-कभी यह नुकसान पहुँचाता है। सबसे अच्छा परिणाम पाने के लिए, उपयोगकर्ताओं को दर्जनों अलग-अलग पात्रों को आज़माना पड़ता है, उनके परिणामों का इंतज़ार करना पड़ता है, और यह अनुमान लगाना पड़ता है कि कौन सा सबसे अच्छा काम करेगा। यह धीमा, महंगा और निराशाजनक है।

वर्तमान समाधान (और यह क्यों विफल होता है)

शोधकर्ताओं ने AI मॉडल को "मजबूत" (robust) बनाने के लिए प्रशिक्षण देकर इसे ठीक करने की कोशिश की। उन्होंने RLVR (वेरिफिएबल रिवॉर्ड्स के साथ रीइन्फोर्समेंट लर्निंग) नामक एक विधि का उपयोग किया।

उपमा: RLVR को एक सख्त फुटबॉल कोच की तरह समझें।

  • कोच को केवल एक ही चीज़ की परवाह है: खेल जीतना (सही उत्तर प्राप्त करना)।
  • यदि कोई खिलाड़ी एक शानदार ट्रिक (एक विशिष्ट पर्सोना) आज़माता है और स्कोर करता है, तो कोच कहता है, "बहुत बढ़िया!"
  • यदि कोई खिलाड़ी एक शानदार ट्रिक आज़माता है और चूक जाता है, तो कोच कहता है, "यह बंद करो! बस गेंद को सीधा किक मारो!"

परिणाम: AI गणित की समस्याओं को हल करने में बहुत अच्छा हो जाता है, चाहे आप उसे कोई भी पात्र निभाने के लिए कहें। वह "किंडरगार्टनर" या "कवि" बनने की कोशिश करना छोड़ देता है यदि वे स्टाइल उसे उत्तर देने से रोकते हैं। वह एक उबाऊ, कुशल रोबट बन जाता है जो हमेशा सही उत्तर देता है, लेकिन अपना व्यक्तित्व खो देता है। यह एक ऐसे फुटबाल खिलाड़ी की तरह है जो ड्रिब्लिंग करना बंद कर देता है और हर बार गेंद को सीधे नेट में किक मार देता है।

नया समाधान: PerMix-RLVR

लेखकों ने महसूस किया कि यहाँ एक ट्रेड-ऑफ (trade-off) है: रोबस्टनेस (Robustness) बनाम एक्सप्रेसिविटी (Expressivity)।

  • रोबस्टनेस (Robustness): मॉडल अच्छा काम करता है, चाहे आप उससे जो भी बनने को कहें।
  • एक्सप्रेसिविटी (Expressivity): मॉडल वास्तव में वैसा ही महसूस कराता है जैसा आपने उसे बनने के लिए कहा है।

स्टैंडर्ड RLVR आपको उच्च रोबस्टनेस देता है लेकिन एक्सप्रेसिविटी को खत्म कर देता है।

प्रवेश होता है PerMix-RLVR का।
इसे AI के लिए एक मेथड एक्टिंग वर्कशॉप (Method Acting Workshop) के रूप में सोचें।

AI को केवल यह बताने के बजाय कि, "खेल जीतो," यह नई प्रशिक्षण विधि कहती है:

"हम खेल जीतने का अभ्यास करेंगे, लेकिन हमें यह करते हुए नाटक करना होगा कि हम एक किंडरगार्टनर हैं, फिर एक डिटेक्टिव हैं, फिर एक रोबोट हैं, फिर एक दादी माँ हैं। आपको गणित की समस्या को हल करना सीखना होगा अपने चरित्र में बने रहते हुए।"

यह कैसे काम करता है:

  1. द मिक्स (The Mix): प्रशिक्षण के दौरान, AI को गणित की समस्याएं दी जाती हैं, लेकिन हर बार, उसे बेतरतीब ढंग से एक अलग "मास्क" या पर्सोना सौंपा जाता है।
  2. द लेसन (The Lesson): AI सीखता है कि खेल जीतने (रिवॉर्ड पाने) के लिए, उसे अपना मास्क उतारने की ज़रूरत नहीं है। वह सीखता है कि एक "किंडरगार्टनर" भी सरल भाषा में समझाकर गणित हल कर सकता है, और एक "डिटेक्टिव" सुरागों की तलाश करके गणित हल कर सकता है।
  3. द रिजल्ट (The Result): AI एक "यूनिवर्सल स्किल" सीख जाता है जो किसी भी चरित्र के अंदर काम करती है।

जादुई परिणाम

जब आप इस नए AI (PerMix-RLVR) का परीक्षण करते हैं:

  1. यह विश्वसनीय है: यदि आप इसे "भ्रमित छात्र" बनने के लिए कहते हैं, तो यह अभी भी गणित की समस्या को सही ढंग से हल करता है (पुराने AI के विपरीत जो विफल हो सकता था)।
  2. यह एक्सप्रेसिव है: यदि आप इसे "भ्रमित छात्र" बनने के लिए कहते हैं, तो यह वास्तव में भ्रमित लगता है और सरल शब्दों का उपयोग करता है, न कि एक ठंडे, रोबोटिक कैलकुलेटर की तरह वापस आ जाता है।

एक वाक्य में सारांश

PerMix-RLVR AI मॉडल को एक कुशल अभिनेता बनने की शिक्षा देता है जो अपने चरित्र में पूरी तरह से बने रहते हुए एक जटिल पहेली को हल कर सकता है, बजाय एक ऐसे रोबोट के जो चरित्र को पूरी तरह से अनदेखा करके पहेली को हल करता है।

यह क्यों महत्वपूर्ण है

  • उपयोगकर्ताओं के लिए: आपको यह अनुमान लगाने के लिए जुआ खेलने की ज़रूरत नहीं है कि किस "पर्सोना" का उपयोग किया जाए। आप वह चुन सकते हैं जो आपको पसंद है (जैसे, "मेरी प्यारी दादी की तरह व्यवहार करो"), और AI फिर भी बहुत अच्छा काम करेगा।
  • डेवलपर्स के लिए: यह पैसा और समय बचाता है क्योंकि आपको सही प्रॉम्प्ट खोजने के लिए अंतहीन परीक्षण करने की आवश्यकता नहीं है। मॉडल शुरुआत से ही भिन्नता को संभालने के लिए बना है।

यह पेपर मूल रूप से कहता है: "AI को केवल सही होना न सिखाएं; इसे किसी विशिष्ट व्यक्ति बने रहने के दौरान भी सही होना सिखाएं।"

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →