← नवीनतम पेपर
🤖 AI

MAPO: Mixed Advantage Policy Optimization for Long-Horizon Multi-Turn Dialogue

यह शोधपत्र MAPO का प्रस्ताव करता है, जो एक क्रिटिक-मुक्त (critic-free) सुदृढीकरण शिक्षण (reinforcement learning) एल्गोरिदम है जो जज मॉडल से सघन प्रक्रिया फीडबैक (dense process feedback) को एक मिश्रित एडवांटेज एस्टिमेटर के साथ जोड़ता है ताकि भावनात्मक समर्थन जैसे व्यक्तिपरक कार्यों में स्थिर, स्केलेबल और उच्च-प्रदर्शन वाले दीर्घ-अवधि बहु-चरण संवाद अनुकूलन को सक्षम बनाया जा सके।

मूल लेखक: Naifan Zhang, Ruihan Sun, Jinwei Su, Hengjie Yang, Zhengyuan Pan, Zhaohan Chen, Xiaofan Zhang

प्रकाशित 2026-03-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Naifan Zhang, Ruihan Sun, Jinwei Su, Hengjie Yang, Zhengyuan Pan, Zhaohan Chen, Xiaofan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को थेरेपिस्ट (चिकित्सक) बनना सिखा रहे हैं। आपका लक्ष्य केवल रोबोट को एक आदर्श वाक्य बोलना सिखाना नहीं है; बल्कि आपका लक्ष्य यह है कि रोबोट एक लंबी, सहायक बातचीत कर सके जो वास्तव में समय के साथ किसी व्यक्ति को बेहतर महसूस करने में मदद करे।

यह शोध पत्र, जिसका शीर्षक MAPO है, इन रोबोट्स को प्रशिक्षित करने का एक नया तरीका पेश करता है ताकि वे केवल अनुमान न लगाएं, बल्कि वास्तव में एक अच्छे श्रोता और मददगार बनना सीखें।

यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "अंतिम ग्रेड" का जाल (The "Final Grade" Trap)

कल्पना कीजिए कि आप 10 प्रश्नों की एक परीक्षा दे रहे एक छात्र हैं।

  • पुराना तरीका (Outcome-Only RL): शिक्षक आपको अंत में केवल एक ग्रेड देता है। यदि आपको 'A' मिलता है, तो शिक्षक कहता है, "बहुत अच्छा!" लेकिन वह यह नहीं बताता कि कौन से उत्तर सही थे या गलत। यदि आपको 'C' मिलता है, तो वे बस कहते हैं, "अधिक मेहनत करो।"
    • समस्या: रोबोट को यह पता नहीं चलता कि उसने पहले मिनट में गलती की या आखिरी मिनट में। वह बस इतना जानता है कि पूरी बातचीत "खराब" थी या "अच्छी"। इससे सीखना बहुत धीमा और भ्रमित करने वाला हो जाता है।
  • "नाइव" (Naïve) तरीका: शिक्षक हर एक प्रश्न को व्यक्तिगत रूप से ग्रेड देने की कोशिश करता है। लेकिन इसे निष्पक्ष रूप से करने के लिए, उन्हें छात्र को ठीक 100 बार वही परीक्षा देनी होगी, हर बार केवल एक उत्तर बदलकर यह देखने के लिए कि क्या होता है।
    • समस्या: एक वास्तविक बातचीत में, आप समय को पीछे नहीं ले जा सकते। एक बार जब आप कुछ कहते हैं, तो दूसरा व्यक्ति प्रतिक्रिया देता है, और बातचीत आगे बढ़ जाती है। आप एक वाक्य का परीक्षण करने के लिए एक ही बातचीत को 100 बार नहीं चला सकते। यह बहुत महंगा और असंभव है।

2. समाधान: MAPO (एक "स्मार्ट कोच")

लेखकों ने MAPO (Mixed Advantage Policy Optimization) बनाया है। MAPO को एक स्मार्ट कोच के रूप में सोचें जो पूरे खेल को देखता है लेकिन हर एक चाल पर फीडबैक भी देता है।

MAPO एक ही समय में दो प्रकार के फीडबैक का उपयोग करता है:

A. "दीर्घकालिक स्कोर" (Monte Carlo Returns)

केवल अंतिम ग्रेड देखने के बजाय, MAPो पूरी यात्रा को देखता है।

  • उपमा: कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं। आपको केवल अंत में जीतने की परवाह नहीं है; आपको इस बात की परवाह है कि आपकी वर्तमान चाल अगले 10 मिनट तक जीवित रहने में कैसे मदद करती है। MAPO गणना करता है: "यदि मैं अभी यह अच्छी बात कहता हूँ, तो 5 टर्न बाद उपयोगकर्ता कितना बेहतर महसूस करेगा?"
  • यह रोबोट को एक लंबी बातचीत में कारण और प्रभाव (cause and effect) समझने में मदद करता है।

B. "तत्काल फीडबैक" (Process Rewards)

MAPO के पास एक "जज" (एक बहुत ही स्मार्ट AI) भी है जो हर एक वाक्य को सुनता है और तुरंत एक स्कोर देता है।

  • उपमा: यह एक टेनिस कोच की तरह है जो गेंद मारने के तुरंत बाद चिल्लाता है, "शानदार स्विंग!" या "अपने फुटवर्क पर ध्यान दें!"
  • यह रोबोट को तुरंत बताता है कि कोई विशिष्ट वाक्य सहानुभूतिपूर्ण था या नहीं।

3. असली मंत्र: "मिक्स्ड एडवांटेज" (The "Secret Sauce")

यहीं पर MAPO चतुर हो जाता है। यदि आप केवल "तत्काल फीडबैक" को सुनते हैं, तो रोबोट अभी अच्छी बातें कहने पर बहुत अधिक ध्यान केंद्रित कर सकता है लेकिन बड़े चित्र (big picture) को भूल सकता है। यदि आप केवल "दीर्घकालिक स्कोर" को सुनते हैं, तो आप भ्रमित हो सकते हैं क्योंकि फीडबैक बहुत अस्पष्ट है।

MAPO इन दोनों को एक परफेक्ट स्मूदी की तरह मिलाता है:

  • बैच नॉर्मलाइजेशन (Batch Normalization): यह पूरे समूह की बातचीत को देखता है कि "औसत" क्या है (जैसे अपनी टेस्ट स्कोर की तुलना पूरी कक्षा से करना)।
  • टर्न नॉर्मलाइजेशन (Turn Normalization): यह बातचीत के विशिष्ट क्षण को देखता है (जैसे अपने उत्तर की तुलना उस विशिष्ट प्रश्न की कठिनाई से करना)।

इन दोनों को मिलाकर, रोबोट को स्थिर प्रशिक्षण (stable training) मिलता है। यह अजीब रूप से उच्च या निम्न स्कोर देखने पर पागल नहीं होता (gradient explosion) और तेजी से सीखता है।

4. परिणाम: "अनजान" से "सहानुभूतिपूर्ण" तक

शोधकर्ताओं ने छोटे (7 बिलियन पैरामीटर्स) से लेकर बड़े (32 बिलियन पैरामीटर्स) रोबोट्स पर इसका परीक्षण किया।

  • MAPO से पहले: छोटे रोबोट भावनात्मक समर्थन देने में बहुत खराब थे। वे अक्सर गलत बात कहते थे, उपयोगकर्ता को और बुरा महसूस कराते थे, या बस हार मान लेते थे (0% सफलता दर)।
  • MAPO के बाद:
    • छोटे रोबटेज अचानक सक्षम थेरेपिस्ट बन गए।
    • बड़े रोबोट और भी बेहतर हो गए, उन्होंने बाजार के कुछ सबसे प्रसिद्ध AI मॉडल्स को भी पीछे छोड़ दिया।
    • जादू: भले ही उन्हें केवल एक विशिष्ट प्रकार की भावनात्मक बातचीत पर प्रशिक्षित किया गया था, वे "सहानुभूति" में इतने अच्छे हो गए कि वे किसी भी भावनात्मक स्थिति को संभाल सकते थे, यहाँ तक कि उन स्थितियों को भी जिन्हें उन्होंने पहले नहीं देखा था।

सारांश

MAPO एक रोबोट को डुअल-लेंस कैमरा देने जैसा है:

  1. एक लेंस पूरी कहानी देखने के लिए ज़ूम आउट करता है (दीर्घकालिक प्रभाव)।
  2. दूसरा लेंस हर वाक्य के विवरण को देखने के लिए ज़ूम इन करता है (तत्काल फीडबैक)।

इन दोनों दृश्यों को जोड़कर, रोबोट एक सहायक, दीर्घकालिक श्रोता बनने के लिए सीखता है बिना भ्रमित हुए या क्रैश हुए। यह एक अराजक, कठिन प्रशिक्षण प्रक्रिया को एक स्थिर, अत्यधिक प्रभावी सीखने के अनुभव में बदल देता है, जिससे छोटे AI मॉडल भी भावनात्मक बुद्धिमत्ता के विशेषज्ञ की तरह कार्य करने लगते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →