← नवीनतम पेपर
💬 NLP

MaPPO: Maximum a Posteriori Preference Optimization with Prior Knowledge

यह शोध पत्र MaPPO को प्रस्तुत करता है, जो एक प्राथमिकता अनुकूलन (preference optimization) विधि है जो पूर्व रिवॉर्ड ज्ञान को मैक्सिमम अ पोस्टीरियर (Maximum a Posteriori) उद्देश्य में शामिल करके DPO जैसे मौजूदा दृष्टिकोणों का सामान्यीकरण करती है, जिससे बिना किसी हाइपरपैरामीटर को जोड़े या दक्षता से समझौता किए विभिन्न बेंचमार्क पर LLM संरेखण (alignment) में सुधार होता है।

मूल लेखक: Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Guangchen Lan, Sipeng Zhang, Tianle Wang, Yuwei Zhang, Daoan Zhang, Xinpeng Wei, Xiaoman Pan, Hongming Zhang, Dong-Jun Han, Christopher G. Brinton

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

बड़ी तस्वीर: एक AI को मददगार बनाना सिखाना

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन थोड़े भ्रमित रोबोट (एक लार्ज लैंग्वेज मॉडल) को कहानियाँ लिखने या सवालों के जवाब देने के लिए प्रशिक्षित कर रहे हैं। आप चाहते हैं कि वह एक मददगार इंसान की तरह व्यवहार करे।

लंबे समय तक, इसे करने का सबसे अच्छा तरीका RLHF (ह्यूमन फीडबैक से रिइन्फोर्समेंट लर्निंग) था। इसे एक खेल की तरह समझें जहाँ रोबोट दो उत्तर लिखता है, एक मानव जज बेहतर वाले को चुनता है, और रोबोट को विजेता के लिए "गोल्ड स्टार" और हारने वाले के लिए "टाइम-आउट" मिलता है। रोबोट विजेताओं को दोहराना और हारने वालों से बचना सीखता है।

हालाँकि, यह तरीका महंगा, धीमा है और कभी-कभी रोबोट को घबराया हुआ बना सकता है। यह गलती करने से बचने के लिए छोटे, उबाऊ या अजीब उत्तर लिखना शुरू कर सकता है, भले ही "गलत" उत्तर वास्तव में काफी अच्छा रहा हो।

समस्या: "बाइनरी ट्रैप" (द्वि-विकल्प का जाल)

यह पेपर तर्क देता है कि वर्तमान लोकप्रिय तरीका (जिसे DPO कहा जाता है) सीखने को एक सरल बाइनरी चॉइस (दो विकल्पों में से एक) की तरह मानता है: "यह अच्छा है, वह बुरा है।"

उपमा: कल्पना कीजिए कि एक छात्र गणित की परीक्षा दे रहा है।

  • प्रश्न: "2 + 2 क्या होता है?"
  • उत्तर A: "4" (सही)
  • उत्तर B: "4.0" (यह भी सही है, बस अलग तरह से लिखा गया है)

वर्तमान प्रणाली (DPO) में, शिक्षक इन दोनों उत्तरों को देखता है और कहता है, "ठीक है, A विजेता है, B हार गया।" शिक्षक फिर छात्र को यह मानने के लिए मजबूर करता है कि A पूरी तरह से सही है और B बहुत गलत है।

समस्या यह है कि दोनों उत्तर वास्तव में अच्छे हैं। छात्र को उत्तर B से नफरत करने के लिए मजबूर करके, शिक्षक अनजाने में छात्र का दोनों उत्तरों पर से विश्वास कम कर देता है। छात्र सोचने लगता है, "शायद 4 भी गलत है? शायद मुझे नंबर लिखना ही नहीं चाहिए?" इसे "स्क्वीजिंग इफेक्ट" (दबाव का प्रभाव) कहा जाता है। रोबोट "गलत" होने के डर से इतना डर जाता है कि वह "सही" होने के अपने आत्मविश्वास को खो देता है।

समाधान: MaPPO ("भीड़ की बुद्धिमत्ता" वाला दृष्टिकोण)

लेखक एक नई विधि प्रस्तावित करते हैं जिसे MaPPO कहा जाता है। केवल विजेता और हारने वाले को देखने के बजाय, MaPPO पूछता है: "विजेता वास्तव में कितना अच्छा था? और हारने वाला वास्तव में कितना बुरा था?"

उपमा:
कल्प laइए कि आप एक कुकिंग कॉम्पिटिशन में जज हैं।

  • DPO (पुराना तरीका): आप दो सूप चखते हैं। सूप A स्वादिष्ट है। सूप B भी स्वादिष्ट है, बस थोड़ा कम नमकीन है। आप घोषणा करते हैं कि सूप A विजेता है और सूप B हार गया। आप शेफ्स से कहते हैं, "सूप B कचरा है! इसे फिर कभी मत बनाना!" शेफ्स भ्रमित हो जाते हैं क्योंकि सूप B का स्वाद बहुत अच्छा था।
  • MaPPO (नया तरीका): आप सूप चखते हैं। आप अनुभव से जानते हैं (आपका प्रायर नॉलेज/पूर्व ज्ञान) कि सूप A 9.5/10 है और सूप B 9.0/10 है। आप शेफ्स से कहते हैं: "सूप A अद्भुत है, लेकिन सूप B भी बहुत अच्छा है। सूप B की रेसिपी को सिर्फ इसलिए मत फेंक देना क्योंकि वह मामूली अंतर से हार गया।"

MaPPO एक "रिवॉर्ड मॉडल" (एक पूर्व-प्रशिक्षित AI जो एक विशेषज्ञ जज की तरह काम करता है) का उपयोग करता है ताकि दोनों उत्तरों को एक स्कोर दिया जा सके। फिर यह इन स्कोर का उपयोग प्रशिक्षण को समायोजित करने के लिए करता है। यदि "हारने वाला" वास्तव में एक उच्च-गुणवत्ता वाला उत्तर था, तो MaPPO रोबोट को बताता है: "इस उत्तर को इतनी कड़ी सजा न दें।"

यह कैसे काम करता है (जादुई ट्रिक)

  1. "प्रायर" (पूर्व) ज्ञान: रोबोट के प्रशिक्षण शुरू करने से पहले ही, MaPPO उत्तरों को देखता है और पूछता है, "इस उत्तर के अच्छा होने की कितनी संभावना है?" यह सीखने के मार्गदर्शन के लिए एक मौजूदा स्कोर (जैसे प्रतिष्ठा स्कोर) का उपयोग करता है।
  2. "कैलिब्रेशन" (अंशांकन): यदि "विजेता" और "हारने वाला" गुणवत्ता में बहुत करीब हैं (एक "निकट-टाई"), तो MaPPO रोबोट को धीरे से संकेत देता है। यह उन्हें एक बड़ा अंतर बनाने के लिए मजबूर नहीं करता है। यह कहता है, "आप दोनों बहुत अच्छा कर रहे हैं, बस जो कर रहे हैं उसे जारी रखें।"
  3. कोई अतिरिक्त लागत नहीं: सबसे अच्छी बात? MaPPO के लिए रोब सहित कुछ भी नया सीखने या अतिरिक्त समय लेने की आवश्यकता नहीं है। यह एक ऐसी रेसिपी में नया मसाला डालने जैसा है जिसे आप पहले से जानते हैं। यह बिना किसी नए सेटिंग या अतिरिक्त कंप्यूटर के मौजूदा तरीकों (जैसे DPO, SimPO, IPO) में पूरी तरह फिट बैठता है।

परिणाम: क्या यह काम करता है?

लेखकों ने कई अलग-अलग रोबोट दिमागों (Llama, Mistral और Qwen जैसे मॉडल) और तीन प्रमुख "परीक्षाओं" (MT-Bench और Arena-Hard जैसे बेंचमार्क) पर इसका परीक्षण किया।

  • परिणाम: MaPPO के साथ प्रशिक्षित रोबोटों ने पुराने तरीकों से प्रशिक्षित रोबोटों की तुलना में लगातार उच्च स्कोर किया।
  • अनुभूति: रोबोट अधिक आत्मविश्वासी हो गए। वे गलतियों से बचने के लिए अजीब, छोटे उत्तर लिखना शुरू नहीं हुए। उन्होंने अपना उच्च-गुणवत्ता वाला स्टाइल बनाए रखा और साथ ही बेहतर उत्तरों को प्राथमिकता देना भी सीखा।
  • दक्षता: यह पुराने तरीकों जितना ही तेज़ और सस्ता था।

सारांश

MaPPO को एक स्मार्ट और दयालु शिक्षक के रूप में सोचें। केवल यह कहने के बजाय कि "तुम सही हो, तुम गलत हो," यह कहता है, "तुमने सही किया, और वह दूसरा उत्तर भी वास्तव में काफी अच्छा था। चलो इस आत्मविश्वास को बनाए रखते हैं।"

इस "प्रायर नॉलेज" का उपयोग करके रोबोट को शांत करने से, MaPPO AI मॉडल्स को अपना आत्मविश्वास खोए बिना या अस्थिर हुए बिना मानवीय प्राथमिकताओं के अनुरूप रहने में मदद करता है। यह एक सरल अपग्रेड है जो पूरी प्रशिक्षण प्रक्रिया को अधिक विश्वसनीय बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →