← नवीनतम पेपर
💬 NLP

Multi-Objective and Mixed-Reward Reinforcement Learning via Reward-Decorrelated Policy Optimization

यह शोध पत्र रिवॉर्ड-डिकोरिलेटेड पॉलिसी ऑप्टिमाइज़ेशन (RDPO) को प्रस्तुत करता है, जो एक नवीन विधि है जो मल्टी-रिवॉर्ड सुदृढीकरण शिक्षण (reinforcement learning) में एडवांटेज एस्टीमेशन को स्थिर करने के लिए मैग्नीट्यूड-अवेयर क्वांटाइल नॉर्मलाइजेशन और महालानोबिस व्हाइटनिंग का उपयोग करती है, जिससे तर्क (reasoning) या कोडिंग क्षमताओं से समझौता किए बिना इंस्ट्रक्शन फॉलोइंग, लेखन और मजबूती (robustness) पर मॉडल के प्रदर्शन में सुधार होता है।

मूल लेखक: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

प्रकाशित 2026-05-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yang Bai, Kaiyuan Liu, Ziyuan Zhuang, Jiahong Zhou, Rongxiang Weng, Xin Chen, Jingang Wang, Xunliang Cai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट (एक AI) को एक साथ कई अलग-अलग काम करने के लिए प्रशिक्षित कर रहे हैं: कहानियाँ लिखना, गणित की समस्याओं को हल करना, सॉफ़्टवेयर कोड करना और सख्त निर्देशों का पालन करना। इसे सिखाने के लिए, आप हर प्रयास के बाद उसे फीडबैक (पुरस्कार) देते हैं।

समस्या यह है कि ये फीडबैक संकेत अव्यवस्थित हैं। कुछ सरल "पास/फेल" ग्रेड (जैसे एक बाइनरी स्विच) हैं, कुछ 0 से 100 तक के स्कोर हैं, और कुछ जटिल राय हैं। इसके अलावा, ये संकेत अक्सर एक-दूसरे पर हावी होते हैं। उदाहरण के लिए, एक लंबे उत्तर को "विस्तृत" होने के लिए अंक मिल सकते हैं लेकिन "बहुत अधिक शब्द" होने के लिए अंक कट सकते हैं, और "विस्तृत" स्कोर और "शब्दों की अधिकता" वाले स्कोर के बीच गणितीय संबंध हो सकता है।

जब आप रोबोट को सुधार करने के लिए इन मिले-जुले स्कोर को जोड़ने की कोशिश करते हैं, तो प्रशिक्षण अराजक हो जाता है। रोबोट भ्रमित हो सकता है क्योंकि एक विशाल स्कोर उसे हावी कर देता है, वह अन्य संकेतों को अनदेखा कर सकता है, या वह एक लूप में फंस सकता है क्योंकि दो संकेत आपस में लड़ रहे होते हैं।

इस शोध पत्र के लेखक एक नई विधि प्रस्तावित करते हैं जिसे RDPO (Reward-Decorrelated Policy Optimization) कहा जाता है ताकि इस गड़बड़ी को ठीक किया जा सके। RDPO को एक दो-चरणीय "सिग्नल क्लीनर" (संकेत साफ करने वाला) के रूप में समझें जो रोबोट के सीखने से पहले फीडबैक को तैयार करता है।

चरण 1: "निष्पक्षता फ़िल्टर" (मैग्निट्यूड-अवेयर क्वांटाइल नॉर्मलाइजेशन)

समस्या: कल्पना कीजिए कि आप एक कक्षा को ग्रेड दे रहे हैं। एक छात्र को 100 का स्कोर मिलता है, दूसरे को 99, और तीसरे को 0। यदि आप केवल कच्चे नंबरों को देखते हैं, तो 99 और 100 के बीच का अंतर बहुत छोटा दिखता है, लेकिन 0 और 99 के बीच का अंतर बहुत बड़ा है। AI प्रशिक्षण में, यदि एक प्रकार के रिवॉर्ड (जैसे "पास/फेल" चेक) में बहुत बड़ा अंतर है, तो वह अन्य सभी फीडबैक को दबा सकता है, जिससे रोबोट केवल उसी एक चीज़ पर ध्यान केंद्रित करने लगता है और बाकी सब कुछ अनदेखा कर देता है।

समाधान: RDPO एक "निष्पक्षता फ़िल्टर" का उपयोग करता है जिसे मैग्निट्यूड-अवेयर क्वांटाइल नॉर्मलाइजेशन कहा जाता है।

  • यह कैसे काम करता है: कच्चे नंबरों को देखने के बजाय, यह प्रयासों की रैंकिंग और उनके बीच के अंतराल को देखता है। यह बड़े अंतरालों को संकुचित करता है (ताकि 100, 99 से अनंत रूप से बेहतर न लगे) और छोटे अंतरालों को फैलाता है (ताकि 99 और 100 अभी भी अलग दिखें)।
  • उपमा: एक दौड़ की कल्पना करें जहाँ एक धावक 10 सेकंड में समाप्त करता है और दूसरा 100 सेकंड में। यदि आप केवल समय देखते हैं, तो दूसरा धावक बहुत बुरा दिखता है। लेकिन यदि आप दौड़ को इस तरह सामान्य करते हैं कि प्रत्येक को समूह के सापेक्ष प्रदर्शन के आधार पर आंका जाए, तो दूसरे धावक को पहले धावक की भारी बढ़त से कुचले बिना सुधार करने का उचित अवसर मिलता है। यह सुनिश्चित करता है कि कोई भी एक "खराब" या "आउटलियर" प्रयास रोबोट की सीखने की प्रक्रिया को नियंत्रित न करे।

चरण 2: "नॉइज़ कैंसलर" (महालनोबिस व्हाइटनिंग)

समस्या: कभी-कभी, फीडबैक संकेत अनावश्यक होते हैं। कल्पना कीजिए कि आपके पास दो सेंसर हैं: एक मापता है "रोबोट ने कितना बोला" और दूसरा भी मापता है "रोबोट ने कितना बोला"। यदि आप इन दोनों स्कोर को जोड़ते हैं, तो आप एक ही जानकारी को दो बार गिन रहे हैं। या, कल्पना कीजिए कि दो सेंसर विपरीत हैं: एक कहता है "लंबा हो जाओ" और दूसरा कहता है "छोटा हो जाओ"। यदि आप उन्हें बस जोड़ देते हैं, तो वे एक-दूसरे को रद्द कर देते हैं, और रोबोट को कोई स्पष्ट दिशा नहीं मिलती।

समाधान: RDPO एक "नॉइज़ कैंसलर" का उपयोग करता है जिसे महालनोबिस व्हाइटनिंग कहा जाता है।

  • यह कैसे काम करता है: यह विभिन्न फीडबैक संकेतों के बीच के संबंध को देखता है। यदि दो संकेत एक ही बात कह रहे हैं (सहसंबंध), तो यह एक के भार को कम कर देता है ताकि वे दोहराव न करें। यदि वे एक-दूसरे से लड़ रहे हैं, तो यह उन्हें समायोजित करता है ताकि रोबलेट को एक स्पष्ट, संतुलित निर्देश मिल सके।
  • उपमा: एक बैंड के बारे में सोचें जहाँ ड्रमर और बेस वादक बिल्कुल एक ही लय बजा रहे हैं। यह धुंधला और अनावश्यक लगता है। "नॉइज़ कैंसलर" एक साउंड इंजीनियर की तरह है जो बेस को थोड़ा कम कर देता है ताकि रिदम सेक्शन स्पष्ट और सटीक सुनाई दे, न कि धुंधला। यह सुनिश्चित करता है कि रोबोट अद्वितीय जानकारी से सीखे, न कि दोहराए गए शोर से।

परिणाम

लेखकों ने इस विधि का परीक्षण LongCat-Flash नामक एक बड़े AI मॉडल पर किया। उन्होंने इसे चार प्रकार के कार्यों पर प्रशिक्षित किया:

  1. निर्देश पालन (Instruction Following): जैसा आप कहें बिल्कुल वैसा ही करना।
  2. सामान्य लेखन (General Writing): अच्छी कहानियाँ या लेख बनाना।
  3. गणित तर्क (Math Reasoning): तर्क संबंधी पहेलियों को हल करना।
  4. कोडिंग (Coding): कंप्यूटर प्रोग्राम लिखना।

क्या हुआ?

  • लेखन और निर्देश: रोबोट निर्देशों का पालन करने और उच्च गुणवत्ता वाला टेक्स्ट लिखने में काफी बेहतर हो गया। यह कठिन या पेचीदा प्रॉम्प्ट मिलने पर अधिक मजबूत (robust) हो गया।
  • गणित और कोडिंग: रोबोट ने गणित और कोडिंग में पिछले सर्वोत्तम तरीकों के समान ही प्रदर्शन किया। यह गणित या कोडिंग में खराब नहीं हुआ; यह अन्य कार्यों में बहुत बेहतर होने के साथ-साथ प्रतिस्पर्धी बना रहा।

मुख्य निष्कर्ष

शोध पत्र का दावा है कि AI के सीखने से पहले फीडबैक संकेतों को साफ करके (उन्हें निष्पक्ष बनाकर और अनावश्यकता को हटाकर), प्रशिक्षण प्रक्रिया बहुत अधिक स्थिर हो जाती है। यह AI को जटिल, बहु-कार्य (जैसे लिखना और नियमों का पालन करना) में बेहतर होने की अनुमति देता है बिना अपनी गणित की समस्याओं को हल करने या कोड लिखने की क्षमता खोए। यह प्रशंसा और आलोचना के विभिन्न प्रकारों को मिलाने का एक स्मार्ट तरीका है ताकि AI सही सबक सीख सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →