← नवीनतम पेपर
🤖 machine learning

Beyond Entropy: Correctness-Aware Advantage Shaping via Contrastive Policy Optimization

यह शोध पत्र कॉन्ट्रास्टिव पॉलिसी ऑप्टिमाइज़ेशन (CPO) को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो एंट्रॉपी-आधारित एडवांटेज शेपिंग को संदर्भ-निर्देशित और वैनिला जनरेशन के बीच टोकन-स्तरीय कॉन्ट्रास्टिव डिसएग्रीमेंट से बदल देता है ताकि शुद्धता को अधिक सटीक रूप से संकेतित किया जा सके, जिससे ज़ीरो-एडवांटेज समस्या का समाधान होता है और इन-डोमेन एवं आउट-ऑफ-डोमेन दोनों बेंचमार्क पर मौजूदा विधियों से काफी बेहतर प्रदर्शन होता है।

मूल लेखक: Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang

प्रकाशित 2026-07-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Weiwen Xu, Jia Liu, Hou Pong Chan, Long Li, Deng Cai, Min Chen, Hao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक कठिन पहेली हल करना सिखा रहे हैं, जैसे कि कोई जटिल गणित की समस्या या कोडिंग चुनौती। आप केवल यह नहीं चाहते कि रोबोट सही उत्तर का अनुमान लगाए; आप चाहते हैं कि वह सोचना सीखे। यह सुदृढीकरण शिक्षण (Reinforcement Learning) की दुनिया है, जहाँ एक AI प्रयास करके और फीडबैक प्राप्त करके सीखता है। आमतौर पर, फीडबैक सरल होता है: यदि अंतिम उत्तर सही है तो "अच्छा काम किया!" या यदि गलत है तो "फिर से कोशिश करें!" लेकिन यहाँ एक पेच है: सही उत्तर तक पहुँचने का एक लंबा, घुमावदार रास्ता कुछ शानदार चरणों और कुछ मूर्खतापूर्ण गलतियों का मिश्रण हो सकता है। यदि आप केवल अंतिम परिणाम को देखते हैं, तो रोबोट इस बात को लेकर भ्रमित हो सकता है कि कौन से विशिष्ट चरण सहायक थे और कौन से हानिकारक।

इसे ठीक करने के लिए, वैज्ञानिकों ने "एन्ट्रॉपी" (entropy) नामक एक अवधारणा का उपयोग करने की कोशिश की। एन्ट्रॉपी को एक माप के रूप में सोचें कि रोबोट किसी भी क्षण कितना "अनिश्चित" या "भ्रमित" है। यदि रोबोट दो विकल्पों के बीच झिझक रहा है, तो उसकी एन्ट्रॉपी उच्च है। विचार यह था कि उच्च अनिश्चितता का अर्थ है कि रोबोट नए विचारों की खोज कर रहा है, जो अच्छा है, जबकि कम अनिश्चितता का अर्थ है कि वह आश्वस्त है, जो कि भी अच्छा है। लेकिन एक समस्या है: भ्रमित होना हमेशा उपयोगी चीज़ों की खोज करने का संकेत नहीं होता। कभी-कभी, एक रोबोट इसलिए भ्रमित होता है क्योंकि वह एक डेड एंड (बंद रास्ते) में खो गया है। यह एक छात्र की तरह है जो गणित की समस्या को देख रहा है, अपना सिर खुजला रहा है। क्या वे एक चतुर समाधान के बारे में गहराई से सोच रहे हैं, या वे पूरी तरह से खो गए हैं? पारंपरिक तरीके एन्ट्रॉपी का उपयोग करके यह अंतर नहीं कर सके कि यह "उत्पादक भ्रम" है या "हानिकारक भ्रम"। "बियॉन्ड एंट्रॉपी" (Beyond Entropy) नामक यह शोध पत्र इसी रहस्य को सुलझाने की कोशिश करता है, जो रोबोट को यह जानने का एक बेहतर तरीका देता है कि क्या वह सही रास्ते पर है।

शोधकर्ता एक नई विधि प्रस्तावित करते हैं जिसे कॉन्ट्रास्टिव पॉलिसी ऑप्टिमाइज़ेशन (CPO) कहा जाता है। केवल यह अनुमान लगाने के बजाय कि रोबोट भ्रमित है या नहीं, CPO एक छात्र की तरह काम करता है जो अपने होमवर्क की तुलना उत्तर कुंजी (answer key) से करता है। कल्पना कीजिए कि एक छात्र ने अभी-अभी गणित का टेस्ट पूरा किया है। वे अपने काम को देखते हैं और सोचते हैं, "मुझे इस चरण के बारे में यकीन नहीं है।" फिर, वे शिक्षक की उत्तर कुंजी पर एक नज़र डालते हैं। अचानक, गलती स्पष्ट हो जाती है! छात्र देखता है, "ओह, मैंने यहाँ माइनस का चिह्न लिखा था, लेकिन उत्तर कुंजी में प्लस का चिह्न है।" एहसास का वह क्षण—जो उन्होंने सोचा था और जो सही उत्तर है उसके बीच का अंतर—उन्हें बताता है कि वे कहाँ गलत थे।

CPO ऐसा ही AI के लिए करता है। यह AI के अपने उत्तर को लेता है और उसकी तुलना एक "संदर्भ उत्तर" (सही समाधान) से करता है। यह AI द्वारा उत्पन्न प्रत्येक शब्द (या "टोकन") को देखता है। यदि AI एक गलत चरण में आश्वस्त था, तो संदर्भ उत्तर उस गलत चरण में AI के आत्मविश्वास को नाटकीय रूप रूप से गिरा देगा। यदि AI एक सही चरण के बारे में अनिश्चित था, तो संदर्भ उत्तर उसके आत्मविश्वास को बढ़ा देगा। यह "कॉन्ट्रास्टिव डिसएग्रीमेंट" (विपरीत असहमति)—जो AI ने सोचा और जो सही रास्ता है उसके बीच का अंतर—एक अत्यंत विश्वसनीय संकेत बन जाता है। यह शोध पत्र गणित और प्रयोगों के माध्यम से दिखाता है कि यह संकेत केवल यह मापने की तुलना में कि AI कितना "भ्रमित" है, गलतियों को पकड़ने में बहुत बेहतर है।

टीम ने Qwen2.5-Math-7B और Qwen3-Base-4B जैसे मॉडलों का उपयोग करके कुछ बहुत कठिन गणितीय समस्याओं पर इसका परीक्षण किया। उन्होंने पाया कि CPO मानक दृष्टिकोण (GRPO) की तुलना में एक बड़ा सुधार था। औसतन, इसने प्रदर्शन को लगभग 7.7% से 8.5% तक बढ़ा दिया। इससे भी अधिक प्रभावशाली बात यह है कि जबकि अन्य तरीके अक्सर उन समस्याओं को हल करने में खराब हो जाते हैं जिन्हें उन्होंने पहले नहीं देखा था (आउट-ऑफ-डोमेन कार्य), CPO वास्तव में उनमें बेहतर हो गया। ऐसा लगता है कि सत्य से AI के तर्क के अलग होने के विशिष्ट क्षणों पर ध्यान केंद्रित करके, मॉडल ने अधिक सटीक और अधिक रचनात्मक होना सीख लिया है।

इनमें से एक सबसे दिलचस्प निष्कर्ष यह है कि AI विभिन्न प्रकार के उत्तरों से कैसे सीखता है। शोध पत्र सुझाव देता है कि जब AI एक उत्तर सही पाता है, तो इसे और अधिक अन्वेषण करने और नए, रचनात्मक पथों को आज़माने के लिए प्रोत्साहित किया जाना चाहिए (exploration)। लेकिन जब वह एक उत्तर गलत पाता है, तो इसे सिद्ध, सही चरणों पर टिके रहने के लिए निर्देशित किया जाना चाहिए (exploitation)। CPO इन दोनों व्यवहारों को पूरी तरह से संतुलित करता है। यह एक कोच की तरह है जो खिलाड़ी को कहता है, "जब आप जीत रहे हों, तो एक नया शानदार मूव आज़माएँ! लेकिन जब आप हार रहे हों, तो उन बुनियादी बातों पर टिके रहें जो काम करती हैं।" यह संतुलन AI को एक उबाऊ लूप में फंसने या बिना किसी दिशा के भटकने से रोकता है।

संक्षेप में, यह शोध पत्र तर्क देता है कि केवल "भ्रम" को मापना ही AI को अच्छी तरह से तर्क करना सिखाने के लिए पर्याप्त नहीं है। इसके बजाय, हमें AI को उसके अपने विचारों और सही उत्तर के बीच के अंतर को दिखाना होगा। इस "कॉन्ट्रास्टिव डिसएग्रीमेंट" का उपयोग करके, AI अपनी गलतियों को बहुत अधिक सटीकता के साथ पहचानना सीखता है, जिससे अधिक स्मार्ट, अधिक विश्वसनीय और अधिक रचनात्मक समस्या-समाधान की ओर ले जाता है। लेखक दिखाते हैं कि यह दृष्टिकोण न केवल उन गणितीय समस्याओं के लिए काम करता है जिन पर इसे प्रशिक्षित किया गया था, बल्कि नई, अनदेखी चुनौतियों के लिए भी काम करता है, जो AI को अधिक स्मार्ट और अधिक मजबूत बनाने के लिए एक आशाजनक मार्ग का सुझाव देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →