← नवीनतम पेपर
💬 NLP

CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization

यह शोध पत्र कॉन्ट्रास्टिविव एविडेंस पॉलिसी ऑप्टिमाइज़ेशन (CEPO) को प्रस्तुत करता है, जो एक नवीन RLVR सेल्फ-डिस्टिलेशन विधि है जो एक कॉन्ट्रास्टिव रिवॉर्ड सिग्नल उत्पन्न करने के लिए सही और अस्वीकृत दोनों रोलआउट्स का लाभ उठाती है, जिससे सूचना रिसाव (information leakage) से बचते हुए निर्णायक रीजनिंग स्टेप्स की सटीक पहचान की जाती है और मल्टीमॉडल गणितीय तर्क बेंचमार्क पर GRPO जैसे मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जाता है।

मूल लेखक: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

प्रकाशित 2026-05-20
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ahmed Heakl, Abdelrahman M. Shaker, Youssef Mohamed, Rania Elbadry, Omar Fetouh, Fahad Shahbaz Khan, Salman Khan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल गणित की समस्या हल करना सिखा रहे हैं। आप रोबोट को इसे हल करने का मौका देते हैं, और जब वह सही उत्तर देता है, तो आप उसे एक गोल्ड स्टार (स्वर्ण सितारा) देते हैं। जब वह गलत होता है, तो आप उसे "फिर से प्रयास करें" का संकेत देते हैं।

AI प्रशिक्षण का यह तरीका (जिसे RLVR कहा जाता है) वर्तमान में इसी तरह काम करता है। लेकिन इस दृष्टिकोण के साथ एक बड़ी समस्या है: रोबोट को उसके द्वारा लिखे गए हर एक शब्द के लिए एक ही गोल्ड स्टार मिलता है, भले ही कुछ शब्द शानदार अंतर्दृष्टि वाले हों और कुछ केवल "um," "so," या "therefore" जैसे हों।

यह वैसा ही है जैसे कोई शिक्षक किसी छात्र को पूरे निबंध के लिए 'A+' दे दे, भले ही छात्र ने केवल एक बेहतरीन वाक्य लिखा हो और बाकी सब केवल अनावश्यक शब्द (filler) हों। रोबोट को यह पता नहीं चलेगा कि वास्तव में किन विशिष्ट शब्दों ने समस्या को हल किया, इसलिए वह धीरे-धीरे सीखता है और भ्रमित हो जाता है।

पुराना समाधान (और क्यों यह विफल रहा)

वैज्ञानिकों ने इसे ठीक करने के लिए यह कहा, "ठीक है, चलिए रोबोट को लिखने से पहले ही सही उत्तर बता देते हैं, और देखते हैं कि वह क्या अलग लिखता।"

हालाँकि, इसने एक नई समस्या पैदा की जिसे "सूचना रिसाव" (Information Leakage) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक छात्र परीक्षा में नकल कर रहा है। यदि आप छात्र को लिखते समय ही उत्तर कुंजी (answer key) बता देते हैं, तो वह उत्तर कुंजी सीखने के बजाय उसे केवल रटने लगेगा। वह ऐसी चीजें लिखने लगता है जो उत्तर कुंजी जैसी दिखती हैं लेकिन वास्तव में उनका कोई अर्थ नहीं होता। शोध पत्र में पाया गया कि पिछले तरीकों ने बिल्कुल यही किया: AI ने तर्क सीखने के बजाय उत्तर को रटने के लिए "नकल" करना शुरू कर दिया।

नया समाधान: CEPO

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे CEPO (कॉन्ट्रास्टिव एविडेंस पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:

"गुड कॉप, बैड कॉप" इंटरव्यू
रोबोट से केवल यह पूछने के बजाय कि "क्या आपको सही उत्तर मिला?", CEPO एक अधिक सटीक प्रश्न पूछता है: "क्या इस विशिष्ट शब्द ने आपको सही उत्तर पाने में मदद की, और क्या इसने आपके गलत उत्तर पाने की संभावना को कम किया?"

  1. अच्छा शिक्षक (सही उत्तर): AI सही समाधान को देखता है और पूछता है, "यदि मुझे पता होता कि उत्तर सही है, तो क्या मैं यह शब्द लिखता?"
  2. बुरा शिक्षक (गलत उत्तर): AI एक असफल प्रयास (एक ऐसा प्रयास जो उसने पहले किया था और गलत रहा) को देखता है और पूछता है, "यदि मैं गलत उत्तर पाने की कोशिश कर रहा होता, तो क्या मैं यह शब्द लिखता?"

जादुय तुलना:

  • "फिलर" शब्द: यदि शब्द केवल "therefore" या "the" है, तो दोनों शिक्षक (अच्छा और बुरा) इसे वैसे ही लिखते। चूंकि दोनों सहमत हैं, इसलिए उस शब्द को एक तटस्थ स्कोर (neutral score) मिलता है। उसे कोई अतिरिक्त श्रेय नहीं मिलता।
  • "निर्णायक" शब्द: यदि शब्द गणित का एक महत्वपूर्ण चरण है (जैसे "2 से विभाजित करें"), तो अच्छा शिक्षक कहता है, "हाँ, मुझे इसकी आवश्यकता है!" लेकिन बुरा शिक्षक कहता, "नहीं, मैं यह नहीं करता!" क्योंकि वे असहमत हैं, AI समझ जाता है: "आहा! यह शब्द समाधान की कुंजी है!" उसे बहुत अधिक श्रेय मिलता है।

यह बेहतर क्यों है?

  • कोई नकल नहीं: क्योंकि AI एक ही बैच के प्रयासों में से "सही" पथ की तुलना "गलत" पथ से करता है, इसलिए यह प्रशिक्षण प्रक्रिया में उत्तर को लीक नहीं करता है। यह सुरक्षित रहता है और वास्तविक तर्क सीखता है।
  • सटीकता: यह रोबोट को "the" या "and" लिखने के लिए प्रशंसा करने में समय बर्बाद करना बंद कर देता है। यह अपना पूरा ध्यान उन विशिष्ट चरणों पर केंद्रित करता है जिन्होंने वास्तव में पहेली को हल किया।

परिणाम

पत्रकारों ने ज्यामिति (geometry) और तर्क (logic) से जुड़ी गणित की समस्याओं का उपयोग करके दो आकार के AI मॉडल (2 बिलियन और 4 बिलियन पैरामीटर) पर इसका परीक्षण किया।

  • विजेता: CEPO ने लगातार पिछले सर्वोत्तम तरीकों को पछाड़ दिया।
  • हारने वाले: पुराने तरीके जो उत्तर लीक करके "नकल" करने की कोशिश करते थे (जिन्हें OPSD और SDIO कहा जाता है), वे वास्तव में बिना प्रशिक्षित रोबोट से भी खराब प्रदर्शन करते थे। इसने सिद्ध किया कि लेखकों का सिद्धांत सही था: यदि आप AI को उत्तर रटने से नहीं रोकते हैं, तो वह और भी मूर्ख हो जाता है।

सारांश

CEPO को एक स्मार्ट स्पॉटलाइट के रूप में समझें। पूरे मंच (पूरे वाक्य) पर तेज रोशनी डालने के बजाय, यह केवल उस अभिनेता पर ज़ूम करता है जो वास्तव में पंचलाइन बोल रहा है। यह बैकग्राउंड शोर और अनावश्यक शब्दों को अनदेखा करता है, जिससे यह सुनिश्चित होता है कि AI ठीक वही सीखे कि समाधान ने वास्तव में कैसे काम किया, बिना गलती से उत्तर कुंजी को रटे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →