CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization
यह शोध पत्र कॉन्ट्रास्टिविव एविडेंस पॉलिसी ऑप्टिमाइज़ेशन (CEPO) को प्रस्तुत करता है, जो एक नवीन RLVR सेल्फ-डिस्टिलेशन विधि है जो एक कॉन्ट्रास्टिव रिवॉर्ड सिग्नल उत्पन्न करने के लिए सही और अस्वीकृत दोनों रोलआउट्स का लाभ उठाती है, जिससे सूचना रिसाव (information leakage) से बचते हुए निर्णायक रीजनिंग स्टेप्स की सटीक पहचान की जाती है और मल्टीमॉडल गणितीय तर्क बेंचमार्क पर GRPO जैसे मौजूदा बेसलाइन्स से बेहतर प्रदर्शन किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल गणित की समस्या हल करना सिखा रहे हैं। आप रोबोट को इसे हल करने का मौका देते हैं, और जब वह सही उत्तर देता है, तो आप उसे एक गोल्ड स्टार (स्वर्ण सितारा) देते हैं। जब वह गलत होता है, तो आप उसे "फिर से प्रयास करें" का संकेत देते हैं।
AI प्रशिक्षण का यह तरीका (जिसे RLVR कहा जाता है) वर्तमान में इसी तरह काम करता है। लेकिन इस दृष्टिकोण के साथ एक बड़ी समस्या है: रोबोट को उसके द्वारा लिखे गए हर एक शब्द के लिए एक ही गोल्ड स्टार मिलता है, भले ही कुछ शब्द शानदार अंतर्दृष्टि वाले हों और कुछ केवल "um," "so," या "therefore" जैसे हों।
यह वैसा ही है जैसे कोई शिक्षक किसी छात्र को पूरे निबंध के लिए 'A+' दे दे, भले ही छात्र ने केवल एक बेहतरीन वाक्य लिखा हो और बाकी सब केवल अनावश्यक शब्द (filler) हों। रोबोट को यह पता नहीं चलेगा कि वास्तव में किन विशिष्ट शब्दों ने समस्या को हल किया, इसलिए वह धीरे-धीरे सीखता है और भ्रमित हो जाता है।
पुराना समाधान (और क्यों यह विफल रहा)
वैज्ञानिकों ने इसे ठीक करने के लिए यह कहा, "ठीक है, चलिए रोबोट को लिखने से पहले ही सही उत्तर बता देते हैं, और देखते हैं कि वह क्या अलग लिखता।"
हालाँकि, इसने एक नई समस्या पैदा की जिसे "सूचना रिसाव" (Information Leakage) कहा जाता है।
- उपमा: कल्पना कीजिए कि एक छात्र परीक्षा में नकल कर रहा है। यदि आप छात्र को लिखते समय ही उत्तर कुंजी (answer key) बता देते हैं, तो वह उत्तर कुंजी सीखने के बजाय उसे केवल रटने लगेगा। वह ऐसी चीजें लिखने लगता है जो उत्तर कुंजी जैसी दिखती हैं लेकिन वास्तव में उनका कोई अर्थ नहीं होता। शोध पत्र में पाया गया कि पिछले तरीकों ने बिल्कुल यही किया: AI ने तर्क सीखने के बजाय उत्तर को रटने के लिए "नकल" करना शुरू कर दिया।
नया समाधान: CEPO
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे CEPO (कॉन्ट्रास्टिव एविडेंस पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। यह कैसे काम करता है, इसके लिए एक सरल उपमा यहाँ दी गई है:
"गुड कॉप, बैड कॉप" इंटरव्यू
रोबोट से केवल यह पूछने के बजाय कि "क्या आपको सही उत्तर मिला?", CEPO एक अधिक सटीक प्रश्न पूछता है: "क्या इस विशिष्ट शब्द ने आपको सही उत्तर पाने में मदद की, और क्या इसने आपके गलत उत्तर पाने की संभावना को कम किया?"
- अच्छा शिक्षक (सही उत्तर): AI सही समाधान को देखता है और पूछता है, "यदि मुझे पता होता कि उत्तर सही है, तो क्या मैं यह शब्द लिखता?"
- बुरा शिक्षक (गलत उत्तर): AI एक असफल प्रयास (एक ऐसा प्रयास जो उसने पहले किया था और गलत रहा) को देखता है और पूछता है, "यदि मैं गलत उत्तर पाने की कोशिश कर रहा होता, तो क्या मैं यह शब्द लिखता?"
जादुय तुलना:
- "फिलर" शब्द: यदि शब्द केवल "therefore" या "the" है, तो दोनों शिक्षक (अच्छा और बुरा) इसे वैसे ही लिखते। चूंकि दोनों सहमत हैं, इसलिए उस शब्द को एक तटस्थ स्कोर (neutral score) मिलता है। उसे कोई अतिरिक्त श्रेय नहीं मिलता।
- "निर्णायक" शब्द: यदि शब्द गणित का एक महत्वपूर्ण चरण है (जैसे "2 से विभाजित करें"), तो अच्छा शिक्षक कहता है, "हाँ, मुझे इसकी आवश्यकता है!" लेकिन बुरा शिक्षक कहता, "नहीं, मैं यह नहीं करता!" क्योंकि वे असहमत हैं, AI समझ जाता है: "आहा! यह शब्द समाधान की कुंजी है!" उसे बहुत अधिक श्रेय मिलता है।
यह बेहतर क्यों है?
- कोई नकल नहीं: क्योंकि AI एक ही बैच के प्रयासों में से "सही" पथ की तुलना "गलत" पथ से करता है, इसलिए यह प्रशिक्षण प्रक्रिया में उत्तर को लीक नहीं करता है। यह सुरक्षित रहता है और वास्तविक तर्क सीखता है।
- सटीकता: यह रोबोट को "the" या "and" लिखने के लिए प्रशंसा करने में समय बर्बाद करना बंद कर देता है। यह अपना पूरा ध्यान उन विशिष्ट चरणों पर केंद्रित करता है जिन्होंने वास्तव में पहेली को हल किया।
परिणाम
पत्रकारों ने ज्यामिति (geometry) और तर्क (logic) से जुड़ी गणित की समस्याओं का उपयोग करके दो आकार के AI मॉडल (2 बिलियन और 4 बिलियन पैरामीटर) पर इसका परीक्षण किया।
- विजेता: CEPO ने लगातार पिछले सर्वोत्तम तरीकों को पछाड़ दिया।
- हारने वाले: पुराने तरीके जो उत्तर लीक करके "नकल" करने की कोशिश करते थे (जिन्हें OPSD और SDIO कहा जाता है), वे वास्तव में बिना प्रशिक्षित रोबोट से भी खराब प्रदर्शन करते थे। इसने सिद्ध किया कि लेखकों का सिद्धांत सही था: यदि आप AI को उत्तर रटने से नहीं रोकते हैं, तो वह और भी मूर्ख हो जाता है।
सारांश
CEPO को एक स्मार्ट स्पॉटलाइट के रूप में समझें। पूरे मंच (पूरे वाक्य) पर तेज रोशनी डालने के बजाय, यह केवल उस अभिनेता पर ज़ूम करता है जो वास्तव में पंचलाइन बोल रहा है। यह बैकग्राउंड शोर और अनावश्यक शब्दों को अनदेखा करता है, जिससे यह सुनिश्चित होता है कि AI ठीक वही सीखे कि समाधान ने वास्तव में कैसे काम किया, बिना गलती से उत्तर कुंजी को रटे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।