RREDCoT: Segment-Level Reward Redistribution for Reasoning Models
यह शोध पत्र RREDCoT प्रस्तुत करता है, जो एक नवीन विधि है जो चेन-ऑफ-थॉट (Chain-of-Thought) ट्रेसेस के लिए इष्टतम सेगमेंट-स्तरीय रिवॉर्ड रिडिस्ट्रीब्यूशन (segment-level reward redistribution) को अनुमानित करने के लिए स्वयं रीजनिंग मॉडल का लाभ उठाता है, जिससे सुदृढीकरण शिक्षण (reinforcement learning) फाइन-ट्यूनिंग में पारंपरिक मोंटे कार्लो क्रेडिट असाइनमेंट (Monte Carlo credit assignment) की उच्च विचरणशीलता और कम्प्यूटेशनल अक्षमता का समाधान किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करके पेपर RREDCoT की व्याख्या दी गई है।
बड़ी समस्या: तर्क करने का "ब्लैक बॉक्स" (The "Black Box" of Reasoning)
कल्पना कीजिए कि आप एक छात्र को एक बहुत कठिन गणित का सवाल हल करना सिखा रहे हैं। छात्र उत्तर लिखने से पहले एक लंबी, चरण-दर-चरण विचार प्रक्रिया (एक "चेन ऑफ थॉट") लिखता है।
वर्तमान AI प्रशिक्षण विधियों में, शिक्षक केवल अंत में फीडबैक देता है।
- छात्र: 50 पेज का विचार लिखता है, पेज 10 पर एक गलती करता है, लेकिन लिखना जारी रखता है, और अंततः पेज 50 पर सही उत्तर का अनुमान लगा लेता है।
- शिक्षक: कहता है, "बहुत बढ़िया! तुमने सही उत्तर दिया।"
- परिणाम: छात्र सोचता है, "वाह, पेज 10 पर मेरी गलती वास्तव में मददगार थी!" या "मुझे नहीं पता कि मेरे 50 पेजों में से कौन सा हिस्सा वास्तव में उपयोगी था।"
इसे विलंबित पुरस्कार समस्या (delayed reward problem) कहा जाता है। क्योंकि AI को यह नहीं पता होता कि किस विशिष्ट विचार ने सफलता दिलाई, वह बहुत धीरे और अक्षम रूप से सीखता है। यह कार चलाना सीखने जैसा है जहाँ आपको केवल तब "अच्छा काम किया" या "बुरा काम किया" का संकेत मिलता है जब आप कार पार्क कर लेते हैं, बिना यह जाने कि आपने पहिया बहुत जल्दी घुमाया था या ब्रेक बहुत देर से लगाया था।
समाधान: RREDCoT (द "रिवाइंड एंड री-डिस्ट्रीब्यूट" टूल)
लेखकों ने RREDCoT (Reward REDistribution for Chain of Thoughts) नामक एक नई विधि बनाई है।
RREDCoT को एक स्मार्ट संपादक (smart editor) के रूप में सोचें जो छात्र के 50-पेज के ड्राफ्ट को देखता है। केवल अंतिम उत्तर को ग्रेड देने के बजाय, संपादक वापस जाता है और हर एक पैराग्राफ को एक "स्कोर" देता है।
- पैराग्राफ 1-5: "अच्छी शुरुआत, लेकिन महत्वपूर्ण नहीं।" (कम स्कोर)
- पैराग्राफ 10: "यह एक गलत मोड़ था, लेकिन आपने इससे सुधार किया।" (नकारात्मक स्कोर)
- पैराग्राफ 25: "यह वह मुख्य अंतर्दृष्टि (insight) थी जिसने पहेली को सुलझाया!" (उच्च स्कोर)
- पैराग्राफ 50: "सही उत्तर।" (बोनस स्कोर)
सोचने की प्रक्रिया के विशिष्ट हिस्सों को श्रेय (या दोष) देकर, AI बहुत तेज़ी से सीखता है कि कौन से विचार वास्तव में उपयोगी हैं।
यह कैसे काम करता है (बिना गणित के)
पेपर बताता है कि पिछली विधियों ने इस समस्या को दो तरीकों से हल करने की कोशिश की, जिनमें दोनों की कमियां थीं:
- "अनुमान लगाने का खेल" (Monte Carlo Sampling): AI एक ही समस्या को 100 बार उत्पन्न करता है ताकि यह देखा जा सके कि कौन से चरण आमतौर पर सफलता की ओर ले जाते हैं। यह सटीक है लेकिन इसमें बहुत समय लगता है (जैसे सबसे अच्छा रास्ता पता करने के लिए 100 बार मैराथन दौड़ना)।
- "दोष मढ़ने का खेल" (Attribution): यह अनुमान लगाने के लिए AI के आंतरिक "अटेंशन" (attention) को देखना कि क्या महत्वपूर्ण था। पेपर का तर्क है कि यह अक्सर भ्रामक होता है क्योंकि यह इस पर ध्यान देता है कि AI ने क्या देखा, न कि इस पर कि वास्तव में क्या काम आया।
RREDCoT की तरकीब:
AI को 100 बार चलाने या अंधे होकर अनुमान लगाने के बजाय, RREDCoT प्रत्येक चरण के मूल्य का अनुमान लगाने के लिए AI के अपने ज्ञान का उपयोग करता है।
- यह "रेफरेंस सॉल्यूशन" (सही पथ) को देखता है।
- यह पूछता है: "यदि मैंने यह विशिष्ट कदम उठाया होता, तो मैं सही उत्तर के कितने करीब पहुँच जाता?"
- यह एक चतुर गणितीय शॉर्टकट का उपयोग करता है (प्रेरित कि हम वाक्य में अगले शब्द की भविष्यवाणी कैसे करते हैं) ताकि बिना 100 अतिरिक्त संस्करण बनाए इसे तुरंत गणना की जा सके।
"हाइब्रिड सेगमेंटेशन" (केक काटना)
इसे काम करने के लिए, AI को यह जानने की आवश्यकता है कि एक "विचार" कहाँ समाप्त होता है और दूसरा कहाँ शुरू होता है। आप केवल हर एक अक्षर (टोकन) को नहीं देख सकते क्योंकि वह बहुत अधिक डेटा है।
- पेपर का विचार: वे एक "हाइब्रिड सेगमेंटेशन" रणनीति का उपयोग करते हैं। कल्पना कीजिए कि एक लंबे केक को काट रहे हैं।
- पहले, वे स्पष्ट स्थानों पर काटते हैं (जैसे नए पैराग्राफ या "Wait" या "Therefore" जैसे कीवर्ड)।
- फिर, वे टेक्स्ट के "भ्रम" (entropy) को देखते हैं। यदि AI अगले शब्द के बारे में बहुत अनिश्चित था, तो यह केक काटने के लिए एक अच्छी जगह है।
- यह सोचने के तार्किक "चंक्स" (chunks) बनाता है जिन्हें ग्रेड करना आसान होता है।
उन्होंने क्या पाया (परिणाम)
शोधकर्ताओं ने गणित की समस्याओं (जैसे AIME और MATH डेटासेट) पर इसका परीक्षण किया।
- तेज़ सीखना: RREDCoT का उपयोग करने वाले मॉडल मानक विधि (GRPO) का उपयोग करने वाले मॉडलों की तुलना में समस्याओं को बेहतर और तेज़ी से हल करना सीख गए।
- बेहतर दक्षता: उन्हें बहुत लंबे चेन ऑफ थॉट (25,000 टोकन तक) के साथ भी बेहतर परिणाम मिले।
- कोई अतिरिक्त मॉडल नहीं चाहिए: अन्य विधियों के विपरीत जिनके लिए काम को ग्रेड करने के लिए दूसरे "जज" AI की आवश्यकता होती है, RREDCoT मुख्य AI का उपयोग स्वयं ग्रेडिंग करने के लिए करता है, जिससे समय और संसाधनों की बचत होती है।
कमी (सीमाएं)
पेपर ईमानदार है कि यह विधि कहाँ संघर्ष कर सकती है:
- आपको उत्तर कुंजी (Answer Key) की आवश्यकता है: RREDCoT तब सबसे अच्छा काम करता है जब आपके पास पहले से ही सही समाधान पथ (या कम से कम एक अच्छा संकेत) हो। यदि आप ऐसी समस्या को हल करने की कोशिश कर रहे हैं जहाँ समाधान अज्ञात है या "सही तरीका" अस्पष्ट है, तो यह विधि अधिक मदद नहीं कर सकती।
- इसमें थोड़ी अधिक लागत आती है: इसके लिए मानक विधि की तुलना में लगभग 1.5 से 2 गुना अधिक कंप्यूटर पावर की आवश्यकता होती है, लेकिन लेखक कहते हैं कि यह इसके द्वारा प्रदान की जाने वाली सीखने की गति के लिए एक उचित सौदा है।
सारांश
RREDCoT बेहतर सोचने के लिए AI को प्रशिक्षित करने का एक नया तरीका है। अंत तक प्रतीक्षा करके "अच्छा काम किया" कहने के बजाय, यह सोचने की प्रक्रिया को छोटे टुकड़ों में तोड़ देता है और AI को ठीक से बताता है कि कौन से विचार सहायक थे और कौन से भटकाव थे। यह इसे तेज़ी से और कुशलता से करता है, जिससे AI पहले की तुलना में बहुत तेज़ी से जटिल तर्क कौशल सीख सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।