Future-KL Regularized GRPO: Process-Level Credit Assignment from -Divergence Regularization
यह शोध पत्र फ्यूचर-केएल रेगुलराइज्ड पॉलिसी ऑप्टिमाइज़ेशन (FRPO) को प्रस्तुत करता है, जो एक क्रिटिक-फ्री विधि है जो -डाइवर्जेंस से व्युत्पन्न एक कॉज़ल फ्यूचर-रेगुलराइजेशन रिटर्न-टू-गो को शामिल करके GRPO के टोकन-लेवल KL रेगुलराइजेशन को ठीक करती है, जिससे उच्च एंट्रॉपी और कम पॉलिसी ड्रिफ्ट बनाए रखते हुए गणितीय तर्क प्रदर्शन में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य विचार: एक रोबोट को सोचना सिखाना
कल्पना कीजिए कि आप एक रोबोट (एक AI) को गणित के सवाल हल करना सिखा रहे हैं। आप उसे एक समस्या देते हैं, और वह एक लंबा, चरण-दर-चरण समाधान लिखने की कोशिश करता है। यह सुनिश्चित करने के लिए कि वह केवल अंदाज़ा न लगाए या पटरी से न उतर जाए, आप उसके काम की जाँच करने के लिए एक "शिक्षक" (एक संदर्भ मॉडल) का उपयोग करते हैं।
यह पेपर एक विशिष्ट प्रशिक्षण पद्धति पर केंद्रित है जिसे GRPO (ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन) कहा जाता है। GRPO को एक क्लासरूम सेटिंग के रूप में समझें:
- रोबोट एक ही गणित के सवाल के कई उत्तर बनाता है (एक "ग्रुप")।
- एक सत्यापनकर्ता (verifier) उनकी जाँच करता है: "क्या आपने सही अंतिम संख्या प्राप्त की?" (हाँ/नहीं)।
- रोबोट अपने सहपाठियों के उत्तरों के साथ तुलना करके सीखता है। यदि कोई उत्तर दूसरों की तुलना में बेहतर है, तो रोबोट को "हाई फाइव" (पुरस्कार/रिवॉर्ड) मिलता है। यदि यह खराब है, तो उसे "थम्स डाउन" मिलता है।
समस्या: "लोकल" दंड बनाम "फ्यूचर" लागत
मानक प्रशिक्षण में, एक नियम होता है जो रोबोट को उसका व्यक्तित्व बहुत अधिक बदलने से रोकता है। इसे KL रेगुलराइजेशन कहा जाता है। यह एक "अपनी लेन में बने रहने" के नियम जैसा है। यदि रोबोट मूल शिक्षक से बहुत अलग चीजें लिखना शुरू कर देता है, तो उसे दंडित किया जाता है।
पुराना तरीका (गलती):
वर्तमान में, अधिकांश सिस्टम इस दंड को टोकन-दर-टोकन (शब्द-दर-शब्द) लागू करते हैं, जो वाक्य के अंत में एक साधारण "जुर्माने" की तरह होता है।
- उपमा: कल्पना कीजिए कि एक ड्राइवर लंबी सड़क यात्रा पर जा रहा है। पुराना सिस्टम केवल तभी जाँच करता है जब ड्राइवर ठीक उस क्षण से गुजरता है जब वह पुलिस कार के पास होता है। यह इस तथ्य को अनदेखा कर देता है कि यदि ड्राइवर ने 10 मील पहले गलत मोड़ लिया था, तो वह अब अपने रास्ते से 10 मील भटक चुका है। सिस्टम हर मील को एक अलग घटना के रूप में मानता है।
पेपर का अंतर्दृष्टि (Insight):
लेखकों ने महसूस किया कि तर्क की एक लंबी श्रृंखला (जैसे गणित के प्रमाण) में, आप जो भी शब्द लिखते हैं, वह उसके बाद आने वाले सभी शब्दों के मार्ग को बदल देता है।
- द "फ्यूचर" कॉस्ट: यदि रोबोट वाक्य की शुरुआत में थोड़ा सा भी भटक जाता है, तो यह भविष्य के सभी शब्दों को अर्थपूर्ण बनाने के लिए भी भटकने के लिए मजबूर करता है। उस शुरुआती गलती की "लागत" केवल वह गलती नहीं है; बल्कि उन सभी भविष्य के शब्दों की संचित लागत है जिन्हें उस गलत रास्ते पर चलना होगा।
- लुप्त संकेत (Missing Signal): पुराना सिस्टम इस "भविष्य की लागत" को अनदेखा करता है। यह केवल वर्तमान शब्द को दंडित करता है, उस लहर (ripple effect) को नहीं जो यह पैदा करता है।
जटिलता: आप उन्हें मिला क्यों नहीं सकते
पेपर यह भी बताता है कि GRPO कैसे काम करता है, उसमें एक पेचीदा गणितीय समस्या है।
- गैर-रेखीय स्कोर (Non-Linear Score): GRPO केवल कच्चे स्कोर (0 या 1) को नहीं देखता है। यह समूह के भीतर स्कोर को सामान्य (normalize) करता है (जैसे कक्षा में छात्रों की रैंकिंग करना)। यह स्कोर और रिवॉर्ड के बीच एक अजीब, घुमावदार संबंध बनाता है।
- टकराव (The Collision): यदि आप "अपनी लेन में रहने" के दंड को रैंकिंग करने से पहले सीधे स्कोर में मिलाने की कोशिश करते हैं, तो आप गणित को बिगाड़ देते हैं। यह एक छात्र के ग्रेड में "देरी के दंड" को जोड़ने जैसा है, इससे पहले कि कक्षा की रैंक निर्धारित की जाए। यह रैंकिंग प्रणाली को विकृत करता है और सीखने के संकेत को खराब कर देता है।
समाधान: FRPO (फ्यूचर-केएल रेगुलराइज्ड पॉलिसी ऑप्टिमाइज़ेशन)
लेखक एक नई विधि प्रस्तावित करते हैं जिसे FRPO कहा जाता है। यह चरण-दर-चरण इस प्रकार काम करती है:
- चरण 1: उत्तरों की रैंकिंग (The Advantage)। पहले, केवल अंतिम गणितीय उत्तर के आधार पर रिवॉर्ड की गणना करें। समूह के उत्तरों को रैंक करें ताकि यह देखा जा सके कि कौन से अच्छे थे और कौन से बुरे। यह "ग्रुप एडवांटेज" है।
- चरण 2: भविष्य का दंड जोड़ना (The Correction)। रैंकिंग होने के बाद, जीतने वाले और हारने वाले उत्तरों के प्रत्येक शब्द को देखें।
- प्रत्येक शब्द के लिए, न केवल अपना स्वयं का दंड, बल्कि उसके बाद आने वाले सभी शब्दों के दंड का योग भी ज्ञात करें।
- उपमा: कल्पना कीजिए कि एक रिले रेस चल रही है। पुराना सिस्टम केवल उस धावक को दंडित करता है जिसने बैटन गिराया। नया सिस्टम उस धावक को दंडित करता है जिसने बैटन गिराया साथ ही इस तथ्य के लिए भी कि अगले तीन धावकों को अब पकड़ बनाने के लिए धीमा दौड़ना पड़ेगा। यह श्रेय (या दोष) उस संपूर्ण भविष्य की यात्रा के आधार पर देता है जो वर्तमान शब्द द्वारा शुरू की गई है।
- चरण 3: अपडेट। रोबोट के मस्तिष्क को अपडेट करने के लिए "ग्रुप रैंक" को इस नए "फ्यूचर पेनल्टी" के साथ जोड़ें।
यह क्यों मायने रखता है (परिणाम)
पेपर का परीक्षण कठिन गणितीय समस्याओं (जैसे हाई स्कूल प्रतियोगिताओं में पाई जाने वाली) को हल करने वाले बड़े भाषा मॉडलों पर किया गया।
- बेहतर स्कोर: नई विधि (FRPO) ने पुराने तरीकों की तुलना में अधिक समस्याओं को सही ढंग से हल किया।
- कम विचलन (Less Drift): रोबोट अपने मूल "शिक्षक" व्यक्तित्व के करीब रहा। वह पागल नहीं हुआ या उच्च स्कोर पाने के लिए बेतुकी बातें (hallucinations) करने नहीं लगा।
- अधिक रचनात्मकता: रोबोट ने अपने सोचने के स्तर में एक स्वस्थ "एन्ट्रॉपी" (विविधता) बनाए रखी। वह एक उबाऊ, दोहराव वाला रोबोट नहीं बना, लेकिन वह पटरी से भी नहीं उतरा।
सारांश
पेपर का तर्क है कि AI को तर्क करने के लिए प्रशिक्षित करते समय, आप इसे केवल उस शब्द के लिए दंडित नहीं कर सकते जो यह अभी कह रहा है। आपको इसे उस भविष्य के मार्ग के लिए दंडित करना होगा जो वह शब्द बनाता है। प्रशिक्षण प्रक्रिया में इस "फ्यूचर कॉस्ट" गणना को जोड़कर, AI अधिक सुसंगत रूप से सोचना सीखता है, कठिन समस्याओं को हल करता है, और बिना किसी जटिल "क्रिटिक" मॉडल की निगरानी के स्थिर रहता है।
संक्षेप में: ड्राइवर को अभी तेज गाड़ी चलाने के लिए दंडित न करें; बल्कि उस गलत मोड़ के लिए दंडित करें जो उसने 10 मील पहले लिया था, जिसके कारण उसे वापस ट्रैक पर आने के लिए तेज गाड़ी चलानी पड़ी। यही "फ्यूचर-केएल" अंतर्दृष्टि है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।