Verifier-Free RL for LLMs via Intrinsic Gradient-Norm Reward
यह शोधपत्र VIGOR को प्रस्तुत करता है, जो एक वर्िफायर-मुक्त (verifier-free) सुदृढीकरण लर्निंग (reinforcement learning) विधि है जो बाहरी वर्िफायर या गोल्ड लेबल पर निर्भर हुए बिना गणितीय तर्क और कोड जनरेशन में LLM के प्रदर्शन को प्रभावी ढंग से सुधारने के लिए स्वयं पॉलिसी मॉडल से प्राप्त आंतरिक ग्रेडिएंट-नॉर्म रिवार्ड्स का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन अनुभवहीन छात्र (AI) को जटिल पहेलियाँ, जैसे गणित के सवाल या कंप्यूटर कोड लिखना, सिखा रहे हैं।
आमतौर पर, इस छात्र को सिखाने के लिए, आपको एक सख्त शिक्षक (एक "वेरिफायर") की आवश्यकता होती है जो हर उत्तर की जाँच करता है। यदि उत्तर सही है, तो छात्र को एक गोल्ड स्टार मिलता है। यदि वह गलत है, तो उसे एक लाल 'X' मिलता है। यह गणित और कोडिंग के लिए बहुत अच्छा काम करता है क्योंकि वहाँ स्पष्ट सही और गलत उत्तर होते हैं।
समस्या:
क्या होता है जब आप चाहते हैं कि छात्र एक कविता लिखे, सलाह दे, या ऐसी समस्या को हल करे जहाँ कोई एक एकल "सही" उत्तर नहीं होता? आप हर कार्य के लिए एक सख्त शिक्षक को काम पर नहीं रख सकते क्योंकि आपके पास उत्तर पहले से मौजूद नहीं होते। बिना शिक्षक के, छात्र को यह पता नहीं चलेगा कि वह अच्छा काम कर रहा है या नहीं, और वह बस बेतरतीब ढंग से अनुमान लगाने लगेगा या अटक जाएगा।
समाधान: VIGOR ("स्व-अनुभूति" वाला पुरस्कार)
यह शोध पत्र एक नई विधि पेश करता है जिसे VIGOR कहा जाता है। एक बाहरी शिक्षक द्वारा काम को ग्रेड देने का इंतज़ार करने के बजाय, VIGOR छात्र से यह पूछता है कि उनका उत्तर कितना "सुचारू" (smooth) महसूस होता है, यानी उनके अपने आंतरिक भावों को सुनने के लिए कहता है।
यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:
1. "खड़ी ढलान" बनाम "सपाट घाटी"
कल्पना कीजिए कि छात्र का मस्तिष्क पहाड़ियों और घाटियों का एक परिदृश्य है।
- एक बुरा उत्तर एक खड़ी, पथरीली चट्टान पर खड़े होने जैसा है। यदि छात्र अपनी सोच में थोड़ा सा भी बदलाव करने की कोशिश करता है, तो वह हिंसक रूप से नीचे फिसल जाएगा। गणितीय शब्दों में, यह एक "लार्ज ग्रेडिएंट" (एक बड़ा, अस्थिर परिवर्तन) है।
- एक अच्छा उत्तर एक सपाट, शांत घाटी में खड़े होने जैसा है। यदि छात्र अपनी सोच में थोड़ा बदलाव करता है, तो वह वहीं बना रहता है। यह एक "स्मॉल ग्रेडिएंट" (एक सुचारू, स्थिर परिवर्तन) है।
VIGOR का नियम: AI को उन उत्तरों को पसंद करने के लिए कहा जाता है जो सपाट घाटी (छोटे ग्रेडिएंट) जैसा महसूस होते हैं, न कि खड़ी ढलान (बड़े ग्रेडिएंट) जैसा। तर्क यह है: "यदि मेरा उत्तर स्थिर महसूस होता है और इसे समझने के लिए किसी बड़े मानसिक झटके की आवश्यकता नहीं है, तो यह संभवतः एक अच्छा उत्तर है।"
2. "लंबाई का जाल" (क्यों एक सुधार की आवश्यकता थी)
शोधकर्ताओं ने एक चालाकी भरी तरकीब देखी। यदि छात्र केवल एक बहुत लंबा उत्तर लिखता है, तो लंबी दूरी पर ढलान फैल जाने के कारण "खड़ी ढलान" स्वाभाविक रूप से छोटी दिखने लगती है। छात्र उच्च स्कोर प्राप्त करने के लिए बहुत लंबे, निरर्थक निबंध लिखकर "बेईमानी" करने की कोशिश कर सकता है।
सुधार ( सुधार):
शोध पत्र एक सरल गणितीय "रूलर" (पैमाना) जोड़ता है। यह कहता है, "हम ढलान को मापेंगे, लेकिन हम स्कोर को इस आधार पर समायोजित करेंगे कि उत्तर कितना लंबा है।" यह छात्र को अधिक शब्द लिखकर बेईमानी करने से रोकता है। यह सुनिश्चित करता है कि स्कोर केवल टेक्स्ट की लंबाई को नहीं, बल्कि सोचने की गुणवत्ता को दर्शाता है।
3. "कक्षा का मतदान" (रैंकिंग)
कभी-कभी, स्थिरता का "एहसास" अलग-अलग सवालों के बीच बहुत भिन्न होता है। एक सवाल बहुत स्थिर महसूस हो सकता है, जबकि दूसरा बहुत अस्थिर, जिससे उनकी सीधे तुलना करना कठिन हो जाता है।
सुधार (रैंकिंग):
एक कच्चा स्कोर देने के बजाय, VIGOR AI को एक ही प्रश्न के लिए कुछ अलग-अलग उत्तर उत्पन्न करने के लिए कहता है, और फिर उन्हें एक-दूसरे के विरुद्ध रैंक (क्रमबद्ध) करता है।
- "इन 8 उत्तरों में से कौन सा सबसे अधिक स्थिर महसूस होता है?" -> उसे उच्चतम पुरस्कार मिलता है।
- "कौन सा सबसे अधिक अस्थिर महसूस होता है?" -> उसे निम्नतम पुरस्कार मिलता है।
यह प्रशिक्षण को निष्पक्ष और स्थिर रखता है, चाहे विशिष्ट प्रश्न कितना भी कठिन क्यों न हो।
जब उन्होंने इसे आजमाया तो क्या हुआ?
शोधकर्ताओं ने इसका परीक्षण Qwen2.5, जो एक लोकप्रिय AI मॉडल है, पर किया।
- गणित और कोडिंग: उन्होंने इस "स्व-एहसास" वाले पुरस्कार (बिना किसी उत्तर कुंजी के) का उपयोग करके गणित के सवालों पर AI को प्रशिक्षित किया। AI गणित में काफी बेहतर हो गया।
- क्रॉस-ट्रेनिंग: आश्चर्यजनक रूप से, जब उन्होंने इस विधि का उपयोग करके AI को केवल गणित पर प्रशिक्षित किया, तो वह कोडिंग में भी बेहतर हो गया, भले ही उसने प्रशिक्षण के दौरान कोडिंग का एक भी सवाल नहीं देखा था।
- स्थिरता: अन्य विधियाँ जो "आत्मविश्वास" का अनुमान लगाने की कोशिश करती हैं, अक्सर AI को पागल कर देती हैं और कुछ समय बाद उसे खुद को दोहराने या बकवास लिखने पर मजबूर कर देती हैं। VIGO ने प्रशिक्षण को सुचारू और स्थिर रखा, एक उग्र तूफान के बजाय एक शांत नदी की तरह।
सारांश में
VIGOR एक ऐसा तरीका है जिससे बिना शिक्षक के AI को सिखाया जा सकता है। यह AI को बताता है: "केवल अनुमान न लगाएं; उस उत्तर को खोजें जो आपके अपने मन में सबसे अधिक स्थिर और सुचारू महसूस होता है।" कुछ तकनीकी खामियों (जैसे लंबाई की ट्रिक) को ठीक करके, उन्होंने इस "स्व-जाँच" को इतना शक्तिशाली बना दिया कि यह एक बुनियादी AI को एक बहुत अधिक स्मार्ट तर्क करने वाले (reasoner) में बदल देता है, और वह भी बिना पहले से सही उत्तर जाने।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।