Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards
यह शोधपत्र Soft-SVeRL प्रस्तुत करता है, जो एक स्व-सत्यापित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो आंशिक रूप से सत्यापन योग्य कार्यों में निर्देश-अनुपालन में सुधार के लिए विघटित, चेकलिस्ट-आधारित सॉफ्ट रिवॉर्ड्स का उपयोग करता है, और साथ ही स्पष्ट स्थिरीकरण तंत्रों के माध्यम से सत्यापनकर्ता शोर (verifier noise) और रिवॉर्ड मुद्रास्फीति के बीच महत्वपूर्ण ट्रेड-ऑफ को संबोधित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट शेफ को एक जटिल रेसिपी का पालन करना सिखा रहे हैं। पुराने दिनों में, यदि रोबोट ने एक ऐसा व्यंजन बनाया जो थोड़ा नमकीन था लेकिन बाकी सब कुछ एकदम सही था, तो आपको कहना पड़ सकता था, "Fail" (असफल), क्योंकि वह बिल्कुल सही नहीं था। यह एक "पास/फेल" टेस्ट की तरह है। लेकिन क्या होगा अगर रोबोट ने 5 में से 4 स्टेप्स सही किए? एक साधारण "Fail" उसे यह नहीं सिखा पाएगा कि उसे कौन सा स्टेप ठीक करने की जरूरत है।
यह पेपर AI मॉडल्स को सिखाने का एक नया तरीका पेश करता है जिसे Soft-RLVR और Soft-SVeRL कहा जाता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:
1. समस्या: "सब-या-कुछ-नहीं" का जाल (The "All-or-Nothing" Trap)
कल्पना कीजिए कि आपने एक छात्र को एक पैराग्राफ लिखने के लिए कहा है जिसमें ये शर्तें होनी चाहिए:
- यह ठीक 5 वाक्यों का होना चाहिए।
- इसमें "apple" शब्द शामिल होना चाहिए।
- इसमें "orange" शब्द का उपयोग नहीं होना चाहिए।
- यह एक बड़े अक्षर (Capital letter) से शुरू होना चाहिए।
- यह एक पूर्ण विराम (Period) के साथ समाप्त होना चाहिए।
यदि छात्र एक सुंदर पैराग्राफ लिखता है लेकिन "apple" शब्द लिखना भूल जाता है, तो एक पारंपरिक "हार्ड" रिवॉर्ड सिस्टम कहता है: 0 अंक। छात्र को अन्य 4 चीजों के लिए कोई फीडबैक नहीं मिलता जो उसने सही की थीं। उसे यह नहीं पता चलेगा कि अगली बार उसे शब्द संख्या पर ध्यान देना है या विराम चिह्नों पर।
2. समाधान: "चेकलिस्ट" (Soft-RLVR)
लेखक उस एकल "Pass/Fail" ग्रेड को एक चेकलिस्ट में तोड़ने का प्रस्ताव देते हैं।
एक बड़े ग्रेड के बजाय, AI को सूची की हर एक चीज़ के लिए एक स्कोर मिलता है।
- क्या आपने 5 वाक्य लिखे? हाँ (+1 अंक)
- क्या आपने "apple" का उपयोग किया? नहीं (0 अंक)
- क्या आपने "orange" का उपयोग नहीं किया? हाँ (+1 अंक)
- ...और इसी तरह।
AI को एक आंशिक स्कोर (जैसे, 5 में से 4) मिलता है। इसे "सॉफ्ट रिवॉर्ड" कहा जाता है।
- लाभ: AI सीखता है कि वह काफी हद तक अच्छा कर रहा है और उसे पता चलता है कि उसने वास्तव में कौन सा विशिष्ट नियम तोड़ा है। यह एक शिक्षक की तरह है जो केवल एक बड़े "F" को थमाने के बजाय, लाल स्याही से आपके पेपर पर गलत शब्द को गोला लगाकर बताता है।
- सावधानी: "शिक्षक" (AI verifier) परफेक्ट नहीं होता है। कभी-कभी, यह गलत उत्तर के लिए भी अंक दे सकता है। पेपर गणितीय रूप से सिद्ध करता है कि यदि आपके पास एक लंबी चेकलिस्ट है, तो शिक्षक की गलतियाँ एक-दूसरे को संतुलित (cancel out) कर देती हैं, जिससे समग्र स्कोर एक एकल, शोर वाले "हाँ/ना" निर्णय की तुलना में अधिक विश्वसनीय हो जाता है।
3. ट्विस्ट: रोबोट खुद को खुद ही सिखा रहा है (Soft-SVeRL)
आमतौर पर, आपको छात्र को ग्रेड देने के लिए एक अलग, अधिक बुद्धिमान शिक्षक की आवश्यकता होती है। लेकिन क्या होगा यदि छात्र ही शिक्षक हो?
Soft-SVeRL में, AI मॉडल ही Generator (उत्तर बनाना) और Verifier (उत्तर को ग्रेड देना) दोनों के रूप में कार्य करता है।
- खतरा: यह छात्र द्वारा अपना होमवर्क खुद ग्रेड देने जैसा है। वे आलसी हो सकते हैं और खुद को हर चीज़ के लिए "A" ग्रेड दे सकते हैं ताकि वे अच्छा महसूस कर सकें, भले ही काम खराब हो। पेपर इसे "Always-Yes Collapse" कहता है। AI को लगता है कि वह बेहतर हो रहा है क्योंकि उसका स्कोर बढ़ रहा है, लेकिन वास्तव में वह केवल एक उदार ग्रेडर बनता जा रहा है।
- समाधान: इसे रोकने के लिए, लेखकों ने दो सुरक्षा ब्रेक जोड़े हैं:
- गोल्ड स्टैंडर्ड उदाहरण (Gold Standard Examples): वे AI को मानव (या एक विश्वसनीय स्रोत) के कुछ "परफेक्ट" उदाहरण दिखाते हैं ताकि AI याद रख सके कि एक असली "Yes" कैसा दिखता है।
- "बहुत दयालु न होने" का दंड (The "Don't Be Too Nice" Penalty): यदि AI उन उत्तरों पर बहुत अधिक "Yes" देने लगता है जो स्पष्ट रूप से विफल रहे हैं, तो उसे दंडित किया जाता है। यह AI को अपने प्रति ईमानदार रहने के लिए मजबूर करता है।
4. परिणाम: क्या यह काम करता है?
टीम ने "Command R7B" नामक एक मॉडल पर परीक्षण किया जो IFEval नामक बेंचमार्क का उपयोग करता है (जो यह जांचता है कि क्या AI सख्त नियमों जैसे "नंबर वाली लिस्ट का उपयोग करें" या "'e' अक्षर का उपयोग न करें" का पालन करता है)।
- जीत: उनके चेकलिस्ट मेथड और बाहरी AI शिक्षक का उपयोग करने पर, मॉडल का स्कोर 11.1 अंक बढ़ गया। यह एक बहुत बड़ा सुधार है।
- सेल्फ-चेक: जब मॉडल ने खुद को ग्रेड दिया (सुरक्षा ब्रेक्स के साथ), तब भी इसमें सुधार हुआ, हालांकि यह उतना अधिक नहीं था जितना कि एक अलग शिक्षक के उपयोग से हुआ था।
- बोनस: मॉडल नियमों का पालन करने में बेहतर हो गया बिना अपनी गणितीय क्षमताओं में गिरावट लाए। इसने निर्देशों का पालन सीखते समय अपने अन्य कौशल नहीं खोए।
सारांश
पेपर कहता है: AI को सिर्फ "गलत" न बताएं। उसे एक चेकलिस्ट दें।
बड़े कार्यों को छोटी, जांच योग्य वस्तुओं में तोड़कर, आप AI को यह स्पष्ट नक्शा देते हैं कि उसे क्या ठीक करना है। इससे भी बेहतर, आप AI को खुद को ग्रेड देने दे सकते हैं, बशर्ते आप उसे कुछ "गोल्ड स्टैंडर्ड" उदाहरण और खुद के प्रति बहुत उदार न होने का नियम दें। यह AI को जटिल निर्देशों का पालन करने में स्मार्ट बनाता है बिना किसी इंसान द्वारा हर एक उत्तर की जांच किए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।