← नवीनतम पेपर
💬 NLP

Soft-SVeRL: Self-Verified Reinforcement Learning with Soft Rewards

यह शोधपत्र Soft-SVeRL प्रस्तुत करता है, जो एक स्व-सत्यापित सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो आंशिक रूप से सत्यापन योग्य कार्यों में निर्देश-अनुपालन में सुधार के लिए विघटित, चेकलिस्ट-आधारित सॉफ्ट रिवॉर्ड्स का उपयोग करता है, और साथ ही स्पष्ट स्थिरीकरण तंत्रों के माध्यम से सत्यापनकर्ता शोर (verifier noise) और रिवॉर्ड मुद्रास्फीति के बीच महत्वपूर्ण ट्रेड-ऑफ को संबोधित करता है।

मूल लेखक: Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saurabh Dash, Pierre Clavier, John Dang, Matthias Galle, Marzieh Fadaee, Ahmet Üstün, Beyza Ermis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट शेफ को एक जटिल रेसिपी का पालन करना सिखा रहे हैं। पुराने दिनों में, यदि रोबोट ने एक ऐसा व्यंजन बनाया जो थोड़ा नमकीन था लेकिन बाकी सब कुछ एकदम सही था, तो आपको कहना पड़ सकता था, "Fail" (असफल), क्योंकि वह बिल्कुल सही नहीं था। यह एक "पास/फेल" टेस्ट की तरह है। लेकिन क्या होगा अगर रोबोट ने 5 में से 4 स्टेप्स सही किए? एक साधारण "Fail" उसे यह नहीं सिखा पाएगा कि उसे कौन सा स्टेप ठीक करने की जरूरत है।

यह पेपर AI मॉडल्स को सिखाने का एक नया तरीका पेश करता है जिसे Soft-RLVR और Soft-SVeRL कहा जाता है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है:

1. समस्या: "सब-या-कुछ-नहीं" का जाल (The "All-or-Nothing" Trap)

कल्पना कीजिए कि आपने एक छात्र को एक पैराग्राफ लिखने के लिए कहा है जिसमें ये शर्तें होनी चाहिए:

  1. यह ठीक 5 वाक्यों का होना चाहिए।
  2. इसमें "apple" शब्द शामिल होना चाहिए।
  3. इसमें "orange" शब्द का उपयोग नहीं होना चाहिए।
  4. यह एक बड़े अक्षर (Capital letter) से शुरू होना चाहिए।
  5. यह एक पूर्ण विराम (Period) के साथ समाप्त होना चाहिए।

यदि छात्र एक सुंदर पैराग्राफ लिखता है लेकिन "apple" शब्द लिखना भूल जाता है, तो एक पारंपरिक "हार्ड" रिवॉर्ड सिस्टम कहता है: 0 अंक। छात्र को अन्य 4 चीजों के लिए कोई फीडबैक नहीं मिलता जो उसने सही की थीं। उसे यह नहीं पता चलेगा कि अगली बार उसे शब्द संख्या पर ध्यान देना है या विराम चिह्नों पर।

2. समाधान: "चेकलिस्ट" (Soft-RLVR)

लेखक उस एकल "Pass/Fail" ग्रेड को एक चेकलिस्ट में तोड़ने का प्रस्ताव देते हैं।
एक बड़े ग्रेड के बजाय, AI को सूची की हर एक चीज़ के लिए एक स्कोर मिलता है।

  • क्या आपने 5 वाक्य लिखे? हाँ (+1 अंक)
  • क्या आपने "apple" का उपयोग किया? नहीं (0 अंक)
  • क्या आपने "orange" का उपयोग नहीं किया? हाँ (+1 अंक)
  • ...और इसी तरह।

AI को एक आंशिक स्कोर (जैसे, 5 में से 4) मिलता है। इसे "सॉफ्ट रिवॉर्ड" कहा जाता है।

  • लाभ: AI सीखता है कि वह काफी हद तक अच्छा कर रहा है और उसे पता चलता है कि उसने वास्तव में कौन सा विशिष्ट नियम तोड़ा है। यह एक शिक्षक की तरह है जो केवल एक बड़े "F" को थमाने के बजाय, लाल स्याही से आपके पेपर पर गलत शब्द को गोला लगाकर बताता है।
  • सावधानी: "शिक्षक" (AI verifier) परफेक्ट नहीं होता है। कभी-कभी, यह गलत उत्तर के लिए भी अंक दे सकता है। पेपर गणितीय रूप से सिद्ध करता है कि यदि आपके पास एक लंबी चेकलिस्ट है, तो शिक्षक की गलतियाँ एक-दूसरे को संतुलित (cancel out) कर देती हैं, जिससे समग्र स्कोर एक एकल, शोर वाले "हाँ/ना" निर्णय की तुलना में अधिक विश्वसनीय हो जाता है।

3. ट्विस्ट: रोबोट खुद को खुद ही सिखा रहा है (Soft-SVeRL)

आमतौर पर, आपको छात्र को ग्रेड देने के लिए एक अलग, अधिक बुद्धिमान शिक्षक की आवश्यकता होती है। लेकिन क्या होगा यदि छात्र ही शिक्षक हो?
Soft-SVeRL में, AI मॉडल ही Generator (उत्तर बनाना) और Verifier (उत्तर को ग्रेड देना) दोनों के रूप में कार्य करता है।

  • खतरा: यह छात्र द्वारा अपना होमवर्क खुद ग्रेड देने जैसा है। वे आलसी हो सकते हैं और खुद को हर चीज़ के लिए "A" ग्रेड दे सकते हैं ताकि वे अच्छा महसूस कर सकें, भले ही काम खराब हो। पेपर इसे "Always-Yes Collapse" कहता है। AI को लगता है कि वह बेहतर हो रहा है क्योंकि उसका स्कोर बढ़ रहा है, लेकिन वास्तव में वह केवल एक उदार ग्रेडर बनता जा रहा है।
  • समाधान: इसे रोकने के लिए, लेखकों ने दो सुरक्षा ब्रेक जोड़े हैं:
    1. गोल्ड स्टैंडर्ड उदाहरण (Gold Standard Examples): वे AI को मानव (या एक विश्वसनीय स्रोत) के कुछ "परफेक्ट" उदाहरण दिखाते हैं ताकि AI याद रख सके कि एक असली "Yes" कैसा दिखता है।
    2. "बहुत दयालु न होने" का दंड (The "Don't Be Too Nice" Penalty): यदि AI उन उत्तरों पर बहुत अधिक "Yes" देने लगता है जो स्पष्ट रूप से विफल रहे हैं, तो उसे दंडित किया जाता है। यह AI को अपने प्रति ईमानदार रहने के लिए मजबूर करता है।

4. परिणाम: क्या यह काम करता है?

टीम ने "Command R7B" नामक एक मॉडल पर परीक्षण किया जो IFEval नामक बेंचमार्क का उपयोग करता है (जो यह जांचता है कि क्या AI सख्त नियमों जैसे "नंबर वाली लिस्ट का उपयोग करें" या "'e' अक्षर का उपयोग न करें" का पालन करता है)।

  • जीत: उनके चेकलिस्ट मेथड और बाहरी AI शिक्षक का उपयोग करने पर, मॉडल का स्कोर 11.1 अंक बढ़ गया। यह एक बहुत बड़ा सुधार है।
  • सेल्फ-चेक: जब मॉडल ने खुद को ग्रेड दिया (सुरक्षा ब्रेक्स के साथ), तब भी इसमें सुधार हुआ, हालांकि यह उतना अधिक नहीं था जितना कि एक अलग शिक्षक के उपयोग से हुआ था।
  • बोनस: मॉडल नियमों का पालन करने में बेहतर हो गया बिना अपनी गणितीय क्षमताओं में गिरावट लाए। इसने निर्देशों का पालन सीखते समय अपने अन्य कौशल नहीं खोए।

सारांश

पेपर कहता है: AI को सिर्फ "गलत" न बताएं। उसे एक चेकलिस्ट दें।
बड़े कार्यों को छोटी, जांच योग्य वस्तुओं में तोड़कर, आप AI को यह स्पष्ट नक्शा देते हैं कि उसे क्या ठीक करना है। इससे भी बेहतर, आप AI को खुद को ग्रेड देने दे सकते हैं, बशर्ते आप उसे कुछ "गोल्ड स्टैंडर्ड" उदाहरण और खुद के प्रति बहुत उदार न होने का नियम दें। यह AI को जटिल निर्देशों का पालन करने में स्मार्ट बनाता है बिना किसी इंसान द्वारा हर एक उत्तर की जांच किए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →