← नवीनतम पेपर
🤖 AI

Reference-Sampled Boltzmann Projection for KL-Regularized RLVR: Target-Matched Weighted SFT, Finite One-Shot Gaps, and Policy Mirror Descent

यह शोध पत्र रेफरेंस-सैंपलड बोल्ट्ज़मैन प्रोजेक्शन (BOLT) को प्रस्तुत करता है, जो एक अनूठा, प्रॉम्प्ट-नॉर्मलाइज्ड वेटेड SFT ऑब्जेक्टिव व्युत्पन्न करने की एक विधि है ताकि KL-रेगुलराइज्ड RLVR टार्गेट पॉलिसी से सटीक रूप से मेल खाया जा सके, जिससे ऑनलाइन रोलआउट बाधाओं को समाप्त किया जा सके और एक परिमित वन-शॉट विश्लेषण प्रदान किया जा सके जो स्टैटिक ट्रेनिंग की सीमाओं और रिफ्रेश्ड सैंपलिंग के लाभों को स्पष्ट करता है।

मूल लेखक: Yao Shu, Chenxing Wei, Hongbin Lin, Shuang Qiu, Hui Xiong

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yao Shu, Chenxing Wei, Hongbin Lin, Shuang Qiu, Hui Xiong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक छात्र (एक AI मॉडल) को कठिन गणित के सवाल हल करना सिखाने की कोशिश कर रहे हैं। आपके पास एक बहुत ही सख्त शिक्षक (एक "वेरिफायर") है जो तुरंत जांच सकता है कि उत्तर सही है या गलत, लेकिन शिक्षक यह नहीं बताता कि वह क्यों सही है, वे बस एक स्कोर देते हैं।

यह शोध पत्र एक विशिष्ट समस्या का समाधान करता है: हम इन स्कोरों का उपयोग करके छात्र को कैसे सिखा सकते हैं बिना हर बार छात्र के मस्तिष्क (brain) को अपडेट करने के लिए नए अभ्यास प्रश्न उत्पन्न किए?

यहाँ इस शोध पत्र के विचारों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. पुराना तरीका: "लाइव" ट्रेनिंग लूप

वर्तमान में, अधिकांश उन्नत AI प्रशिक्षण एक लाइव कुकिंग प्रतियोगिता की तरह काम करता है।

  • शेफ (AI) एक व्यंजन बनाता है (उत्तर उत्पन्न करता है)।
  • जज (वेरिफायर) उसे चखता है और एक स्कोर देता है।
  • शेफ उस स्कोर के आधार पर तुरंत अपनी रेसिपी में बदलाव करता है।
  • फिर, शेफ एक नया व्यंजन बनाता है, जज उसे फिर से चखता है, और यह चक्र दोहराया जाता है।

समस्या: यह अविश्वसनीय रूप से महंगा और धीमा है। हर बार जब शेफ कुछ सीखता है, तो उन्हें वापस रसोई में जाना पड़ता है, ताजी सामग्री खरीदनी पड़ती है और अगला सबक पाने के लिए फिर से खाना बनाना पड़ता है। "रसोई" (कंप्यूटिंग पावर) ही यहाँ मुख्य बाधा (bottleneck) है।

2. प्रस्तावित शॉर्टकट: "फ्रोजन मेनू" (स्थिर मेनू)

शोध पत्र एक अलग दृष्टिकोण का सुझाव देता है: रसोई का एक स्नैपशॉट ले लें।

  • लाइव खाना बनाने के बजाय, हम शेफ को अपनी वर्तमान रेसिपी का उपयोग करके एक बार में 100 व्यंजन बनाने के लिए कहते हैं।
  • हमें उन 100 व्यंजनों और उनके स्कोर की एक सूची मिल जाती है।
  • अब, हम इस व्यंजनों की सूची को स्थिर (freeze) कर देते हैं।
  • अब, हम इस स्थिर सूची पर शेफ को जितनी बार चाहें उतनी बार प्रशिक्षित कर सकते हैं बिना वापस रसोई में जाए।

चुनौती: यदि आप केवल इस सूची पर प्रशिक्षण लेते हैं, तो आपको यह तय करना होगा कि प्रत्येक व्यंजन पर कितना ध्यान (attention) देना है।

  • गलत दृष्टिकोण: "इस व्यंजन को 10 स्कोर मिला, तो चलिए इसे 1 वाले व्यंजन की तुलना में 10 गुना अधिक अध्ययन करते हैं।"
  • शोध पत्र का अंतर्दृष्टि (Insight): यह सरल गणित काम नहीं करता है। व्यंजनों की यह सूची शेफ की पुरानी रेसिपी द्वारा बनाई गई थी। यदि आपकी पुरानी रेसिपी शायद ही कभी "परफेक्ट" व्यंजन बनाती थी, तो आपकी सूची में वे व्यंजन नहीं होंगे, चाहे आप उनका कितना भी अध्ययन क्यों न करें।

3. मुख्य खोज: "परफेक्ट रेसिपी" (बोल्ट्ज़मैन प्रोजेक्शन)

लेखकों ने इस बात का सटीक गणितीय सूत्र खोजा है कि इन स्थिर व्यंजनों को कैसे वेट (weight) किया जाए ताकि छात्र वही सीख सके जो वह महंगी "लाइव" प्रतियोगिता में सीखता।

वे इसे BOLT (बोल्ट्ज़मैन-टारगेटेड SFT) कहते हैं।

इसे इस तरह समझें:

  • कल्पना करें कि "परफेक्ट रेसिपी" एक मानचित्र है कि सबसे अच्छे व्यंजन कहाँ होने चाहिए।
  • "फ्रोजन मेनू" एक मानचित्र है कि व्यंजन वास्तव में कहाँ हैं।
  • शोध पत्र सिद्ध करता है कि फ्रोजन मेनू को परफेक्ट रेसिपी सिखाने के लिए, आपको केवल स्कोर को नहीं देखना है। आपको हर व्यंजन के लिए एक विशेष वेट (weight) की गणना करनी होगी।
  • यह वेट इस पर आधारित है: यह व्यंजन औसत से कितना बेहतर है, और यह मूल रूप से कितना दुर्लभ था।

यदि शेफ शायद ही कभी एक परफेक्ट व्यंजन बनाता है, लेकिन जज ने इसे उच्च स्कोर दिया है, तो यह सूत्र कहता है: "यह एक दुर्लभ रत्न है! हमें इसका गहन अध्ययन करना चाहिए।" यदि शेफ ने आसानी से एक परफेक्ट व्यंजन बनाया, तो सूत्र कहता है: "हमने यह पहले भी देखा है; सामान्य रूप से अध्ययन करें।"

4. "वन-शॉट" सीमा: गायब सामग्रियाँ

यह पत्र एक कठिन सीमा के बारे में भी बताता है।

  • उपमा: कल्पना करें कि आप शेफ को "गोल्डन ड्रैगन केक" बनाना सिखाने की कोशिश कर रहे हैं।
  • यदि शेफ की पुरानी रेसिपी में कभी भी गोल्डन ड्रैगन केक नहीं बना (भले ही वह खराब ही क्यों न हो), और आपके पास केवल 1,000 साधारण केक का फ्रोजन मेनू है, तो आप उन्हें गोल्डन ड्रैगन केक बनाना नहीं सिखा सकते।
  • फ्रोजन मेनू का अध्ययन करने से कोई फर्क नहीं पड़ेगा यदि उसमें वे सामग्रियाँ (डेटा) मौजूद नहीं हैं।
  • सबक: आप केवल अधिक अध्ययन करके गायब सामग्री की कमी को पूरा नहीं कर सकते। आपको पहले रसोई में वापस जाना होगा और गोल्डन ड्रैगन केक बनाने की कोशिश करनी होगी (इसे "सैंपलर को रिफ्रेश करना" कहा जाता है)।

5. "रिफ्रेश" रणनीति: पुनरावृत्ति (Iterative) सीखना

क्या होगा यदि शेफ लगभग गोल्डन ड्रैगन केक बना लेता है?

  • शोध पत्र एक रणनीति सुझाता है जिसे इटरेटिव BOLT (Iterative BOLT) कहा जाता है।
  • चरण 1: फ्रोजन मेनू पर प्रशिक्षण लें। शेफ थोड़ा बेहतर हो जाता है।
  • चरण 2: उस नए शेफ को लें और उसे व्यंजनों का एक नया बैच पकाने के लिए कहें।
  • चरण 3: इस नए बैच को फ्रीज करें और फिर से प्रशिक्षित करें।
  • यह क्यों काम करता है: क्योंकि अब शेफ बेहतर है, इसलिए इस बात की अधिक संभावना है कि वह नए बैच में गलती से "गोल्डन ड्रैगन केक" बना ले। इस लूप को दोहराकर, शेफ धीरे-धीरे असंभव व्यंजन बनाना सीख जाता है।

6. परिणाम: तेज़ और स्मार्ट

लेखकों ने गणित और कोडिंग समस्याओं (जैसे GSM8K और HumanEval) पर इसका परीक्षण किया।

  • गति: चूंकि उन्होंने "खाना पकाने" (उत्तर उत्पन्न करने) और "स्कोरिंग" को मुख्य प्रशिक्षण लूप से बाहर निकाल दिया, इसलिए उन्होंने कंप्यूटर मेमोरी और समय की भारी बचत की (कुछ परीक्षणों में 85% तक तेज़)।
  • सटीकता: केवल कच्चे स्कोर के बजाय अपने विशेष "BOLT" वेट का उपयोग करके, AI ने कच्चे स्कोर का उपयोग करने वाले तरीकों की तुलना में बेहतर सीखा।
  • "सैचुरेशन" बिंदु: उन्होंने दिखाया कि यदि आप केवल एक ही फ्रोजन सूची पर प्रशिक्षण लेते रहते हैं, तो AI अंततः सुधार करना बंद कर देता है (यह एक दीवार से टकरा जाता है)। लेकिन यदि आप सूची को "रिफ्रेश" करते हैं (नया बैच लेने के लिए रसोई में वापस जाते हैं), तो AI प्रदर्शन के एक नए स्तर पर पहुँच जाता है।

सारांश

यह शोध पत्र कुशल AI प्रशिक्षण के लिए एक ब्लूप्रिंट प्रदान करता है। यह कहता है:

  1. केवल "अच्छे" उत्तरों पर प्रशिक्षण न दें; उन उत्तरों पर प्रशिक्षण दें जिन्हें एक विशिष्ट सूत्र द्वारा भारित (weight) किया गया है जो यह गणना करता है कि उन्हें खोजना कितना कठिन था।
  2. आप वह नहीं सीख सकते जो आपने सैंपल नहीं किया है; यदि आपके डेटा में उत्तर नहीं है, तो कोई भी प्रशिक्षण उसे पैदा नहीं कर सकता।
  3. कठिन चीजें सीखने के लिए, आपको अपने वर्तमान कौशल के आधार पर नया डेटा उत्पन्न करने के लिए समय-समय पर वापस जाना होगा, और फिर से प्रशिक्षित करना होगा।

यह एक धीमे, महंगे, लाइव-फीडबैक लूप को एक तेज़, कुशल, दो-चरणीय प्रक्रिया में बदल देता है: एक बार उत्पन्न करें, सही ढंग से वेट करें, और गहराई से सीखें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →