RIFT: Repurposing Negative Samples via Reward-Informed Fine-Tuning
यह शोध पत्र RIFT को प्रस्तुत करता है, जो एक डेटा-कुशल ढांचा है जो रिवॉर्ड-इन्फॉर्म्ड लॉस रीवेटिंग और एक स्थिर फॉर्मूलेशन के माध्यम से स्वयं-निर्मित नकारात्मक नमूनों का पुनरुद्देश्य बनाकर LLM अलाइनमेंट में सुधार करता है, और गणितीय बेंचमार्क पर मानक रिजेक्शन सैंपलिंग फाइन-ट्यूनिंग से लगातार बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन थोड़े ज़िद्दी छात्र (AI) को जटिल गणित की समस्याओं को हल करना सिखा रहे हैं। आपके पास अभ्यास परीक्षणों (practice tests) का एक ढेर है, लेकिन आपके पास हर एक प्रश्न के लिए एक सटीक उत्तर कुंजी (answer key) नहीं है। इसके बजाय, आप छात्र को टेस्ट देने देते हैं, और फिर आप उत्तरों की जाँच करते हैं।
पुराना तरीका: "कचरा पात्र" दृष्टिकोण (The "Trash Can" Approach)
पारंपरिक रूप से, जब कोई छात्र किसी प्रश्न का गलत उत्तर देता है, तो शिक्षक उस प्रयास को कचरे में फेंक देता है।
- सुपरवाइज्ड फाइन-ट्यूनिंग (SFT): आप छात्र को केवल मानव विशेषज्ञों द्वारा दिए गए "परफेक्ट" उत्तर दिखाते हैं। इन विशेषज्ञों को प्राप्त करना महंगा है, और यदि छात्र ऐसी गलती करता है जो उसने पहले कभी नहीं देखी है, तो वह भ्रमित हो जाता है।
- रिजेक्शन सैंपलिंग फाइन-ट्यूनिंग (RFT): आप छात्र को एक प्रश्न को 8 बार हल करने देते हैं। यदि 7 उत्तर गलत हैं और 1 सही है, तो आप उस 1 सही उत्तर को रखते हैं और उन 7 गलत उत्तरों को फेंक देते हैं। आप केवल परफेक्ट वाले का अध्ययन करते हैं।
समस्या: यह बर्बादी है। वे 7 गलत उत्तर वास्तव में मूल्यवान संकेत (clues) रखते हैं! वे दिखाते हैं कि छात्र का तर्क ठीक कहाँ टूटा। उन्हें फेंककर, आप सीखने के अवसरों के एक खजाने को अनदेखा कर रहे हैं। इसके अलावा, यदि छात्र अभी बहुत अच्छा नहीं है, तो वह शायद कोई भी परफेक्ट उत्तर न दे पाए, जिससे आपके पास अध्ययन के लिए कुछ भी नहीं बचेगा।
नया तरीका: RIFT (द "स्मार्ट कोच")
यह पेपर RIFT (रिवॉर्ड-इन्फॉर्म्ड फाइन-ट्यूनिंग) पेश करता है। RIFT को एक स्मार्ट कोच की तरह समझें जो हर एक प्रयास पर नज़र रखता है, चाहे वह एक परफेक्ट स्कोर हो या पूरी तरह से आपदा।
RIFT कैसे काम करता है, इसे एक सरल उपमा (analogy) का उपयोग करके यहाँ समझाया गया है:
1. "स्कोरकार्ड" प्रणाली
केवल यह कहने के बजाय कि "अच्छे वाले रखें, बुरे वाले फेंक दें," RIFT हर उत्तर को एक स्कोर देता है।
- सही उत्तर: उच्च सकारात्मक स्कोर प्राप्त करता है (जैसे, +10)।
- गलत उत्तर: नकारात्मक स्कोर प्राप्त करता है (जैसे, -2)।
2. "धक्का और खिंचाव" तंत्र (The "Push and Pull" Mechanism)
कोच इन स्कोर का उपयोग छात्र के मस्तिष्क को समायोजित करने के लिए करता है:
- अच्छे उत्तरों के लिए (+10): कोच कहता है, "इसे फिर से करो! इस अहसास को और मजबूत बनाओ!" (यह छात्र को सफलता को दोहराने के लिए प्रेरित करता है)।
- बुरे उत्तरों के लिए (-2): कोच कहता है, "ऐसा मत करो। उस अहसास को कमजोर बनाओ।" (यह छात्र को गलती से दूर खींचता है)।
3. "सुरक्षा जाल" (The "Safety Net" - असली जादू)
यहाँ पेचीदा हिस्सा आता है। यदि आप केवल छात्र को कहते हैं "X मत करो" और वे X से बचने में बहुत अच्छे हो जाते हैं, तो पर्दे के पीछे का गणित टूट सकता है। यह एक रस्सी पर चलने वाले (tightrope walker) को बताने जैसा है, "गिरना मत!" यदि वे गिरने से बचने में बहुत अच्छे हो जाते हैं, तो गणित कहता है कि उन्हें अनंत रूप से गिरना चाहिए, जिससे क्रैश हो सकता है (इसे "ट्रेनिंग कोलैप्स" कहा जाता है)।
RIFT का नवाचार: इस क्रैश को रोकने के लिए, RIFT गलत उत्तरों के लिए नियम बदल देता है।
- एक "डरावी, अनंत दंड" (infinite penalty) देने के बजाय, यह एक सौम्य, सीमित दंड (capped penalty) का उपयोग करता है।
- एक सुरक्षा जाल की कल्पना करें। यदि छात्र गिरता है, तो वह जाल से टकराता है और धीरे से वापस उछलता है, बजाय इसके कि वह एक अंतहीन गड्ढे में गिर जाए। यह प्रशिक्षण को स्थिर रखता है और AI को वह सब कुछ भूलने से रोकता है जो उसने पहले सीखा था।
RIFT बेहतर क्यों है?
- यह डेटा का संचय करता है (अच्छे तरीके से): यह एक भी उत्पन्न उत्तर को बर्बाद नहीं करता है। यहाँ तक कि "बुरे" उत्तर भी AI को यह सीखने में मदद करते हैं कि क्या नहीं करना है।
- यह कमजोर छात्रों के साथ भी काम करता है: आपको शुरुआत करने के लिए जीनियस AI की आवश्यकता नहीं है। भले ही AI 8 में से केवल 1 उत्तर सही दे, RIFT अभी भी उन 7 गलत उत्तरों से सीख सकता है। पुराना तरीका (RFT) विफल हो जाएगा क्योंकि वे 7 गलत उत्तरों को फेंक देते हैं और उनके पास सीखने के लिए कुछ नहीं बचता।
- यह पैसा और मेमोरी बचाता है: क्योंकि इसे एक परफेक्ट उत्तर खोजने के लिए हजारों उत्तर उत्पन्न करने की आवश्यकता नहीं होती है, और इसे एक "रेफरेंस मॉडल" (तुलना करने के लिए दूसरा AI) को मेमोरी में रखने की आवश्यकता नहीं होती है, यह DPO जैसी अन्य उन्नत विधियों की तुलना में बहुत तेज़ी से और सस्ते में चलता है।
परिणाम
पेपर के प्रयोगों में, RIFT ने एक सुपर-एफिशिएंट ट्यूटर की तरह काम किया। इसने उन मॉडल्स को जो पहले से ही गणित में अच्छे थे, कठिन समस्याओं को हल करने में काफी बेहतर बनाया, और यह सब करते हुए प्रतिस्पर्धा की तुलना में कम कंप्यूटर मेमोरी का उपयोग किया।
संक्षेप में: RIFT गलतियों को कचरा मानना बंद करता है। इसके बजाय, यह गलतियों को "लर्निंग डेटा" के रूप में मानता है, और एक चतुर गणितीय सुरक्षा जाल का उपयोग करता है ताकि यह सुनिश्चित हो सके कि AI क्रैश हुए बिना उनसे सीख सके। यह एक ऐसे शिक्षक के बीच का अंतर है जो केवल आपको सही उत्तर दिखाता है और एक ऐसे कोच के बीच का अंतर है जो हर खेल का विश्लेषण करता है—चाहे जीत हो या हार—ताकी आप खेल जीत सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।