CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models
यह शोधपत्र CARE-RFT को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण फाइनट्यूनिंग (reinforcement finetuning) विधि है जो तर्क क्षमता (reasoning performance) और मॉडल की विश्वसनीयता (trustworthiness) के बीच के संतुलन को हल करने के लिए स्क्यू रिवर्स KL डाइवर्जेंस (skew reverse KL divergence) का उपयोग करती है, जिससे अनियंत्रित RFT की उच्च तर्क क्षमताओं को प्राप्त करते हुए बेस मॉडल के अंशांकन (calibration) और विश्वसनीयता को बनाए रखा जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित छात्र (AI मॉडल) को जटिल पहेलियाँ हल करना सिखा रहे हैं। आप चाहते हैं कि वह एक कुशल तर्ककर्ता (master reasoner) बने, जो चरण-दर-चरण सोचने और रचनात्मक समाधान खोजने में सक्षम हो। हालाँकि, आप यह भी चाहते हैं कि वह ईमानदार बना रहे और अनिश्चित होने पर तथ्य न गढ़े।
यह शोध पत्र, CARE-RFT, एक विशिष्ट समस्या को संबोधित करता है जो तब उत्पन्न होती है जब हम इन छात्रों को "रीइन्फोर्समेंट फाइनट्यूनिंग" (RFT) नामक एक विधि का उपयोग करके प्रशिक्षित करने का प्रयास करते हैं।
समस्या: "अति-आत्मविश्वासी स्वप्नद्रष्टा" बनाम "सतर्क नौकरशाह"
लेखकों ने पाया कि वर्तमान प्रशिक्षण विधियाँ आपको दो बुरे विकल्पों में से एक को चुनने के लिए मजबूर करती हैं:
अनियंत्रित दृष्टिकोण (The Overconfident Dreamer - अति-आत्मविश्वासी स्वप्नद्रष्टा):
यदि आप छात्र को सख्त नियमों के बिना केवल परीक्षण और त्रुटि (trial and error) के माध्यम से सीखने देते हैं, तो वे कठिन पहेलियों को हल करने में बहुत अच्छे हो जाते हैं। वे लीक से हटकर सोचना शुरू कर देते हैं! लेकिन, वे भ्रम (hallucinate) भी करने लगते हैं। वे अपने उत्तरों के प्रति इतने आश्वस्त हो जाते हैं कि वे आत्मविश्वास के साथ फर्जी तथ्य गढ़ने या उन चीजों के बारे में झूठ बोलने लगते हैं जिन्हें वे नहीं जानते। वे अपनी "कैलिब्रेशन" खो देते हैं, जिसका अर्थ है कि उनका आत्मविश्वास उनकी वास्तविक सटीकता से मेल नहीं खाता।- उपमा: यह एक ऐसे छात्र की तरह है जिसने गणित की परीक्षा के लिए उत्तर कुंजी (answer key) रट ली है लेकिन गणित को समझा नहीं है। यदि परीक्षा में थोड़ा सा बदलाव होता है, तो वह बस बेतहाशा और आत्मविश्वास के साथ अनुमान लगाने लगता है, जिससे वह भाग्य से सही उत्तर तो प्राप्त कर लेता है लेकिन विश्वसनीय नहीं रह जाता।
RKL-प्रतिबंधित दृष्टिकोण (The Cautious Bureaucrat - सतर्क नौकरशाह):
झूठ बोलने से रोकने के लिए, शोधकर्ता आमतौर पर एक "सुरक्षा पट्टे" के रूप में रिवर्स KL (RKL) नामक एक नियम जोड़ते हैं। यह छात्र को उनके मूल, पूर्व-प्रशिक्षित व्यक्तित्व के बहुत करीब रहने के लिए मजबूर करता है। यह उन्हें ईमानदार और तथ्यात्मक रखता है।- चुनौती: पट्टा बहुत कसकर बंधा हुआ है। यह छात्र को कुछ भी नया या अलग करने के लिए दंडित करता है। क्योंकि वे सुरक्षित पथ से विचलित होने से डरते हैं, इसलिए वे जटिल पहेलियों को हल करना बंद कर देते हैं। वे ईमानदार तो रहते हैं, लेकिन वे बुद्धिमान होना छोड़ देते हैं।
समाधान: CARE-RFT (The "Confidence-Anchored" Coach - "आत्मविश्वास-आधारित" कोच)
लेखक एक नया तरीका प्रस्तावित करते हैं जिसे CARE-RFT कहा जाता है। इसे एक स्मार्ट कोच के रूप में समझें जो जानता है कि पट्टे को कब ढीला करना है और कब कसना है।
एक एकल, कठोर नियम के बजाय, CARE-RFT एक विशेष उपकरण का उपयोग करता है जिसे Skew Reverse KL कहा जाता है। यहाँ बताया गया है कि यह एक सरल रूपक का उपयोग करके कैसे काम करता है:
- "एंकर" (Anchor) की अवधारणा: कल्पना करें कि छात्र एक नाव है, और मूल, अच्छी तरह से प्रशिक्षित मॉडल एक भारी लंगर (anchor) है।
- मानक RKL (पुराना तरीका): लंगर एक विशाल, अटूट जंजीर है। यदि नाव थोड़ा भी नए, अनछुए क्षेत्रों (नए तर्क पथों) में जाने की कोशिश करती है, तो जंजीर उसे हिंसक रूप से वापस खींच लेती है। नाव सुरक्षित रहती है लेकिन कभी भी अन्वेषण नहीं कर पाती।
- Unconstrained RFT (दूसरा तरीका): लंगर काट दिया गया है। नाव कहीं भी जा सकती है, लेकिन वह चट्टानों से टकरा सकती है (भ्रम/hallucinations) या खाई में गिर सकती है (मिसकैलिब्रेशन)।
- CARE-RFT (नया तरीका): लंगर एक स्मार्ट, समायोज्य बंधन (adjustable tether) है।
- जब छात्र अनिश्चित होता है: यदि नाव धुंधले, अनिश्चित पानी में बह रही है, तो बंधन उसे जोर से खींचता है, जिससे छात्र बेस मॉडल के सुरक्षित, तथ्यात्मक ज्ञान में स्थिर रहता है। यह भ्रम (hallucinations) को रोकता है।
- जब छात्र आत्मविश्वासी और पुरस्कृत होता है: यदि छात्र एक नया रास्ता आज़माता है और वह सफल होता है (उसे उच्च पुरस्कार मिलता है), तो बंधन ढीला हो जाता है। यह छात्र को और अधिक अन्वेषण करने और जटिल तर्क सीखने के लिए दूर तक जाने की अनुमति देता है, लेकिन केवल इसलिए क्योंकि उन्होंने साबित कर दिया है कि वे सही रास्ते पर हैं।
जब आप CARE-RFT का उपयोग करते हैं तो क्या होता है?
शोधपत्र ने विभिन्न AI मॉडलों (जैसे Qwen2.5) पर प्रयोग चलाए और पाया कि CARE-RFT "दोनों दुनियाओं का सर्वश्रेष्ठ" प्राप्त करता है:
- यह "स्वप्नद्रष्टा" की बुद्धिमत्ता बनाए रखता है: मॉडल अनियंत्रित, भ्रम-प्रवण मॉडलों की तरह ही कठिन गणित और तर्क समस्याओं को हल करने में उतने ही अच्छे हो गए।
- यह "नौकरशाह" की ईमानदारी बनाए रखता है: मॉडल सतर्क, पट्टे वाले मॉडलों की तरह ही उतने ही भरोसेमंद और तथ्यात्मक रूप से सटीक रहे। उन्होंने तथ्य बनाना बंद कर दिया और उनके आत्मविश्वास का स्तर उनके वास्तविक प्रदर्शन से मेल खाता था।
"एंट्रॉपी" (Entropy) का रहस्य
लेखकों ने प्रशिक्षण के दौरान मॉडलों की "एंट्रॉपी" (अनिश्चितता का एक माप) का भी अध्ययन किया।
- Unconstrained मॉडल "भंगुर" (brittle) हो गए—उनकी अनिश्चितता बहुत तेज़ी से शून्य हो गई, जिससे वे अति-आत्मविश्वासी और त्रुटियों के प्रति संवेदनशील हो गए।
- RKL मॉडल बहुत अधिक "धुंधले" और अनिश्चित रहे जिससे वे कठिन कार्य सीखने में असमर्थ रहे।
- CARE-RFT ने एक "गोल्डिलॉक्स ज़ोन" (Goldilocks zone) खोजा। इसने मॉडलों को कठिन समस्याओं को हल करने के लिए पर्याप्त आत्मविश्वासी बनने की अनुमति दी, लेकिन इतना आत्मविश्वासी नहीं कि वे खुद पर संदेह करना छोड़ दें।
सारांश
संक्षेप में, CARE-RFT एक नई प्रशिक्षण तकनीक है जो एक स्मार्ट सुरक्षा जाल की तरह कार्य करती है। यह बड़े भाषा मॉडलों (LLMs) को वास्तविकता से अपना संपर्क खोए बिना नई, जटिल तर्क रणनीतियों का अन्वेषण करने की अनुमति देता है। यह सिद्ध करता है कि आपको एक शानदार तर्ककर्ता और एक भरोसेमंद तथ्य-जांचकर्ता होने के बीच चयन करने की आवश्यकता नहीं है; सही "आत्मविश्वास-आधारित" दृष्टिकोण के साथ, आप दोनों हो सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।