← नवीनतम पेपर
🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

यह शोध पत्र इस धारणा को चुनौती देता है कि "SFT याद करता है, RL सामान्यीकरण करता है" और चेकपॉइंट-वार एवं स्पेक्ट्रल विश्लेषणों के माध्यम से यह प्रदर्शित करता है कि SFT अक्सर आउट-ऑफ-डिस्ट्रीब्यूशन विस्मृति (out-of-distribution forgetting) का कारण बनता है जिसे बाद में RL द्वारा पुनर्स्थापित किया जाता है, एक ऐसी रिकवरी प्रक्रिया जो सिंगुलर मानों (singular values) में परिवर्तनों के बजाय सिंगुलर वेक्टर्स के रोटेशन से जुड़ी है।

मूल लेखक: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

प्रकाशित 2026-05-12
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके शोध पत्र का स्पष्टीकरण दिया गया है।

बड़ी तस्वीर: AI प्रशिक्षण का "दो-चरणीय" नृत्य

कल्पना कीजिए कि आप एक प्रतिभाशाली लेकिन अनुभवहीन छात्र (एक लार्ज लैंग्वेज मॉडल) को जटिल पहेलियाँ हल करना सिखा रहे हैं। इस छात्र को तर्क विशेषज्ञ बनाने की मानक विधि में दो चरण शामिल हैं:

  1. चरण 1: सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) – आप छात्र को उत्तरों के साथ एक पाठ्यपुस्तक देते हैं और कहते हैं, "इन पैटर्नों को याद करो और इसी शैली की नकल करो।"
  2. चरण 2: रीइन्फोर्समेंट लर्निंग (RL) – आप छात्र को एक खेल में डालते हैं जहाँ उन्हें सही उत्तरों के लिए अंक मिलते हैं और गलत उत्तरों के लिए अंक कटते हैं, और आप कहते हैं, "अब, जीतने के लिए खुद तर्क लगाना सीखो।"

लंबे समय तक, AI समुदाय एक सरल कहानी में विश्वास करता रहा: "SFT छात्र को पाठ्यपुस्तक याद करने में मदद करता है (ज्ञात समस्याओं के लिए अच्छा है), और RL उसे सामान्यीकरण करने और रचनात्मक रूप से सोचने में मदद करता है (नई समस्याओं के लिए अच्छा है)।"

यह शोध पत्र कहता है कि वह कहानी अधूरी है। लेखकों ने पाया कि हालांकि SFT शुरुआत में बहुत अच्छा होता है, लेकिन यदि आप छात्र को बहुत लंबे समय तक पाठ्यपुस्तक पढ़ने देते हैं, तो यह वास्तव में नई प्रकार की पहेलियों को हल करने की उसकी क्षमता को नुकसान पहुँचाने लगता है। फिर, RL अनिवार्य रूप से उसे नई महाशक्तियाँ नहीं सिखाता; यह मुख्य रूप से उस नुकसान को ठीक करता है जो SFT ने पहुँचाया था।


खोज: "शिखर और पतन" (The Peak and Crash)

शोधकर्ताओं ने प्रशिक्षण प्रक्रिया के दौरान हर एक दिन छात्र की प्रगति पर नज़र रखी। उन्होंने एक आश्चर्यजनक पैटर्न देखा:

  • शुरुआती जीत: "पाठ्यपुस्तक अध्ययन" (SFT) के बिल्कुल शुरुआत में, छात्र नए प्रकार की पहेलियों (आउट-ऑफ-डिस्ट्रीब्यूशन या OOD कार्यों) को हल करने में बहुत कुशल हो जाता है। यह ऐसा है जैसे छात्र अचानक गणित के अंतर्निहित तर्क को समझ गया हो।
  • पतन (The Crash): जैसे-जैसे छात्र पाठ्यपुस्तक का अध्ययन जारी रखता है, वह नई पहेलियों को हल करने में खराब होने लगता है, भले ही वह विशिष्ट पाठ्यपुस्तक समस्याओं में बेहतर होता जा रहा हो। वह पाठ्यपुस्तक के उत्तरों के सटीक प्रारूप के प्रति इतना जुनूनी हो जाता है कि वह थोड़ी भिन्न स्थितियों में तर्क लागू करना भूल जाता है।
  • सुधार (The Fix): जब वे अंततः "खेल" चरण (RL) में स्विच करते हैं, तो नई पहेलियों पर छात्र का प्रदर्शन फिर से ऊपर उठ जाता है।

उपमा:
कल्पना कीजिए कि एक शेफ खाना बनाना सीख रहा है।

  • प्रारंभिक SFT: शेफ स्वाद के बुनियादी नियम सीखता है। वह किसी भी सामग्री के साथ एक शानदार भोजन बना सकता है।
  • विलंबित SFT: शेफ को एक विशिष्ट रेसिपी बुक याद करने के लिए मजबूर किया जाता है। वह उस सटीक व्यंजन को बनाने में अद्भुत हो जाता है लेकिन अलग-अलग सामग्रियां मिलने पर स्वाद को कैसे समायोजित करना है, यह भूल जाता है। उसने अपनी सामान्य कुकिंग सहजता (intuition) "खो" दी है।
  • RL: शेफ को एक प्रतियोगिता में डाला जाता है जहाँ उसे स्वादिष्ट भोजन के लिए अंक मिलते हैं, चाहे रेसिपी कुछ भी हो। यह उसे आँख बंद करके किताब का पालन करने के बजाय फिर से अपनी सहज बुद्धि का उपयोग करने के लिए मजबूर करता है। वह अपने सामान्य कुकिंग कौशल को वापस पा लेता है, लेकिन वह अपने प्रशिक्षण के बिल्कुल शुरुआती स्तर से बेहतर शेफ नहीं बन जाता है।

मुख्य निष्कर्ष: RL एक "पुनर्स्थापक" है, "निर्माता" नहीं

यह शोध पत्र इस विचार को चुनौती देता है कि RL शून्य से नई तर्क क्षमताएं बनाता है। इसके बजाय, लेखकों ने पाया:

  1. SFT भूल जाता है: यदि आप विशिष्ट डेटा पर बहुत लंबे समय तक प्रशिक्षण देते हैं, तो मॉडल अजीब या नई स्थितियों को संभालने की अपनी क्षमता "भूल" जाता है।
  2. RL रिकवर करता है: RL एक पट्टी (bandage) की तरह काम करता है। यह उन छेदों को भर देता है जो SFT ने बनाए थे, और मॉडल को उसके SFT चरण के शिखर के प्रदर्शन स्तर तक वापस ले आता है।
  3. सीमा (The Ceiling): RL शायद ही कभी मॉडल को उस शुरुआती शिखर से बेहतर बनाता है। यह बस उसे वापस वहीं ले आता है जहाँ वह बहुत अधिक विशिष्ट होने से पहले था।

"गोल्डिलॉक्स" ज़ोन (The Goldilocks Zone):
शोधकर्ताओं ने पाया कि RL तभी काम करता है जब आप इसे सही समय पर शुरू करते हैं।

  • यदि आप RL बहुत जल्दी शुरू करते हैं (इससे पहले कि मॉडल बुनियादी बातें जानता हो), तो यह विफल हो जाता है क्योंकि मॉडल बहुत भ्रमित होता है।
  • यदि आप RL बहुत देर से शुरू करते हैं (SFT के बाद जब मॉडल सब कुछ भूल चुका होता है), तो "खेल" के संकेत मॉडल के सीखने के लिए बहुत अव्यवस्थित (messy) होते हैं।
  • एक विशिष्ट "स्वीट स्पॉट" (चेकपॉइंट्स की एक सीमा) है जहाँ RL सफलतापूर्वक भूलने की प्रक्रिया को ठीक कर सकता है।

गुप्त तंत्र: "घूमता हुआ दिशा-सूचक यंत्र" (The Spinning Compass)

यह समझने के लिए कि यह क्यों होता है, लेखकों ने सिंगुलर वैल्यू डिकंपोजिशन (SVD) नामक एक गणितीय उपकरण का उपयोग करके मॉडल के मस्तिष्क के अंदर देखा। मॉडल के ज्ञान को कई सुइयों वाले एक विशाल कंपास (दिशा-सूचक यंत्र) के रूप में सोचें जो अलग-अलग दिशाओं में इशारा कर रहे हैं।

  • सुइयों का आकार (Singular Values): शोधकर्ताओं ने पाया कि प्रशिक्षण के दौरान इन सुइयों की शक्ति (कितना ज्ञान संग्रहीत है) में बहुत कम बदलाव आता है। वे स्थिर रहते हैं।
  • सुइयों की दिशा (Singular Vectors): हालाँकि, सुइयों की दिशा नाटकीय रूप से बदल जाती है।

उपमा:
कल्पive कि मॉडल का ज्ञान एक मानचित्र (map) है।

  • SFT मानचित्र को मिटाता नहीं है (डेटा का आकार समान रहता है), लेकिन यह मानचित्र को घुमा देता है (rotate करता है)। यह कंपास को इस तरह घुमा देता है कि "उत्तर" विशिष्ट पाठ्यपुस्तक उदाहरणों की ओर इशारा करता है, जिससे नए, अलग स्थानों के लिए "उत्तर" खोजना कठिन हो जाता है।
  • RL कंपास को वापस घुमाता है। यह मानचित्र में नई भूमि नहीं जोड़ता; यह केवल कंपास को फिर से संरेखित (re-align) करता है ताकि "उत्तर" फिर से सामान्य तर्क की ओर इशारा करे, जिससे मॉडल को नए क्षेत्रों में नेविगेट करने की अनुमति मिलती है।

सामान्य पाठक के लिए सारांश

  • पुराना विश्वास: "SFT याद करता है, RL सामान्यीकरण करता है।"
  • नई वास्तविकता: "SFT भूल जाता है (अत्यधिक विशिष्ट होकर), और RL पुनर्स्थापित करता है (पुनः संरेखित करके)।"
  • सबक: अपने AI को एक ही विशिष्ट डेटा पर हमेशा के लिए प्रशिक्षित न करें। यह लचीले ढंग से सोचने की अपनी क्षमता खो देगा। यदि आप चाहते हैं कि यह नई चीजों के बारे में स्मार्ट हो, तो आपको "याद करने" के चरण को सही समय पर रोकना होगा और फिर "खेल" के चरण का उपयोग फोकस को ठीक करने के लिए करना होगा, न कि यह उम्मीद करने के लिए कि खेल उसे पूरी तरह से नई कौशल सिखाएगा।

शोध पत्र निष्कर्ष निकालता है कि नई, कठिन समस्याओं को हल करने के लिए सबसे अच्छा प्रदर्शन अक्सर प्रशिक्षण प्रक्रिया के शुरुआती चरण में होता है, और दूसरा चरण (RL) मुख्य रूप से उन गलतियों को सुधारने के लिए है जो हमने पहले चरण में बहुत लंबे समय तक प्रशिक्षण देकर की थीं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →