← नवीनतम पेपर
💻 computer science

Reconciling Contradictory Views on the Effectiveness of SFT in LLMs: An Interaction Perspective

यह शोध पत्र बड़े भाषा मॉडलों (LLMs) पर सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) की असंगत प्रभावशीलता को समझाने के लिए एक इंटरैक्शन-आधारित परिप्रेक्ष्य प्रस्तावित करता है, जो यह प्रकट करता है कि SFT शुरुआत में शोर जैसे इंटरैक्शन (noise-like interactions) को हटा देता है लेकिन यदि प्रशिक्षण एक संक्षिप्त डिनोइजिंग चरण के बाद भी जारी रहता है, तो यह जल्दी ही ओवरफिटेड इंटरैक्शन की ओर ले जाता है।

मूल लेखक: Junpeng Zhang, Lei Cheng, Guoxi Zhang, Hua Cai, Qing Xu, Quanshi Zhang

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junpeng Zhang, Lei Cheng, Guoxi Zhang, Hua Cai, Qing Xu, Quanshi Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य प्रश्न: "अभ्यास" कभी-कभी AI को खराब क्यों कर देता है?

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली छात्र (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसने पहले ही मानव ज्ञान के पूरे पुस्तकालय को पढ़ लिया है। वे बुद्धिमान हैं, लेकिन कभी-कभी भ्रमित करने वाले तरीके से बोलते हैं या अजीब शब्दावली का उपयोग करते हैं।

इसे ठीक करने के लिए, शिक्षक उन्हें सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) देते हैं। यह उस छात्र को "सही" उत्तरों की एक विशिष्ट कार्यपुस्तिका (workbook) देने जैसा है और यह कहना है, "इन उदाहरणों का अभ्यास करो ताकि तुम एक सहायक असिस्टेंट की तरह बात कर सको।"

विरोधाभास:

  • छोटे छात्रों के लिए: यह अभ्यास चमत्कार करता है। वे तुरंत बेहतर हो जाते हैं।
  • प्रतिभाशाली छात्र (LLM) के लिए: कभी-कभी, यह अभ्यास बहुत अच्छा काम करता है। लेकिन अन्य समय में, यह उन्हें खराब बना देता है। वे कार्यपुस्तिका को बहुत अधिक बारीकी से रटने लगते हैं, असली लोगों से बात करना भूल जाते हैं, या यहाँ तक कि तथ्य भी मनगढ़ंत (hallucinate) बताने लगते हैं।

पेपर का लक्ष्य:
शोधकर्ताओं ने यह पता लगाने की कोशिश की कि ऐसा क्यों होता है। उन्होंने केवल अंतिम टेस्ट स्कोर को नहीं देखा; उन्होंने छात्र के मस्तिष्क के अंदर झाँका यह देखने के लिए कि अभ्यास करते समय क्या बदल रहा था।


उपकरण: "शब्दों की अंतःक्रिया" (Word Interactions) लेगो ब्लॉक्स के रूप में

AI के मस्तिष्क के भीतर झाँकने के लिए, शोधकर्ताओं ने इंटरैक्शन एनालिसिस नामक एक विशेष उपकरण का उपयोग किया।

AI के मस्तिष्क को एक ब्लैक बॉक्स के रूप में नहीं, बल्कि लेगो निर्देशों (Lego instructions) के एक विशाल सेट के रूप में सोचें।

  • सरल निर्देश: "यदि मैं 'आग' शब्द देखता हूँ, तो मुझे शायद 'गर्म' कहना चाहिए।" (यह एक सरल, विश्वसनीय अंतःक्रिया है)।
  • जटिल, उलझे हुए निर्देश: "यदि मैं 'आग' AND 'लाल' AND 'आकाश' AND 'बादल' AND 'शायद' AND 'कल' देखता हूँ..." (यह एक जटिल, उलझी हुई अंतःक्रिया है)।

शोधकर्ताओं ने पाया कि AI का आउटपुट वास्तव में इन लेगो निर्देशों का योग है। कुछ निर्देश मददगार (विश्वसनीय) होते हैं, और कुछ केवल शोर (शोर/noise) होते हैं (भ्रमित करने वाले या एक-दूसरे को रद्द करने वाले)।


खोज: "डिनोइजिंग" (Denoising) बनाम "ओवरफिटिंग" (Overfitting) का नृत्य

शोधकर्ताओं ने चरण-दर-चरण AI का अभ्यास देखा और पाया कि यह प्रक्रिया दो बहुत अलग चरणों में होती है, जैसे सफाई का एक छोटा सा विस्फोट और उसके बाद गड़बड़ करने की एक लंबी अवधि।

चरण 1: "स्प्रिंग क्लीनिंग" (अच्छा हिस्सा)

अवधि: अत्यंत संक्षिप्त (प्रशिक्षण के केवल पहले कुछ सौ चरण)।

कल्पte कीजिए कि AI का मस्तिष्क पुराने, टूटे हुए खिलौनों से भरा एक अस्त-व्यस्त कमरा है जो आपस में फिट नहीं होते।

  • क्या होता है: जैसे ही AI अभ्यास शुरू करता है, वह तुरंत टूटे हुए खिलौनों को बाहर फेंक देता है।
  • विज्ञान: AI तेजी से "शोर जैसी अंतःक्रियाओं" (noise-like interactions) को हटा देता है। ये वे जटिल, भ्रमित करने वाले निर्देश हैं जहाँ सकारात्मक और नकारात्मक प्रभाव एक-दूसरे को रद्द कर देते हैं (जैसे, एक नियम कहता है "बाएं जाओ," दूसरा कहता "दाएं जाओ")।
  • परिणाम: कमरा बहुत साफ हो जाता है। AI केवल सरल, विश्वसनीय निर्देशों को रखता है (जैसे "आग = गर्म")। यही कारण है कि शुरुआत में AI के प्रदर्शन में अक्सर तेजी से उछाल आता है।

चरण 2: "ओवर-डेकोरेटिंग" (बुरा हिस्सा)

अवधि: प्रशिक्षण का बाकी हिस्सा (लंबी अवधि)।

एक बार जब कमरा साफ हो जाता है, तो AI अभ्यास जारी रखता है। लेकिन नए, उपयोगी नियम सीखने के बजाय, यह ओवर-डेकोरेटिंग करने लगता है।

  • क्या होता है: AI नए, अत्यधिक जटिल नियम बनाने लगता है जो केवल विशिष्ट अभ्यास पुस्तिका के लिए काम करते हैं, वास्तविक दुनिया के लिए नहीं।
  • विज्ञान: AI "ओवरफिटेड इंटरैक्शंस" (overfitted interactions) सीखना शुरू कर देता है। ये उच्च-जटिलता वाले पैटर्न हैं जो ऐसे दिखते हैं जैसे वे समझ में आ रहे हों, लेकिन वास्तव में वे केवल प्रशिक्षण डेटा के विशिष्ट उदाहरणों को रट रहे होते हैं। वे नाजुक होते हैं और सामान्य रूप से लागू नहीं होते।
  • परिणाम: AI एक सामान्य असिस्टेंट होने का "भूलने" लगता है और एक ऐसा रोबोट बन जाता है जिसे केवल विशिष्ट कार्यपुस्तिका का ज्ञान है। यही कारण है कि यदि आप बहुत लंबे समय तक प्रशिक्षण देते हैं, तो प्रदर्शन गिर सकता है या असंगत हो सकता है।

मुख्य निष्कर्ष

  1. "स्वीट स्पॉट" (Sweet Spot) बहुत छोटा है: पेपर का दावा है कि AI वास्तव में कुछ वास्तव में उपयोगी (शोर को हटाकर) सीखने का एकमात्र समय वही बहुत पहला, संक्षिप्त क्षण है।
  2. अधिक डेटा हमेशा बेहतर नहीं होता: यदि आप उस संक्षिप्त सफाई चरण के बाद AI को प्रशिक्षित करना जारी रखते हैं, तो आप उसे स्मार्ट नहीं बना रहे हैं; आप बस उसे प्रशिक्षण डेटा को बहुत अधिक बारीकी से रटने के लिए सिखा रहे हैं (ओवरफिटिंग)।
  3. "बैकबोन" (Backbone) पहले से ही मौजूद है: प्रश्नों के उत्तर देने के लिए AI द्वारा उपयोग किए जाने वाले सबसे विश्वसनीय नियम अभ्यास शुरू करने से पहले ही उसके अंदर थे। फाइन-ट्यूनिंग ने मुख्य रूप से AI को भ्रमित करने वाले, टूटे हुए नियमों का उपयोग करने से रोकने में मदद की। इसने नया मस्तिष्क नहीं बनाया; इसने बस पुराने को साफ किया।

व्यावहारिक सलाह (अर्ली स्टॉपिंग - Early Stopping)

यह पेपर AI को प्रशिक्षित करने का एक नया तरीका सुझाता है: जल्दी रुकें (Stop early)।

AI को विशाल डेटासेट पर दिनों तक प्रशिक्षित करने के बजाय, आपको इन "लेगो निर्देशों" की निगरानी करनी चाहिए। जैसे ही AI "टूटे हुए खिलौने" (शोर) फेंकना बंद कर देता है और नए, अजीब सजावट (ओवरफिटिंग) उठाना शुरू कर देता है, आपको स्टॉप बटन दबा देना चाहिए।

संक्षेप में: पेपर का तर्क है कि लार्ज लैंग्वेज मॉडल्स के लिए, "कम ही अधिक है" (less is more)। थोड़ा सा अभ्यास गंदगी को साफ कर देता है, लेकिन बहुत अधिक अभ्यास एक नया, अधिक जटिल कचरा पैदा कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →