← नवीनतम पेपर
💻 computer science

SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR

यह शोध पत्र यह प्रदर्शित करता है कि अत्यधिक सुपरवाइज्ड फाइन-ट्यूनिंग (SFT) रोलआउट वितरण को संकुचित कर सकती है, जिससे एंट्रॉपी कोलैप्स (entropy collapse) होता है जो ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइज़ेशन (GRPO) प्रशिक्षण में रैंक इनवर्जन और प्रदर्शन में गिरावट का कारण बनता है, एक ऐसा विफलता मोड जिसे प्री-आरएल (pre-RL) एंट्रॉपी और प्रारंभिक GRPO डायनेमिक्स की निगरानी करके अनुमानित और कम किया जा सकता है।

मूल लेखक: Siddharth Aphale, Kelly Liu

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siddharth Aphale, Kelly Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य विचार: "बहुत अधिक पूर्णता" का जाल (The "Too Perfect" Trap)

कल्पना कीजिए कि आप एक रोबोट को कोड लिखना सिखा रहे हैं। मानक रेसिपी में दो चरण होते हैं:

  1. सुपरवाइज्ड फाइन-ट्यूनिंग (SFT): आप रोबोट को सही कोड के हजारों उदाहरण दिखाते हैं ताकि वह पैटर्न सीख सके।
  2. रीइन्फोर्समेंट लर्निंग (RL): आप रोबोट को अपने आप नई समस्याओं को हल करने देते हैं। यदि वह सही करता है, तो उसे एक इनाम (रिवॉर्ड) मिलता है; यदि वह विफल होता है, तो उसे कुछ नहीं मिलता।

समस्या: शोध में पाया गया कि यदि आप चरण 1 में रोबोट को बहुत अधिक प्रशिक्षित करते हैं (चरण 1 ओवरट्रेनिंग), तो यह वास्तव में चरण 2 में बदतर हो जाता है।

आमतौर पर, हम सोचते हैं, "चरण 1 में रोबोट जितने अधिक उदाहरण याद करेगा, वह उतना ही बेहतर होगा।" लेखकों ने इसके विपरीत खोजा: चरण 1 में जो रोबोट सबसे अधिक याद करता है, वह चरण 2 में सबसे खराब प्रदर्शन करता है। वास्तव में, वह रोबोट जिसने सबसे कम याद किया, अंत में विजेता बनता है।

रूपक: सख्त डांसर बनाम लचीला डांसर (The Stiff Dancer vs. The Flexible Dancer)

यह समझने के लिए कि ऐसा क्यों होता है, दो डांसरों की कल्पना करें जो एक प्रतियोगिता की तैयारी कर रहे हैं जहाँ उन्हें रैंडम संगीत के आधार पर एक रूटीन बनाना है।

  • "ओवरट्रेन्ड" डांसर (Deep SFT): इस डांसर ने एक ही 10 परफेक्ट रूटीन का हजारों बार अभ्यास किया है। वे अविश्वसनीय रूप से सटीक हैं। लेकिन जब संगीत बदलता है, तो वे जम जाते हैं। वे केवल उन्हीं 10 मूव्स को जानते हैं। उन्हें किसी अन्य तरीके से हिलने-डुलने का कोई अंदाजा नहीं है।
  • "बिल्कुल सही" डांसर (Shallow SFT): इस डांसर ने बुनियादी बातों का अभ्यास किया लेकिन अपने शरीर को ढीला और लचीला रखा। वे नियमों को जानते हैं, लेकिन वे अभी भी संगीत बदलने पर हिल-डुल सकते हैं और नए प्रयोग कर सकते हैं।

प्रतियोगिता (RL):
प्रतियोगिता में डांसरों को यह देखने के लिए एक साथ कई अलग-अलग मूव्स आज़माने की आवश्यकता होती है कि कौन सा सबसे अच्छा काम करता है।

  • ओवरट्रेन्ड डांसर हर बार बिल्कुल वही परफेक्ट मूव करने की कोशिश करता है। चूंकि वे सभी एक जैसे दिखते हैं, इसलिए जज (एल्गोरिदम) यह नहीं बता पाते कि कौन सा मूव बेहतर है। डांसर फंस जाता है और कुछ नया नहीं सीख पाता।
  • लचीला डांसर कई तरह के मूव्स आज़माता है। जज देख सकते हैं, "आह, यह मूव काम कर गया, वह नहीं किया!" और डांसर तेजी से सीखता है।

तकनीकी कारण: एंट्रॉपी कोलैप्स (Entropy Collapse)

पेपर "विविधता" या "लचीलेपन" के लिए एक फैंसी शब्द का उपयोग करता है: एंट्रॉपी (Entropy)

  1. एंट्रॉपी कोलैप्स: जब रोबोट को ओवरट्रेन किया जाता है, तो उसका "मन" बहुत संकीर्ण हो जाता है। वह विभिन्न संभावनाओं को तलाशना बंद कर देता है और बस उन्हीं कुछ उत्तरों को दोहराता रहता है। पेपर की भाषा में, उसकी एंट्रॉपी कोलैप्स (घट) हो जाती है।
  2. सिग्नल मर जाता है: सीखने का एल्गोरिदम (जिसे GR_PO कहा जाता है) अलग-अलग उत्तरों की तुलना करके काम करता है। यदि रोबोट लगातार 8 बार एक ही उत्तर देता है, तो एल्गोरिदम भ्रमित हो जाता है। वह सुधार के लिए "ग्रेडिएंट" (एक दिशा) की गणना नहीं कर सकता क्योंकि तुलना करने के लिए कोई अंतर ही नहीं है। यह कार चलाने जैसा है जब स्टीयरिंग व्हील सीधा लॉक हो जाए।
  3. रैंक इनवर्जन (Rank Inversion): यह एक अजीब परिणाम की ओर ले जाता है जिसे रैंक इनवर्जन कहा जाता है।
    • दूसरे प्रशिक्षण चरण से पहले, ओवरट्रेन्ड रोबोट एक जीनियस की तरह दिखता है (वह प्रैक्टिस टेस्ट पर 100% सही उत्तर देता है)।
    • दूसरे प्रशिक्षण चरण के बाद, वह एक आपदा बन जाता है।
    • इस बीच, "कम पूर्ण" दिखने वाला रोबोट सुपरस्टार बन जाता है।

दो मॉडल: दो शहरों की कहानी (A Tale of Two Cities)

लेखकों ने इसे दो अलग-अलग रोबोट दिमागों (मॉडल्स) पर परखा:

  1. Qwen (पीड़ित): यह मॉडल इस जाल में फंस गया। उन्होंने इसे चरण 1 में जितना अधिक प्रशिक्षित किया, यह उतना ही सख्त होता गया। "सबसे अच्छा" दिखने वाला चेकपॉइंट (उच्चतम स्कोर) अगले चरण के लिए सबसे खराब शुरुआती बिंदु साबित हुआ।
  2. DeepSeek (सर्वाइवर): यह मॉडल स्वाभाविक रूप से अधिक लचीला था। भारी प्रशिक्षण के बाद भी, यह सख्त नहीं हुआ। यह "सुरक्षित क्षेत्र" में बना रहा जहाँ यह अभी भी सीख सकता था। इसने साबित किया कि समस्या दूसरे प्रशिक्षण चरण में नहीं थी, बल्कि विशेष रूप से इस बात में थी कि पहले चरण ने Qwen के लचीलेपन को कैसे बिगाड़ दिया।

समाधान: दो-चरणीय चेकअप (A Two-Step Checkup)

लेखकों ने केवल समस्या ही नहीं खोजी; उन्होंने इसे समय और पैसा बर्बाद करने से पहले पहचानने के लिए एक डायग्नोस्टिक टूल बनाया।

  • चरण 1: "स्ट्रेच" टेस्ट (Pre-RL Entropy): दूसरे प्रशिक्षण चरण को शुरू करने से पहले, वे देखते हैं कि रोबोट का मन कितना "ढीला" है। यदि रोबोट बहुत कठोर (लो एंट्रॉपी) है, तो वे इसे उच्च जोखिम के रूप में चिह्नित करते हैं।
  • चरण 2: "अर्ली वार्निंग" मॉनिटर: यदि वे दूसरा चरण शुरू करते हैं, तो वे पहले कुछ मिनटों पर नज़र रखते हैं। यदि रोबमा रोबोट नई चीजें आज़माना बंद कर देता है और तुरंत खुद को दोहराने लगता है, तो वे संसाधनों को बचाने के लिए प्रशिक्षण को जल्दी रोक देते हैं।

क्या काम नहीं आया?

लेखकों ने मानक ट्रिक्स के साथ टूटे हुए रोबोट को ठीक करने की कोशिश की, जैसे:

  • पेनल्टी जोड़ना: "अपने मूल प्रशिक्षण से बहुत अधिक विचलित न हों।" (इसने स्थिति को और खराब कर दिया)।
  • लेबल को स्मूथ करना: "अपने उत्तरों के बारे में थोड़ा कम निश्चित रहें।" (इससे रोबोट फिर से आत्मविश्वासी दिखने लगा, लेकिन वह प्रतियोगिता में फिर भी विफल रहा)।

निष्कर्ष: आप एक सख्त डांसर को प्रतियोगिता के दौरान "अधिक मेहनत करने" के लिए कहकर ठीक नहीं कर सकते। आपको उन्हें पहले से ही इतनी कठोरता से प्रशिक्षित करना बंद करना होगा। यह पेपर सिद्ध करता है कि जब आप चाहते हैं कि एक मॉडल सीखते रहे, तो पूर्णता से अधिक विविधता (एंट्रॉपी) महत्वपूर्ण है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →