← नवीनतम पेपर
🤖 machine learning

Stage-1 Controls the Entropy Regime, Not the Outcome

यह अध्ययन प्रदर्शित करता है कि जबकि स्टेज-1 वॉर्म-स्टार्ट विधियाँ (SFT बनाम OPD) विज़न-लैंग्वेज मॉडल्स के प्रारंभिक एंट्रॉपी रिजीम और उत्तर विविधता को महत्वपूर्ण रूप से प्रभावित करती हैं, वे स्टेज-2 सुदृढीकरण लर्निंग (reinforcement learning) के बाद अंतिम इन-डोमेन प्रदर्शन को पर्याप्त रूप से नहीं बदलती हैं या कोई स्पष्ट डाउनस्ट्रीम लाभ प्रदान नहीं करती हैं।

मूल लेखक: Jianxiong Shen

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianxiong Shen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक स्मार्ट रोबोट (एक विजन-लैंग्वेज मॉडल) को जटिल ज्यामिति (geometry) की पहेलियाँ हल करने के लिए प्रशिक्षित कर रहे हैं। यह शोध पत्र इस बात की जांच करता है कि एक उच्च-जोखिम वाले प्रशिक्षण शिविर जिसे रीइन्फोर्समेंट लर्निंग (RL) कहा जाता है, उसमें भेजने से पहले रोबोट को "वॉर्म अप" करने का सबसे अच्छा तरीका क्या है।

रोबोट को वॉर्म अप करने के दो मुख्य तरीके हैं:

  1. SFT (सुपरवाइज्ड फाइन-ट्यूनिंग): आप रोबोट को एक बहुत ही बुद्धिमान शिक्षक द्वारा लिखे गए सटीक उत्तरों की एक पाठ्यपुस्तक दिखाते हैं और कहते हैं, "इन्हें बिल्कुल वैसे ही याद करो।"
  2. OPD (ऑन-पॉलिसी डिस्टिलेशन): आप रोबोट को खुद समस्याओं को हल करने की कोशिश करने देते हैं, लेकिन जब भी वह अटक जाता है या कोई गलती करता है, तो सुपर-स्मार्ट शिक्षक उसे सही अगला कदम धीरे से बताता है। रोबोट केवल अंतिम उत्तर नहीं, बल्कि शिक्षक की प्रक्रिया की नकल करके सीखता है।

शोधकर्ता जानना चाहते थे कि: क्या हमारे द्वारा रोबोट को वॉर्म अप करने के तरीके से अंतिम परिणाम बदल जाता है?

यहाँ उनके निष्कर्षों का विवरण दिया गया है, जो सरल उपमाओं (analogies) का उपयोग करता है:

1. "अंतिम स्कोर" आश्चर्यजनक रूप से समान है

सोचिए कि अंतिम परीक्षा (ज्यामिति की समस्याओं को हल करना) एक दौड़ की तरह है। शोधकर्ताओं ने तीन अलग-अलग वॉर्म-अप विधियों का परीक्षण किया।

  • निष्कर्ष: चाहे उन्होंने कौन सा भी वॉर्म-अप इस्तेमाल किया हो, रोबोट दौड़ में लगभग एक ही स्थान (लगभग 53-54% सटीकता) पर समाप्त हुआ।
  • उपमा: यह एक ट्रैक पर तीन अलग-अलग धावकों के थोड़ा अलग स्थान से शुरू करने जैसा है। जब तक वे फिनिश लाइन तक पहुँचते हैं, वे सभी एक छोटे से समूह में एक साथ आ जाते हैं। वॉर्म-अप ने किसी को भी ऐसा बड़ा फायदा नहीं दिया जो अंत तक बना रहे।

2. "भूलने" का मिथक

कुछ लोग चिंतित रहते हैं कि यदि आप रोबोट को बहुत अधिक विशिष्ट गणित सिखाते हैं (SFT), तो वह अन्य चीजें (जैसे सामान्य गणित पहेलियाँ) करना भूल जाएगा।

  • निष्कर्ष: यह केवल तभी हुआ जब आपने रोबोट को बहुत लंबे समय तक या गलत निर्देशों के साथ प्रशिक्षित किया। यदि आप सही समय पर प्रशिक्षण रोक देते, तो रोबलेट कुछ भी नहीं भूलता।
  • उपमा: यह इतिहास की किसी विशेष परीक्षा के लिए अध्ययन करने जैसा है। यदि आप 10 घंटे तक रटते हैं, तो आप शायद अपना नाम भी भूल जाएं। लेकिन यदि आप केवल 1 घंटा अध्ययन करते हैं, तो आपको परीक्षा भी याद रहती है और अपना नाम भी। समस्या अध्ययन करने के तरीके में नहीं थी; समस्या बहुत लंबे समय तक अध्ययन करने में थी।

3. वास्तविक अंतर: "एंट्रॉपी" (रोबोट का मूड)

यह इस शोध पत्र की सबसे बड़ी खोज है। जबकि अंतिम स्कोर समान थे, रोबोटों की आंतरिक स्थिति बहुत अलग थी।

  • SFT रोबोट: ये बहुत आत्मविश्वासी और कठोर बन गए। उन्हें उत्तर पता था और वे उस पर अडिग रहे। उनकी "एंट्रॉपी" (विचारों की विविधता या यादृच्छिकता का एक माप) बहुत कम थी। वे एक ऐसे रोबोट की तरह थे जो कहता है, "मुझे पता है कि उत्तर 4 है, और मैं कभी 5 नहीं कहूँगा।"
  • OPD रोबोट: ये जिज्ञासु और विविध बने रहे। उन्होंने कई अलग-अलग संभावनाओं को ध्यान में रखा। उनकी "एंट्रॉपी" बहुत अधिक थी। वे एक ऐसे रोबोट की तरह थे जो कहता है, "उत्तर शायद 4 है, लेकिन 5 या 6 भी संभव है।"
  • उपमा: एक शेफ (रसोइया) की कल्पना करें।
    • SFT शेफ एक ऐसा रोबोट है जो केवल एक विशिष्ट रेसिपी को पूरी तरह से बनाना जानता है।
    • OPD शेफ एक ऐसा रोबोट है जो मुख्य रेसिपी तो जानता ही है, लेकिन उसे शिक्षक की "शायद थोड़ा नमक डालें" या "शायद थोड़ा मसाला जोड़ें" जैसी बातें भी याद हैं। OPD शेफ के पास विचारों का एक विस्तृत मेनू है।

4. क्या "जिज्ञासु" होना मदद करता है?

शोधकर्ताओं ने पूछा: "क्या उस अतिरिक्त विविधता (उच्च एंट्रॉपी) से रोबोट को अधिक समस्याएं हल करने में मदद मिलती है?"

  • शुरुआत में (अंतिम प्रशिक्षण से पहले): हाँ! OPD रोबोट (जिज्ञासु वाला) यदि आप उसे 16 प्रयास देते हैं, तो कई अलग-अलग सही उत्तर उत्पन्न कर सकता है। वह विकल्पों को खोजने में बेहतर था।
  • अंतिम प्रशिक्षण के बाद (RL): नहीं। एक बार जब रोबोट उच्च-जोखिम वाले प्रशिक्षण शिविर से गुजर गया, तो वह शुरुआती जिज्ञासा गायब हो गई। कठोर SFT रोबोट और जिज्ञासु OPD रोबोट दोनों ने अंततः समान संख्या में समस्याएं हल कीं।
  • नई पहेलियों पर (आउट-ऑफ-डोमेन): जिज्ञासा ने रोबोट को गणित के नए प्रकार की समस्याओं को हल करने में भी मदद नहीं की। लाभ पूरी तरह से समाप्त हो गया।

निचोड़ (The Bottom Line)

यह शोध पत्र निष्कर्ष निकालता है कि वॉर्म-अप का चुनाव एक सख्त ड्रिल सार्जेंट और एक लचीले कोच के बीच चयन करने जैसा है।

  • यह क्या नियंत्रित करता है: यह रोबोट के "व्यक्तित्व" (उसके सोचने के तरीके की कठोरता या लचीलापन) को शुरुआती चरणों के दौरान नियंत्रित करता है।
  • यह क्या नियंत्रित नहीं करता है: यह गारंटी नहीं देता कि अंतिम स्कोर बेहतर होगा या नई, अनदेखी समस्याओं पर प्रदर्शन बेहतर होगा।

सीख: यदि आप चाहते हैं कि रोबोट अभी अधिक विविधता के साथ सोचे, तो लचीले कोच (OPD) का उपयोग करें। लेकिन यह उम्मीद न करें कि यह विविधता आपके रोबोट के प्रशिक्षण पूरा होने के बाद स्वचालित रूप से उच्च अंतिम स्कोर में बदल जाएगी। "वॉर्म-अप" मूड सेट करता है, लेकिन "प्रशिक्षण शिविर" (RL) ही वास्तव में अंतिम परिणाम निर्धारित करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →