SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning
यह शोध पत्र प्रदर्शित करता है कि मानक SFT-फिर-RL पाइपलाइन वास्तव में हालिया मिश्रित-नीति (mixed-policy) विधियों से बेहतर प्रदर्शन करती है, जो यह प्रकट करता है कि इसके विपरीत पिछले दावे DeepSpeed और OpenRLHF में विशिष्ट बग्स के कारण उत्पन्न दोषपूर्ण बेसलाइन्स पर आधारित थे।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
"टूटा हुआ स्केल" का रहस्य: क्यों AI गणित विशेषज्ञ वास्तव में उतने बेहतर नहीं थे जितने वे दिख रहे थे
कल्पना कीजिए कि आप एक हाई स्कूल गणित प्रतियोगिता में जज हैं। आपके पास छात्रों के दो समूह हैं:
- "परंपरावादी" (The Traditionalists): वे एक महीने तक पाठ्यपुस्तकों का अध्ययन करते हैं (सुपरवाइज्ड फाइन-ट्यूनिंग) और फिर एक सप्ताह तक एक कोच के साथ कठिन समस्याओं का अभ्यास करते हैं जो उन्हें "सही" या "गलत" बताता है (रीइन्फोर्समेंट लर्निंग)।
- "नवाचारी" (The Innovators): वे एक क्रांतिकारी नई पद्धति का दावा करते हैं जहाँ वे पाठ्यपुस्तकों का अध्ययन और कोच के साथ अभ्यास एक ही समय में करते हैं, दोनों शैलियों को तेजी से सीखने के लिए मिला देते हैं।
पिछले एक साल से, "नवाचारी" हर ट्रॉफी जीत रहे हैं। पूरी AI दुनिया उत्साह से कह रही थी, "नया तरीका बेहतर है! हमें पुराना 'पहले पाठ्यपुस्तक फिर कोच' वाला तरीका छोड़ देना चाहिए!"
लेकिन इस शोध पत्र ने एक चौंकाने वाला सच उजागर किया है: नवाचारी वास्तव में जीत नहीं रहे थे। जज परंपरावादियों को मापने के लिए टूटे हुए स्केल का उपयोग कर रहे थे।
"टूटे हुए स्केल" (बग्स/खामियां)
शोधकर्ताओं ने पाया कि "परंपरावादियों" को उस सॉफ्टवेयर में मौजूद दो बड़े तकनीकी ग्लिच (glitches) द्वारा धोखा दिया जा रहा था जिसका उपयोग AI को प्रशिक्षित करने के लिए किया जाता था।
1. "चयनात्मक स्मृति" का बग (द ऑप्टिमाइज़र बग)
कल्पना कीजिए कि एक छात्र परीक्षा की तैयारी के लिए 10 गणित के सवाल हल कर रहा है। वे एक-एक करके सवाल हल करते हैं और अपनी प्रगति को एक नोटबुक में जोड़ते हैं। लेकिन उनके पेन में एक खराबी के कारण, पेन केवल पहले सवाल को ही लिखता है और बाकी नौ को अनदेखा कर देता है। जब शिक्षक नोटबुक चेक करता है, तो ऐसा लगता है जैसे छात्र ने केवल एक ही चीज़ सीखी है!
AI के संदर्भ में, DeepSpeed नामक एक लोकप्रिय टूल में एक बग के कारण कंप्यूटर "पाठ्यपुस्तक चरण" के दौरान अपने डेटा के अधिकांश हिस्से को "भूल" गया। यह केवल उस छोटे से हिस्से से सीख रहा था जिसे इसे प्रोसेस करना चाहिए था, जिससे AI वास्तव में जितना बुद्धिमान था, उससे कहीं अधिक "मूर्ख" दिखने लगा।
2. "खराब औसत" का बग (द लॉस एग्रीगेशन बग)
कल्पना कीजिए कि एक शिक्षक एक कक्षा का ग्रेड दे रहा है। एक छात्र 2 सवालों के जवाब देता है, और दूसरा 100 के। प्रत्येक छात्र के सही उत्तरों की कुल संख्या देखने के बजाय, शिक्षक प्रत्येक छात्र के प्रदर्शन का औसत लेता है और उन्हें समान रूपв रूप से महत्वपूर्ण मानता है। यह उस छात्र को बहुत कम प्रभावशाली बनाता है जिसने 100 सवाल किए हैं।
OpenRLHF सॉफ्टवेयर में इस बग ने AI को गलत तरीके से सीखने के लिए भारित (weight) किया, जिससे उसके "स्कोर" को और भी नीचे गिरा दिया गया।
बड़ा खुलासा: पुराना तरीका वास्तव में बेहतर है
एक बार जब शोधकर्ताओं ने "स्केल को ठीक कर दिया" (बग्स को ठीक किया), तो परिणाम पूरी तरह बदल गए।
जब "परंपरावादियों" (मानक SFT-फिर-RL विधि) को सही ढंग से मापा गया, तो वे न केवल बराबरी पर आए—उन्होंने प्रतियोगिता को पछाड़ दिया।
- एक मॉडल (Qwen) पर, पुराने तरीके ने "अभिनव" तरीकों को एक बड़े अंतर से हराया।
- दूसरे मॉडल (Llama) पर, पुराना तरीका इतना बेहतर था कि यह लगभग एक पेशेवर गणितज्ञ की तुलना एक छोटे बच्चे से करने जैसा था।
पुराना तरीका बेहतर क्यों काम करता है?
शोधकर्ता इसे एक सरल अवधारणा के साथ समझाते हैं: नींव पहले (Foundation first)।
यदि आप बुनियादी बातें जाने बिना सीधे उच्च-जोखिम वाले कोचिंग सत्र (Reinforcement Learning) में कूदकर गणित सीखने की कोशिश करते हैं, तो आप ज्यादातर समय विफल होंगे। कोच बस "गलत!" कहता रहेगा और आप कुछ भी नहीं सीख पाएंगे।
"पारंपरिक" तरीका पहले ज्ञान की एक ठोस नींव बनाता है (पाठ्यपुस्तक चरण)। जब तक AI कोचिंग चरण शुरू करता है, तब तक वह पर्याप्त चीजें जान चुका होता है ताकि वह कई चीजें सही कर सके, जिससे कोच को बेहतर "सिग्नल" मिलते हैं।
कहानी की सीख
यह शोध पत्र AI उद्योग के लिए एक बड़ी चेतावनी है। यह हमें दो बातें बताता है:
सिर्फ इसलिए यह मान न लें कि कोई "नया" तरीका बेहतर है क्योंकि पुराना तरीका बुरा दिख रहा है। हमेशा जांचें कि क्या "पुराने" तरीके को निष्पक्ष रूप से मापा जा रहा था।
कभी-कभी, सबसे सरल तरीका ही सबसे अच्छा होता है। सीखने के जटिल, "मिश्रित" तरीके आविष्कार करने के बजाय, हमें इस बात पर ध्यान केंद्रित करना चाहिए कि बुनियादी चरणों को—तथ्यों को सीखना, फिर कौशल का अभ्यास करना—पूरी तरह से सही ढंग से किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।