← नवीनतम पेपर
🤖 machine learning

SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning

यह शोध पत्र प्रदर्शित करता है कि मानक SFT-फिर-RL पाइपलाइन वास्तव में हालिया मिश्रित-नीति (mixed-policy) विधियों से बेहतर प्रदर्शन करती है, जो यह प्रकट करता है कि इसके विपरीत पिछले दावे DeepSpeed और OpenRLHF में विशिष्ट बग्स के कारण उत्पन्न दोषपूर्ण बेसलाइन्स पर आधारित थे।

मूल लेखक: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Alexis Limozin, Eduard Durech, Torsten Hoefler, Imanol Schlag, Valentina Pyatkin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

"टूटा हुआ स्केल" का रहस्य: क्यों AI गणित विशेषज्ञ वास्तव में उतने बेहतर नहीं थे जितने वे दिख रहे थे

कल्पना कीजिए कि आप एक हाई स्कूल गणित प्रतियोगिता में जज हैं। आपके पास छात्रों के दो समूह हैं:

  1. "परंपरावादी" (The Traditionalists): वे एक महीने तक पाठ्यपुस्तकों का अध्ययन करते हैं (सुपरवाइज्ड फाइन-ट्यूनिंग) और फिर एक सप्ताह तक एक कोच के साथ कठिन समस्याओं का अभ्यास करते हैं जो उन्हें "सही" या "गलत" बताता है (रीइन्फोर्समेंट लर्निंग)।
  2. "नवाचारी" (The Innovators): वे एक क्रांतिकारी नई पद्धति का दावा करते हैं जहाँ वे पाठ्यपुस्तकों का अध्ययन और कोच के साथ अभ्यास एक ही समय में करते हैं, दोनों शैलियों को तेजी से सीखने के लिए मिला देते हैं।

पिछले एक साल से, "नवाचारी" हर ट्रॉफी जीत रहे हैं। पूरी AI दुनिया उत्साह से कह रही थी, "नया तरीका बेहतर है! हमें पुराना 'पहले पाठ्यपुस्तक फिर कोच' वाला तरीका छोड़ देना चाहिए!"

लेकिन इस शोध पत्र ने एक चौंकाने वाला सच उजागर किया है: नवाचारी वास्तव में जीत नहीं रहे थे। जज परंपरावादियों को मापने के लिए टूटे हुए स्केल का उपयोग कर रहे थे।


"टूटे हुए स्केल" (बग्स/खामियां)

शोधकर्ताओं ने पाया कि "परंपरावादियों" को उस सॉफ्टवेयर में मौजूद दो बड़े तकनीकी ग्लिच (glitches) द्वारा धोखा दिया जा रहा था जिसका उपयोग AI को प्रशिक्षित करने के लिए किया जाता था।

1. "चयनात्मक स्मृति" का बग (द ऑप्टिमाइज़र बग)

कल्पना कीजिए कि एक छात्र परीक्षा की तैयारी के लिए 10 गणित के सवाल हल कर रहा है। वे एक-एक करके सवाल हल करते हैं और अपनी प्रगति को एक नोटबुक में जोड़ते हैं। लेकिन उनके पेन में एक खराबी के कारण, पेन केवल पहले सवाल को ही लिखता है और बाकी नौ को अनदेखा कर देता है। जब शिक्षक नोटबुक चेक करता है, तो ऐसा लगता है जैसे छात्र ने केवल एक ही चीज़ सीखी है!

AI के संदर्भ में, DeepSpeed नामक एक लोकप्रिय टूल में एक बग के कारण कंप्यूटर "पाठ्यपुस्तक चरण" के दौरान अपने डेटा के अधिकांश हिस्से को "भूल" गया। यह केवल उस छोटे से हिस्से से सीख रहा था जिसे इसे प्रोसेस करना चाहिए था, जिससे AI वास्तव में जितना बुद्धिमान था, उससे कहीं अधिक "मूर्ख" दिखने लगा।

2. "खराब औसत" का बग (द लॉस एग्रीगेशन बग)

कल्पना कीजिए कि एक शिक्षक एक कक्षा का ग्रेड दे रहा है। एक छात्र 2 सवालों के जवाब देता है, और दूसरा 100 के। प्रत्येक छात्र के सही उत्तरों की कुल संख्या देखने के बजाय, शिक्षक प्रत्येक छात्र के प्रदर्शन का औसत लेता है और उन्हें समान रूपв रूप से महत्वपूर्ण मानता है। यह उस छात्र को बहुत कम प्रभावशाली बनाता है जिसने 100 सवाल किए हैं।

OpenRLHF सॉफ्टवेयर में इस बग ने AI को गलत तरीके से सीखने के लिए भारित (weight) किया, जिससे उसके "स्कोर" को और भी नीचे गिरा दिया गया।


बड़ा खुलासा: पुराना तरीका वास्तव में बेहतर है

एक बार जब शोधकर्ताओं ने "स्केल को ठीक कर दिया" (बग्स को ठीक किया), तो परिणाम पूरी तरह बदल गए।

जब "परंपरावादियों" (मानक SFT-फिर-RL विधि) को सही ढंग से मापा गया, तो वे न केवल बराबरी पर आए—उन्होंने प्रतियोगिता को पछाड़ दिया।

  • एक मॉडल (Qwen) पर, पुराने तरीके ने "अभिनव" तरीकों को एक बड़े अंतर से हराया।
  • दूसरे मॉडल (Llama) पर, पुराना तरीका इतना बेहतर था कि यह लगभग एक पेशेवर गणितज्ञ की तुलना एक छोटे बच्चे से करने जैसा था।

पुराना तरीका बेहतर क्यों काम करता है?
शोधकर्ता इसे एक सरल अवधारणा के साथ समझाते हैं: नींव पहले (Foundation first)।

यदि आप बुनियादी बातें जाने बिना सीधे उच्च-जोखिम वाले कोचिंग सत्र (Reinforcement Learning) में कूदकर गणित सीखने की कोशिश करते हैं, तो आप ज्यादातर समय विफल होंगे। कोच बस "गलत!" कहता रहेगा और आप कुछ भी नहीं सीख पाएंगे।

"पारंपरिक" तरीका पहले ज्ञान की एक ठोस नींव बनाता है (पाठ्यपुस्तक चरण)। जब तक AI कोचिंग चरण शुरू करता है, तब तक वह पर्याप्त चीजें जान चुका होता है ताकि वह कई चीजें सही कर सके, जिससे कोच को बेहतर "सिग्नल" मिलते हैं।

कहानी की सीख

यह शोध पत्र AI उद्योग के लिए एक बड़ी चेतावनी है। यह हमें दो बातें बताता है:

  1. सिर्फ इसलिए यह मान न लें कि कोई "नया" तरीका बेहतर है क्योंकि पुराना तरीका बुरा दिख रहा है। हमेशा जांचें कि क्या "पुराने" तरीके को निष्पक्ष रूप से मापा जा रहा था।

  2. कभी-कभी, सबसे सरल तरीका ही सबसे अच्छा होता है। सीखने के जटिल, "मिश्रित" तरीके आविष्कार करने के बजाय, हमें इस बात पर ध्यान केंद्रित करना चाहिए कि बुनियादी चरणों को—तथ्यों को सीखना, फिर कौशल का अभ्यास करना—पूरी तरह से सही ढंग से किया जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →