Curriculum Reinforcement Learning from Easy to Hard Tasks Improves LLM Reasoning
यह शोध पत्र E2H Reasoner का प्रस्ताव करता है, जो एक करिकुलम रिइन्फोर्समेंट लर्निंग पद्धति है जो छोटे भाषा मॉडलों की तर्क करने की क्षमताओं को सुधारने के लिए कार्यों को आसान से कठिन के क्रम में निर्धारित करती है, जो मानक RL दृष्टिकोणों की तुलना में सैद्धांतिक अभिसरण गारंटी और बेहतर प्रदर्शन के अनुभवजन्य साक्ष्य दोनों प्रदान करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बच्चे को शतरंज का उस्ताद (मास्टर) बनना सिखाना चाहते हैं।
पुराना तरीका (प्रत्यक्ष शिक्षण - Direct Learning):
आप बच्चे को एक ग्रैंडमास्टर के सामने बिठा देते हैं और कहते हैं, "यह खेल देखो। अब, तुम खेलो।" बच्चा घबरा जाता है। उसे यह भी नहीं पता कि मोहरे कैसे चलते हैं, और दस चालें आगे की योजना बनाना तो दूर की बात है। वह निराश हो जाता है, मनमाने ढंग से चालें चलता है, और कभी भी गहरी रणनीतियों को नहीं सीख पाता क्योंकि "पुरस्कार" (जीतना) बहुत दुर्लभ और दूर की चीज़ है। यही तब होता है जब हम AI मॉडल्स को मानक सुदृढीकरण शिक्षण (Reinforcement Learning - RL) का उपयोग करके एक साथ कठिन समस्याओं (जैसे उन्नत गणित या कोडिंग) को हल करने के लिए प्रशिक्षित करने की कोशिश करते हैं। AI फंस जाता है क्योंकि "सही उत्तर" अपने आप ढूंढना बहुत कठिन होता है।
नया तरीका (E2H Reasoner):
यह पेपर E2H Reasoner (ईजी-टू-हार्ड रीज़नर) नामक एक विधि पेश करता है। यह एक व्यक्तिगत पाठ्यक्रम (Personalized Curriculum) की तरह है। बच्चे को सीधे ग्रैंडमास्टर के खेल में झोंकने के बजाय, आप उन्हें इनसे शुरू करते हैं:
- तुच्छ कार्य (Trivial tasks): "यह एक प्यादा है। इसे एक वर्ग आगे बढ़ाओ।" (AI बुनियादी बातें सीखता है)।
- आसान कार्य (Easy tasks): "अपने घोड़े को प्यादे पर हमला करने के लिए ले जाओ।" (AI सरल चालें सीखता है)।
- मध्यम कार्य (Medium tasks): "शह और मात (checkmate) देने के लिए तीन चालों का क्रम तय करो।" (AI आगे सोचना सीखता है)।
- कठिन कार्य (Hard tasks): अंत में, "एक ग्रैंडमास्टर के खिलाफ पूरा खेल खेलो।"
जादू केवल इस बात में नहीं है कि आप क्या सिखाते हैं, बल्कि इसमें है कि आप इसे कैसे शेड्यूल करते हैं।
असली मंत्र: "धुंधला होता हुआ" शिक्षक (The Fading Teacher)
पेपर ने एक महत्वपूर्ण अंतर्दृष्टि खोजी: आप हमेशा के लिए केवल आसान चीजें नहीं सिखा सकते।
यदि आप AI को केवल "प्यादा चलाओ" जैसे कार्यों का अभ्यास कराते रहते हैं, तो वह प्यादा चलाने में तो बहुत अच्छा हो जाता है लेकिन पूरा खेल खेलना भूल जाता है। वह इनाम पाने के लिए शॉर्टकट लेने लगता है (जैसे उत्तर का अनुमान लगाना), जिसे "रिवॉर्ड हैकिंग" (reward hacking) कहा जाता है।
E2H विधि एक स्मार्ट शेड्यूलर (एक डिजिटल शिक्षक) का उपयोग करती है जो एक धुंधली होती रोशनी (fading spotlight) की तरह काम करता है:
- शुरुआत में: रोशनी आसान कार्यों पर चमकती है। AI आत्मविश्वास बनाता है और बुनियादी नियम सीखता है।
- बीच में: शिक्षक धीरे-धीरे आसान कार्यों पर रोशनी कम करता है और कठिन कार्यों पर रोशनी बढ़ा देता है।
- अंत में: आसान कार्य लगभग समाप्त हो जाते हैं, और AI पूरी तरह से कठिन चुनौतियों पर केंद्रित होता है।
शोधकर्ताओं ने दो प्रकार के "शिक्षकों" (शेड्यूलर्स) का परीक्षण किया:
- कोसाइन टीचर (E2H-C): यह आसान से कठिन की ओर ध्यान को सहजता से और धीरे-धीरे स्थानांतरित करता है, जैसे सूर्यास्त होता है। यह उन विषयों के लिए अच्छा काम करता है जहाँ AI पहले से ही कुछ हद तक सक्षम है (जैसे कुछ गणित की समस्याएं)।
- गौसियन टीचर (E2H-G): यह अधिक आक्रामक है। यह AI को बुनियादी बातों का एक त्वरित क्रैश कोर्स देता है, और फिर तुरंत उसे कठिन कार्यों की ओर धकेल देता है ताकि वह आसान चीजों पर आलसी या अति-आत्मविश्वासी न हो जाए। यह बहुत कठिन नियोजन (planning) कार्यों के लिए बेहतरीन है।
यह क्यों महत्वपूर्ण है (परिणाम)
शोधकर्ताओं ने इसका परीक्षण छोटे AI मॉडल्स पर किया (उन्हें "सुपरकंप्यूटर" की तुलना में "स्मार्ट फोन" मान लें)।
- इस विधि के बिना: छोटा AI कठिन गणित की समस्याओं या जटिल नियोजन खेलों में विफल हो जाएगा। वह बस अनुमान लगाएगा या हार मान लेगा।
- E2H के साथ: छोटे AI ने उन समस्याओं को हल करना सीख लिया जिन्हें वह पहले "बहुत कम बुद्धिमान" समझता था। उसने केवल उत्तरों को रटा नहीं; उसने तर्क के सिद्धांतों (जैसे एक बड़ी समस्या को छोटे चरणों में तोड़ना) को सीखा जिसे वह नई, अनदेखी चुनौतियों पर लागू कर सके।
निचोड़ (The Bottom Line)
इस पेपर को AI के लिए "ट्रेनिंग व्हील्स से रेसिंग बाइक तक" का मार्गदर्शक मानें।
पहले, हम AI को तुरंत रेसिंग बाइक पर बिठाने की कोशिश करते थे। वह गिर जाता और घायल हो जाता। यह पेपर कहता है, "नहीं, आइए ट्रेनिंग व्हील्स (आसान कार्य) से शुरू करें, फिर एक बैलेंस बाइक (मध्यम कार्य) पर स्विच करें, और अंत में ट्रेनिंग व्हील्स को पूरी तरह हटा दें (कठिन कार्य)।"
कठिनाई को सावधानीपूर्वक नियंत्रित करके और यह जानकर कि आसान चीजों के साथ मदद कब रोकनी है, हम छोटे और साधारण AI मॉडल्स को भी जीनियस की तरह सोचना सिखा सकते हैं। यह AI को बड़ा बनाने के बारे में नहीं है; यह उसे बेहतर सिखाने के बारे में है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।