Instruction-Conditioned Exploration with Asymmetric Reinforcement Learning and Self-Distillation
यह शोध पत्र गणितीय तर्क कार्यों में महत्वपूर्ण प्रदर्शन लाभ प्राप्त करने के लिए, LLM अन्वेषण को बढ़ाने और विविध व्यवहारों को टेस्ट-टाइम पॉलिसी में स्थानांतरित करने हेतु असिमेट्रिक रीइन्फोर्समेंट लर्निंग और सेल्फ-डिस्टिलेशन उद्देश्य के साथ इंस्ट्रक्शन-कंडीशन्ड एक्सप्लोरेशन (ICE) का प्रस्ताव करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को एक कठिन पहेली सुलझाना सिखाने की कोशिश कर रहे हैं। आपके पास एक शक्तिशाली उपकरण है जिसे "रीइन्फोर्समेंट लर्निंग" (RL) कहा जाता है, जो एक वीडियो गेम कोच की तरह है। रोबोट एक चाल चलता है, उसे "अच्छा काम किया!" या "फिर से कोशिश करो" का संकेत मिलता है, और धीरे-धीरे जीतना सीख जाता है। लेकिन यहाँ एक पेच है—लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया में—जो टेक्स्ट लिखते हैं और गणित की समस्याओं को हल करते हैं—"चालें" केवल "कूदना" या "गोली चलाना" जैसे सरल बटन नहीं हैं। यहाँ चुनने के लिए हजारों शब्द हैं।
यदि आप रोबट को सिर्फ यह कहते हैं कि "रैंडम चीजें आजमाओ" ताकि वह सीख सके, तो वह आमतौर पर बकवास (gibberish) पैदा करेगा। एक वाक्य में रैंडम तरीके से शब्द बदलना ऐसा ही है जैसे कार के इंजन को रैंडम पुर्जों पर हमला करके ठीक करने की कोशिश करना; यह शायद ही कभी काम करता है। इसलिए, रोबोट अक्सर उन्हीं कुछ चीजों को करने में फंसा रहता है जिन्हें वह पहले से जानता है, और नए, चतुर तरीकों को खोजने से चूक जाता है। बड़ा सवाल वैज्ञानिकों के सामने यह है: हम इन AI दिमागों को बिना बकवास बोले, नए और विविध तरीकों से सोचने के लिए कैसे प्रेरित करें? यह पेपर ठीक इसी समस्या को हल करता है, और एक चतुर तरीका प्रस्तावित करता है जिससे रोबोट को सीखने के दौरान अलग-अलग "रणनीतियों" को आज़माने के लिए मजबूर किया जा सके, और फिर उसे यह सिखाया जा सके कि संकेतों के बिना भी उन रणनीतियों का उपयोग कैसे करना है।
"सीक्रेट इंस्ट्रक्शन" रणनीति
शोधकर्ताओं, जिम डिल्क्स और साउथेम्प्टन विश्वविद्यालय की उनकी टीम ने एक विधि विकसित की जिसे वे इंस्ट्रक्शन-कंडीशन्ड एक्सप्लोरेशन (ICE) कहते हैं। इसे इस तरह समझें: कल्पना कीजिए कि आप एक शतरंज खिलाड़ी को प्रशिक्षित कर रहे हैं। केवल यह कहने के बजाय कि, "एक खेल खेलो," आप उन्हें हर अभ्यास खेल के लिए एक अलग "सीक्रेट इंस्ट्रक्शन" (गुप्त निर्देश) देते हैं। एक शीट कह सकती है, "आज, केवल राजा के पक्ष पर हमला करने पर ध्यान केंद्रित करें," जबकि दूसरी कह सकती है, "अपने प्यादों की रक्षा हर कीमत पर करें।"
पेपर की विधि में, वे एक गणित की समस्या लेते हैं और उसके साथ कई अलग-अलग "बिहेवियरल इंस्ट्रक्शंस" (व्यवहार संबंधी निर्देश) जोड़ देते हैं। ये उत्तर नहीं हैं; ये केवल हल्के संकेत हैं जैसे, "इस समस्या में समरूपता (symmetry) खोजें" या "इसे छोटे टुकड़ों में तोड़ने की कोशिश करें।" AI को इन अलग-अलग "टोपियों" को पहनकर उत्तर जेनरेट करने के लिए मजबूर करके, मॉडल अपने आप से कहीं अधिक विविध समाधानों की खोज करता है। यह एक छात्र को एक ही गणित की समस्या को पांच अलग-अलग तरीकों से हल करने के लिए मजबूर करने जैसा है ताकि देखा जा सके कि कौन सा तरीका काम आता है।
शिक्षक और छात्र
यहीं पर जादू होता है। AI मॉडल वास्तव में एक साथ दो भूमिकाएँ निभा रहा है: एक शिक्षक (Teacher) और एक छात्र (Student)।
- शिक्षक (The Teacher): इस संस्करण के AI को "सीक्रेट इंस्ट्रक्शंस" (निर्देश) मिलते हैं। यह इन संकेतों का उपयोग करके समस्याओं को हल करने की कोशिश करता है। जब इसे वास्तव में एक अच्छा उत्तर मिलता है, तो इसे इनाम मिलता है।
- छात्र (The Student): इस संस्करण का AI वह "असली" वाला है जिसे हम बाद में उपयोग करना चाहते हैं। इसे निर्देश कभी नहीं दिखाई देते। इसे केवल कच्ची गणित की समस्या दिखाई देती है।
टीम एक विशेष प्रशिक्षण ट्रिक का उपयोग करती है जिसे Asymmetric-RL/SD कहा जाता है। यह थोड़ा वैसा ही है जैसे एक मास्टर शेफ (शिक्षक) एक गुप्त मसाला मिश्रण का उपयोग करके एक स्वादिष्ट भोजन बनाता है। छात्र (Student) शेफ को खाना बनाते हुए देखता है, अंतिम व्यंजन का स्वाद लेता है, और यह सीखने की कोशिश करता है कि उस स्वादिष्ट स्वाद को बिना उस गुप्त मसाले के, केवल बुनियादी सामग्रियों का उपयोग करके कैसे दोबारा बनाया जाए।
शोधकर्ताओं ने पाया कि शिक्षक को संकेतों के साथ अन्वेषण करने देने और फिर उस ज्ञान को छात्र में "डिस्टिल" (स्थानांतरित) करने से, छात्र अकेले समस्याओं को हल करने में बहुत बेहतर हो जाता है।
उन्होंने क्या पाया
टीम ने इसे Qwen3-1.7B (एक "छोटा" मॉडल जो लैपटॉप और फोन पर चल सकता है) नामक एक विशिष्ट AI मॉडल पर टेस्ट किया, जो गणित की समस्याओं को हल कर रहा था। उन्होंने इसकी तुलना एक मानक प्रशिक्षण तकनीक से की जिसे DAPO कहा जाता है।
- परिणाम: जब मॉडल को उनके "सीक्रेट इंस्ट्रक्शन" विधि (ICE) और "टीचर-टू-स्टूडेंट" ट्रांसफर (Asymmetric-RL/SD) के साथ प्रशिक्षित किया गया, तो यह मानक विधि की तुलना में पहली बार में गणित की समस्याओं को सही ढंग से हल करने में 5.0% बेहतर रहा।
- प्रमाण: यह कोई इत्तेफाक नहीं था। उन्होंने अलग-अलग रैंडम सीड्स (जैसे पांच बार पासा फेंकना) के साथ प्रयोग को पांच बार चलाया, और उनकी विधि पांचों बार जीती। सुधार इतना सुसंगत था कि शोधकर्ता काफी आश्वस्त हैं कि यह एक वास्तविक प्रभाव है, न कि केवल किस्मत।
- लॉन्ग गेम: उन्होंने लंबे उत्तरों (8K कॉन्टेक्स्ट लेंथ) के साथ भी इसका परीक्षण किया, और मॉडल में सुधार हुआ, हालांकि उछाल थोड़ा कम था।
हालांकि, इसकी एक सीमा भी है। जब उन्होंने एक बड़े मॉडल (4B पैरामीटर्स) पर इसे आजमाया, तो इस विधि ने मानक प्रशिक्षण की तुलना में परिणामों में कोई सुधार नहीं किया। यह सुझाव देता है कि यह "इंस्ट्रक्शन" वाला तरीका छोटे मॉडल्स के लिए सबसे अच्छा काम करता है जो समस्या को हल करने की दहलीज पर होते हैं, जिससे उन्हें उन ऊंचाइयों तक पहुँचने में मदद मिलती है जहाँ वे अकेले नहीं पहुँच सकते थे।
यह क्यों मायने रखता है
सबसे शानदार बात यह है कि एक बार प्रशिक्षण पूरा हो जाने के बाद, आपको निर्देशों की आवश्यकता नहीं होती है। "छात्र" मॉडल तैयार है, जो बिना किसी अतिरिक्त निर्देश के गणित की समस्याओं को हल कर रहा है। इसका मतलब है कि आप अपने फोन या लैपटॉप पर एक स्मार्ट, अधिक सक्षम AI प्राप्त कर सकते हैं बिना निर्देशों की एक विशाल सूची साथ रखे। यह AI को उसके "स्कूली जीवन" के दौरान अधिक रचनात्मक और गहन होने के लिए सिखाने का एक तरीका है ताकि वह बाकी जीवन के लिए एक बेहतर समस्या-समाधानकर्ता बन सके।
शोधकर्ता स्वीकार करते हैं कि वे अभी भी यह पता लगा रहे हैं कि यह कितनी दूर तक जाता है, क्योंकि यह उनके द्वारा टेस्ट किए गए बड़े मॉडल पर काम नहीं आया। लेकिन हमारे उपकरणों को चलाने वाले रोज़मर्रा के छोटे AI मॉडल्स के लिए, यह "इंस्ट्रक्शन-कंडीशन्ड एक्सप्लोरेशन" उन्हें लीक से हटकर सोचने में मदद करने का एक आशाजनक नया तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।