ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning
एक्स्ट्रा (ExTra) एक GRPO-संगत फ्रेमवर्क है जो विविध सही समाधानों के लिए नवीनता पुरस्कारों (novelty rewards) और आसान एवं कठिन रीजनिंग कार्यों पर मानक RLVR की सीमाओं को दूर करने के लिए एंट्रॉपी-निर्देशित प्रीफिक्स पुनर्जनन (entropy-guided prefix regeneration) को जोड़कर भाषा मॉडल सुदृढीकरण शिक्षण (reinforcement learning) को बढ़ाता है, जिससे सटीकता और इन्फरेंस-टाइम कवरेज में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान छात्र (एक AI भाषा मॉडल) को कठिन गणित की समस्याएं हल करना सिखा रहे हैं। आप एक विधि का उपयोग करते हैं जिसे Reinforcement Learning कहा जाता है, जहाँ छात्र समस्या को हल करने का प्रयास करता है, यदि वह सही है तो उसे "थम्स अप" (अंगूठा ऊपर) मिलता है, और यदि वह गलत है तो "थम्स डाउन" (अंगूठा नीचे) मिलता है। लक्ष्य छात्र को इन थम्स अप और थम्स डाउन से सीखने में मदद करना है ताकि वह समय के साथ बेहतर हो सके।
यह शोध पत्र एक नई शिक्षण विधि पेश करता है जिसे ExTra (Exploratory Trajectory Optimization) कहा जाता है। यह दो विशिष्ट समस्याओं को ठीक करता है जो तब होती हैं जब छात्र प्रयासों के एक समूह से सीखने की कोशिश करता है।
वे दो समस्याएँ जिन्हें ExTra हल करता है
1. "बहुत आसान" वाली समस्या (बोरिंग क्लास)
कल्पना कीजिए कि आप छात्र को एक बहुत ही आसान गणित की समस्या देते हैं, जैसे ।
- क्या होता है: छात्र 10 बार प्रयास करता है, और हर बार वह "4" लिखता है।
- समस्या: चूंकि हर उत्तर एक जैसा और सही है, इसलिए शिक्षक (AI सिस्टम) भ्रमित हो जाता है। सीखने के लिए प्रयासों के बीच कोई अंतर नहीं रह जाता। छात्र सोचने के नए तरीके आज़माना बंद कर देता है और बस उसी उबाऊ पैटर्न को दोहराता रहता है। वह एक ढर्रे में "फँस" जाता है, जिससे उसकी रचनात्मक रूप से सोचने की क्षमता कम हो जाती है।
- ExTra का समाधान: यह एक "Novelty Bonus" (नवीनता बोनस) जोड़ता है। यदि छात्र सही उत्तर () प्राप्त करता है लेकिन इसे पहले के मुकाबले एक अनोखे, अलग तरीके से समझाता है, तो उसे अतिरिक्त अंक मिलते हैं। यह छात्र को आसान समस्याओं को हल करने के अलग-अलग तरीकों को आज़माने के लिए प्रोत्साहित करता है, जिससे उसका मस्तिष्क सक्रिय और विविध बना रहता है।
2. "बहुत कठिन" वाली समस्या (डेड एंड/बंद रास्ता)
अब कल्पना कीजिए कि आप छात्र को एक अत्यंत कठिन समस्या देते हैं, जैसे कि एक जटिल ओलंपियाड गणित का प्रश्न।
- क्या क्या होता है: छात्र 10 बार प्रयास करता है, और हर बार वह या तो अटक जाता है या गलत उत्तर देता है।
- समस्या: शिक्षक देखता है कि 10 बार विफलता मिली है और उसे समझ नहीं आता कि क्या किया जाए। सीखने के लिए कोई "थम्स अप" नहीं है। आमतौर पर, सिस्टम उन सभी 10 प्रयासों को फेंक देता है और शून्य से फिर से शुरू कर देता है, जिससे छात्र द्वारा किए गए पिछले पूरे काम की बर्बादी होती है।
- ExTra का समाधान: सब कुछ फेंक देने के बजाय, ExTra एक स्मार्ट हाइकिंग गाइड की तरह काम करता है।
- यह छात्र के असफल प्रयासों को देखता है और पूछता है: "वे कहाँ लगभग सही थे?"
- यह एक विशेष संकेत का उपयोग करता है जिसे Entropy (जो कि यह मापने जैसा है कि प्रत्येक चरण पर छात्र कितना "भ्रमित" या "अनिश्चित" था) कहा जाता है। यह उत्तर के उस हिस्से को ढूंढता है जहाँ छात्र सबसे कम भ्रमित था।
- यह उस विशिष्ट "लगभग-सही" हिस्से को लेता है और कहता है: "ठीक है, इस हिस्से को बनाए रखते हुए बाकी समस्या को यहाँ से पूरा करने की कोशिश करो।"
- यह छात्र की प्रगति को बचाता है और उसे एक मजबूत शुरुआती बिंदु से नए रास्तों को खोजने के लिए निर्देशित करता है, न कि शून्य से शुरू होने के लिए।
यह मिलकर कैसे काम करता है
सोचिए कि ExTra एक कोच की तरह है जो दो चीजें एक साथ करता है:
- आसान कार्यों के लिए: वे छात्र से कहते हैं, "बहुत अच्छा! लेकिन अगली बार इसे बिल्कुल नए तरीके से समझाने की कोशिश करें ताकि हम और सीख सकें।" (यह Novelty Reward है)।
- कठिन कार्यों के लिए: वे कहते हैं, "आप यहाँ अटक गए थे, लेकिन आप इस वाक्य तक बहुत अच्छा कर रहे थे। आइए इस वाक्य को रखें और वहीं से पहेली को पूरा करने की कोशिश करें।" (यह Entropy-Guided Regeneration है)।
परिणाम
शोधकर्ताओं ने इसका परीक्षण छह अलग-अलग गणितीय बेंचमार्क (जैसे AIME और MATH) पर किया। उन्होंने ExTra की तुलना मानक विधि (जिसे GRPO कहा जाता है) से की।
- बेहतर सटीकता (Better Accuracy): AI ने पहली बार में ही अधिक सही उत्तर दिए।
- बेहतर कवरेज (Better Coverage): यदि आप AI को समस्या हल करने के लिए 16 बार प्रयास करने देते हैं, तो ExTra के पास उन 16 प्रयासों में से कम से कम एक सही उत्तर खोजने की बहुत अधिक संभावना होती है। इसका मतलब है कि AI केवल सोचने के एक विशिष्ट तरीके में बेहतर नहीं हुआ; इसने समस्याओं को हल करने के कई विविध तरीके सीखे।
- दक्षता (Efficiency): इसने अतिरिक्त कंप्यूटर समय खर्च किए बिना या हर चरण के लिए मानव ग्रेडिंग की आवश्यकता के बिना ये परिणाम प्राप्त किए। इसने यह पता लगा लिया कि क्या काम कर रहा है, सिर्फ AI की अपनी सोचने की प्रक्रिया को देखकर।
संक्षेप में, ExTra AI को सिखाता है कि जब चीजें आसान हों तो विविध (diverse) कैसे बनें और जब चीजें कठिन हों तो लचीला (resilient) कैसे बनें, जिससे यह सुनिश्चित होता है कि वह दोहराव के चक्र में या चुनौती का सामना करते समय हार मान लेने में न फँसे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।