Envs-FORGE: Frontier-Optimized Reward-Grounded Environment Synthesis for Agent RL
Envs-FORGE एक नवीन प्रॉम्प्टिंग पॉलिसी है जो मिक्सड-इंटीजर लीनियर प्रोग्रामिंग के माध्यम से वेरीफायर रिवार्ड्स को प्रति-सीड (per-seed) एक्शन्स में परिवर्तित करके सुदृढीकरण सीखने (reinforcement learning) के लिए एनवायरनमेंट सिंथेसिस को गतिशील रूप से अनुकूलित करती है, जिससे टेलर्ड प्रशिक्षण वातावरण उत्पन्न होते हैं जो फिक्स्ड-रेसिपी बेसलाइन्स की तुलना में विभिन्न बेंचमार्क पर एजेंट के प्रदर्शन में महत्वपूर्ण सुधार करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कंप्यूटर ठीक करना या कोड लिखना सिखाने की कोशिश कर रहे हैं। आप उसे सीधे कोई मैनुअल थमा नहीं सकते; उसे करने के अभ्यास से सीखने की आवश्यकता है। यह रीइन्फोर्समेंट लर्निंग (Reinforcement Learning - RL) की दुनिया है, जहाँ एक AI एजेंट चीज़ों को आज़माकर, गलतियाँ करके और सफलता मिलने पर एक "रिवॉर्ड" (जैसे कि हाई स्कोर) प्राप्त करके सीखता है। लेकिन यहाँ एक पेंच है: रोबोट को बेहतर होने के लिए, जो अभ्यास समस्याएँ वह हल करता है, उन्हें बिल्कुल सटीक होना चाहिए। यदि समस्याएँ बहुत आसान हैं, तो रोबोट ऊब जाएगा और कुछ नया नहीं सीख पाएगा। यदि वे बहुत कठिन हैं, तो वह निराश होकर हार मान लेगा। इस "स्वीट स्पॉट" को "लर्निंग फ्रंटियर" (learning frontier) कहा जाता है—वह सीमा जो रोबोट वर्तमान में कर सकता है, जहाँ थोड़ा सा चुनौतीपूर्ण होना उसे सबसे अधिक बढ़ने में मदद करता है।
लंबे समय से, वैज्ञानिक इन अभ्यास समस्याओं को स्वचालित रूप से बनाने की कोशिश कर रहे हैं, जिसके लिए वे लार्ज लैंग्वेज मॉडल्स (LLMs) का उपयोग करते हैं, जो चैटबॉट्स के पीछे के सुपर-स्मार्ट AI दिमाग हैं। उन्होंने कार्यों को उत्पन्न करने के लिए सरल, निश्चित रेसिपी का उपयोग किया, जैसे कि एक शेफ हर भोजन को पकाने के लिए बिल्कुल उसी रेसिपी का उपयोग करता है, चाहे वह भोजन किसी छोटे बच्चे के लिए हो या किसी विशेषज्ञ के लिए। यह पेपर इन अभ्यास समस्याओं को बनाने का एक नया, स्मार्ट तरीका पेश करता है। इसे Envs-FORGE कहा जाता है। एक "एक ही आकार के सभी के लिए" (one-size-fits-all) वाली रेसिपी के बजाय, यह नया तरीका एक व्यक्तिगत ट्रेनर की तरह काम करता है जो रोबोट की वर्तमान ताकत को देखता है, यह पता लगाता है कि अगला चैलेंज वास्तव में कितना कठिन होना चाहिए, और फिर उसके लिए एक अनूठा व्यायाम तैयार करता है। लक्ष्य यह सुनिश्चित करना है कि प्रत्येक अभ्यास कार्य उसे ठीक उस सीमा तक धकेले जहाँ वह पहले से थोड़ा आगे जा सके।
"एक ही आकार के सभी के लिए" रेसिपी के साथ समस्या
अतीत में, जब शोधकर्ता इन AI एजेंटों के लिए नए प्रशिक्षण कार्य बनाना चाहते थे, तो वे निश्चित रणनीतियों पर निर्भर थे। कल्पना कीजिए कि एक शिक्षक के पास एक ही वर्कशीट है और वह तय करता है कि हर छात्र के लिए इसे बस "थोड़ा कठिन" बना दे, चाहे वह कोई भी हो। एक छात्र के लिए जिसने टेस्ट में महारत हासिल कर ली है, यह नई वर्कशीट अभी भी बहुत आसान हो सकती है। एक छात्र के लिए जो संघर्ष कर रहा था, यह असंभव हो सकती है।
यह पेपर तर्क देता है कि ये निश्चित तरीके—जैसे कि "सेल्फ-इंस्ट्रक्ट" (Self-Instruct) या "इवॉल्व-इंस्ट्रक्ट" (Evol-Instruct)—उसी कठोर शिक्षक की तरह हैं। वे बिना यह जांचे कि क्या AI इसके लिए तैयार है, हर शुरुआती विचार (या "सीड") पर एक ही तर्क लागू करते हैं। वे किसी कार्य को तब कठिन बना सकते हैं जब उसे आसान बनाया जाना चाहिए था, या वे विषय को पूरी तरह से बदल सकते हैं जब AI को केवल एक विशिष्ट कौशल का गहराई से अभ्यास करने की आवश्यकता थी। इससे समय बर्बाद होता है और ऐसा प्रशिक्षण डेटा मिलता है जो बहुत उपयोगी नहीं होता।
Envs-FORGE में प्रवेश: स्मार्ट पर्सनल ट्रेनर
इस पेपर के लेखक Envs-FORGE (Frontier-Optimized Reward-Grounded Environment Synthesis) प्रस्तुत करते हैं। इसे एक स्मार्ट सिस्टम के रूप में समझें जो केवल अनुमान नहीं लगाता; यह गणना करता है।
यह चरण-दर-चरण इस प्रकार काम करता है:
- चेक-अप: सबसे पहले, सिस्टम एक शुरुआती कार्य को देखता है और वर्तमान AI एजेंट को उसे हल करने की कोशिश करने के लिए कहता है। यह गिनता है कि एजेंट कितनी बार सफल होता है। यह इसे एक "पास रेट" (pass rate) देता है, जो एक रिपोर्ट कार्ड की तरह है जो दिखाता है कि उस विशिष्ट रोबमाट के लिए कार्य कितना आसान या कठिन है।
- रणनीति बैठक: उस रिपोर्ट कार्ड के आधार पर, सिस्टम कार्य को बदलने के छह अलग-अलग तरीकों पर विचार करता है। यह चुन सकता है:
- कठिनाई को बढ़ाना (अधिक बाधाएं या एज केसेस जोड़ना)।
- कठिनाई को कम करना (यदि रोबोट अटक गया है तो सरल बनाना)।
- कार्य में विविधता लाना (संदर्भ बदलना लेकिन कठिनाई समान रखना)।
- और इन प्रत्येक के लिए, यह इन-डेप्थ (उसी विषय में गहराई तक जाना) या इन-ब्रैडथ (एक व्यापक, संबंधित विषय का अन्वेषण करना) जा सकता है।
- गणित का जादू (MILP): सिस्टम उस विशिष्ट कार्य के लिए परिवर्तनों के सबसे अच्छे संयोजन को चुनने के लिए "मिक्स्ड-इंटीजर लीनियर प्रोग्राम" (MILP) नामक एक विशेष प्रकार के गणितीय पहेली का उपयोग करता है। यह एक कोच की तरह है जो खिलाड़ी के आँकड़ों को देखता है और निर्णय लेता है, "ठीक है, इस खिलाड़ी के लिए, हमें परफेक्ट लर्निंग ज़ोन में पहुँचने के लिए कठिनाई को 'इन-डेप्थ' बढ़ाना होगा।"
- निर्माण: एक बार सबसे अच्छी रणनीति चुने जाने के बाद, सिस्टम पूरे कार्य पैकेज को फिर से लिखता है। यह केवल प्रश्न को नहीं बदलता; यह निर्देशों, डेटा, समाधान, परीक्षण और यहाँ तक कि कंप्यूटर वातावरण (जैसे कि डॉकर कंटेनर) को भी अपडेट करता है ताकि यह सुनिश्चित हो सके कि सब कुछ मिलकर काम कर रहा है।
- गोल्ड स्टैंडर्ड चेक: नए कार्य को प्रशिक्षण जिम में जाने की अनुमति देने से पहले, यह एक सख्त "गोल्ड वेरीफायर" (Gold Verifier) से गुजरता है। यह यह सुनिश्चित करने के लिए एक अत्यंत सख्त परीक्षण है कि नया कार्य चलने योग्य (runnable), सुसंगत और वास्तव में हल करने योग्य है। यदि यह विफल होता है, तो इसे बाहर कर दिया जाता है। केवल बेहतरीन कार्य ही चुने जाते हैं।
उन्होंने क्या पाया
शोधकर्ताओं ने इस नई पद्धति का परीक्षण Qwen 3.5 35B नामक एक शक्तिशाली AI मॉडल पर किया। उन्होंने Envs-FORGE की तुलना पुरानी निश्चित रेसिपीज़ (Few-shot, Self-Instruct, और Evol-Instruct) और बिना किसी अतिरिक्त प्रशिक्षण वाले बेसलाइन मॉडल से की।
परिणाम स्पष्ट थे: Envs-FORGE जीत गया।
- tb-core नामक बेंचमार्क पर, बेस मॉडल का स्कोर 40.0% था। सबसे अच्छी फिक्स्ड रेसिपी को 46.8% मिला, लेकिन Envs-FORGE 49.2% तक पहुँच गया। यह शुरुआती बिंदु से 9.2 प्रतिशत अंक का सुधार है।
- tb-2.0 पर, बेस मॉडल का स्कोर 23.0% था, जबकि Envs-FORGE 29.4% तक पहुँचा, जो 6.4 प्रतिशत अंक की छलांग है।
- यहाँ तक कि SWE-bench Verified नामक एक बहुत ही कठिन वास्तविक दुनिया के परीक्षण पर भी, Envs-FORGE ने 77.1% प्राप्त किया, जो बेस मॉडल के 73.4% से बेहतर था।
महत्वपूर्ण रूप से, पेपर दिखाता है कि यह इसलिए नहीं था क्योंकि Envs-FORGE ने अधिक कंप्यूटर पावर या अधिक डेटा का उपयोग किया। सभी तरीकों ने ठीक 100 सत्यापित वातावरण (verified environments) उत्पन्न किए। अंतर पूरी तरह से इस बात में था कि उन्होंने उन 100 कार्यों में से प्रत्येक को कैसे चुना। Envs-FORGE ने बस बेहतर कार्य चुने।
यह क्यों मायने रखता है
इस पेपर का मुख्य निष्कर्ष यह है कि प्रशिक्षण डेटा को बनाने का तरीका उतना ही महत्वपूर्ण है जितना कि स्वयं डेटा। "एक ही आकार के सभी के लिए" वाली कठोर रेसिपी का उपयोग करने के बजाय और एक स्मार्ट, डेटा-संचालित दृष्टिकोण का उपयोग करके जो हर कार्य को AI की वर्तमान क्षमता के अनुसार ढालता है, हम इन एजेंटों को तेज़ी से और बेहतर तरीके से सीखने में मदद कर सकते हैं।
लेखक सुझाव देते हैं कि यह "फ्रंटियर-अवेयर" (frontier-aware) दृष्टिकोण—लगातार यह जांचना कि एजेंट कहाँ खड़ा है और उसे उसकी क्षमताओं की सीमा पर रखने के लिए चुनौती को समायोजित करना—अधिक सक्षम टर्मिनल एजेंट बनाने की कुंजी है जो जटिल सॉफ्टवेयर इंजीनियरिंग और सिस्टम प्रशासन कार्यों को संभाल सकें। हालाँकि अध्ययन ने विशिष्ट बेंचमार्क और मॉडल साइज पर ध्यान केंद्रित किया, परिणाम दृढ़ता से संकेत देते हैं कि "स्मार्ट सिंथेसिस" का यह तरीका AI को सीखने का तरीका सिखाने की दिशा में एक महत्वपूर्ण कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।