Endless Terminals: Scaling RL Environments for Terminal Agents
यह शोध पत्र 'एंडलेस टर्मिनल्स' (Endless Terminals) को प्रस्तुत करता है, जो एक पूर्णतः स्वायत्त पाइपलाइन है जो सुदृढीकरण सीखने (reinforcement learning) वाले एजेंटों को प्रशिक्षित करने के लिए हजारों स्केलेबल टर्मिनल-उपयोग कार्यों को प्रक्रियात्मक रूप से उत्पन्न करती है, और यह प्रदर्शित करती है कि इस डेटासेट पर सरल आरएल (RL) दृष्टिकोण जटिल एजेंटिक स्कैफोल्ड्स की आवश्यकता के बिना, सिंथेटिक और मानव-क्यूरेटेड दोनों बेंचमार्क पर पर्याप्त प्रदर्शन लाभ प्रदान करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट बटलर (नौकर) को अपना घर साफ करना सिखाना चाहते हैं। आप उसे एक इंसान को सफाई करते हुए दिखाने वाला वीडियो दिखा सकते हैं, या एक मैनुअल लिख सकते हैं। लेकिन एक रोबोट को सिखाने का सबसे अच्छा तरीका क्या है? उसे अभ्यास करने दें, असफल होने दें, और फिर से कोशिश करने दें, लाखों बार।
समस्या यह है कि आप रोबोट को सफाई के लिए लाखों अलग-अलग "गंदे कमरे" नहीं बना सकते। इसे इंसानों द्वारा सेटअप करना बहुत महंगा और समय लेने वाला है।
यह पेपर, "Endless Terminals," इसी समस्या को हल करता है। यह एक जादुई फैक्ट्री बनाता है जो AI एजेंटों के लिए अनंत अभ्यास कक्ष (practice rooms) स्वतः ही तैयार करती है।
यहाँ इसका सरल विवरण दिया गया है:
1. समस्या: "खाली जिम" (The Empty Gym)
रिनफोर्समेंट लर्निंग (RL) को AI के लिए एक जिम की तरह समझें। मजबूत होने के लिए, एक AI को भारी वजन उठाना (कठिन समस्याओं को हल करना) होगा, और वह भी बार-बार।
- पुराना तरीका: इंसानों को इन "वजन" (टास्क) को मैन्युअल रूप से बनाना पड़ता था। वे केवल कुछ सौ ही बना सकते थे। यह एक ओलंपिक वेटलिफ्टर को केवल 50 डंबल के साथ प्रशिक्षित करने जैसा है। AI ऊब जाता है, उन 50 चालों को रट लेता है, और कुछ भी नया संभालने में सक्षम नहीं रहता।
- लक्ष्य: हमें एक ऐसा जिम चाहिए जिसमें अनंत वजन हों जो कठिन होते जाएं, ताकि AI केवल विशिष्ट चालों को नहीं, बल्कि वजन उठाने के कौशल को सीख सके।
2. समाधान: "एंडलेस टर्मिनल" फैक्ट्री (The Endless Terminal Factory)
लेखकों ने एक पूरी तरह से स्वचालित पाइपलाइन (एक सेल्फ-रनिंग फैक्ट्री) बनाई है जो बिना किसी इंसान द्वारा कमांड टाइप किए ये अभ्यास कार्य (tasks) उत्पन्न करती है। यह चार चरणों में काम करता है, जैसे कि एक प्रोडक्शन लाइन:
- चरण 1: आइडिया जनरेटर (शेफ): एक स्मार्ट AI एक नए कार्य के लिए रेसिपी लिखता है। "किचन साफ करें" कहने के बजाय, यह कह सकता है, "इन 500 लॉग फाइलों को व्यवस्थित करें, त्रुटियों को खोजें, और एक CSV रिपोर्ट बनाएं।" यह गुप्त रूप से एक "उत्तर कुंजी" (answer key) भी लिख देता है (कि अंतिम परिणाम कैसा दिखना चाहिए) ताकि बाद में काम का ग्रेड दिया जा सके।
- चरण 2: रूम बिल्डर (ठेकेदार): सिस्टम स्वचालित रूप से एक डिजिटल सैंडबॉक्स (एक कंटेनर) बनाता है जहाँ कार्य होता है। यह जाँचता है: "क्या कमरे में वे फाइलें हैं जिनकी रेसिपी को आवश्यकता है? क्या कंप्यूटर चालू है?" यदि कमरा खराब है, तो यह उसे ठीक करता है और फिर से प्रयास करता है।
- चरण 3: ग्रेडर (शिक्षक): यह एक टेस्ट बनाता है ताकि देखा जा सके कि काम सही ढंग से हुआ या नहीं। "क्या CSV फ़ाइल दिखाई दी? क्या नंबर सही हैं?"
- चरण 4: फ़िल्टर (सुरक्षा निरीक्षक): इससे पहले कि छात्र AI कार्य को देखे, फैक्ट्री एक सुपर-स्मार्ट AI (जिसे o3 कहा जाता है) से इसे 16 बार हल करने के लिए कहती है। यदि सुपर-AI इसे हल नहीं कर पाता, तो कार्य बहुत कठिन या टूटा हुआ है, इसलिए इसे कचरे में डाल दिया जाता है। यदि सुपर-AI इसे हल कर सकता है, तो कार्य को छात्र के सीखने के लिए रखा जाता है।
परिणाम: उन्होंने 3,255 अद्वितीय, सत्यापित कार्य उत्पन्न किए, जो फाइलों के प्रबंधन से लेकर डेटाबेस को ठीक करने तक फैले हुए हैं।
3. प्रशिक्षण: "वैनिला" PPO
लेखकों ने कोई फैंसी ट्रिक्स, जटिल उपकरण, या एक-दूसरे की मदद करने वाले AI एजेंटों की टीम का उपयोग नहीं किया। उन्होंने एक बहुत ही सरल सेटअप का उपयोग किया:
- लूप: AI स्क्रीन को देखता है, सोचता है, कमांड टाइप करता है, परिणाम देखता है, और दोहराता है।
- रिवॉर्ड (पुरस्कार): यह बाइनरी है। क्या आपने कार्य पूरा किया? हाँ = 1 अंक। नहीं = 0 अंक। कोई आंशिक क्रेडिट नहीं।
- विधि: उन्होंने PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन) नामक एक मानक एल्गोरिदम का उपयोग किया। इसे "ट्रायल एंड एरर" (प्रयास और त्रुटि) की मसल मेमोरी समझें।
4. परिणाम: अनाड़ी से सक्षम तक
परिणाम आश्चर्यजनक थे क्योंकि सेटअप बहुत सरल था।
- प्रशिक्षण से पहले: AI मॉडल टर्मिनल कार्यों में बहुत खराब थे। उदाहरण के लिए, एक मॉडल (Llama-3.2-3B) ने 0% कार्य सही किए।
- प्रशिक्षण के बाद: उसी मॉडल ने 18% तक की छलांग लगाई। दूसरे मॉडल (Qwen2.5-7B) ने 10% से 53% तक की वृद्धि की।
- ट्रांसफर: इससे भी बेहतर, जब उन्होंने इन प्रशिक्षित मॉडलों का एक अलग, मानव-निर्मित कठिन परीक्षाओं (TerminalBench 2.0) पर परीक्षण किया, तो मॉडल काफी बेहतर प्रदर्शन कर रहे थे। उन्होंने केवल अभ्यास कार्यों को रटा नहीं; उन्होंने वास्तव में एक कंप्यूटर इंजीनियर की तरह सोचना सीख लिया।
मुख्य निष्कर्ष
यह पेपर एक सरल लेकिन शक्तिशाली विचार को सिद्ध करता है: यदि आप एक AI को पर्याप्त अभ्यास वातावरण देते हैं, तो एक सरल प्रशिक्षण विधि भी चमत्कार कर सकती है।
यह कहने जैसा है कि, "आपको एक नए फैंसी शिक्षण तरीके की आवश्यकता नहीं है यदि आप बस छात्र को हल करने के लिए लाखों अलग-अलग गणित की समस्याएं दे देते हैं।" बाधा AI का दिमाग नहीं थी, बल्कि अभ्यास सामग्री की कमी थी। Endless Terminals वह अनंत अभ्यास सामग्री प्रदान करता है, और अचानक, AI स्मार्ट हो जाता है।
संक्षेप में: उन्होंने एक ऐसे रोबोट को बनाया जो रोबोट ट्रेनिंग कोर्स बनाता है, जिसने अन्य रोबोटों को कंप्यूटर का उपयोग करना सिखाया, और यह सब बिना किसी मानव शिक्षक के कमरे में मौजूद रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।