AgentJet: A Flexible Swarm Training Framework for Agentic Reinforcement Learning
AgentJet एक लचीला, वितरित स्वार्म ट्रेनिंग फ्रेमवर्क है जो हेट्रोजेनियस मल्टी-मॉडल रिइन्फोर्समेंट लर्निंग, फॉल्ट-टॉलरेंट मल्टी-टास्क ट्रेनिंग और लाइव कोड इटरेशन को सक्षम करने के लिए एजेंट निष्पादन को मॉडल अनुकूलन से अलग करता है, जबकि स्वायत्त लॉन्ग-होरिज़न आरएल रिसर्च के लिए एक स्वचालित प्रणाली पेश करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप रोबोटों की एक टीम को एक जटिल खेल खेलना सिखाने की कोशिश कर रहे हैं, जैसे कि Werewolf या कठिन गणित के सवालों को हल करना। पुराने तरीके में यह करने का (एक "केंद्रीकृत" फ्रेमवर्क का उपयोग करके), शिक्षक और रोबोट एक ही कमरे में फंसे होते थे। यदि एक रोबोट अपने तारों में उलझ जाता, क्रैश हो जाता, या एक लूप में फंस जाता, तो पूरी क्लास को रुकना पड़ता था, शिक्षक को अपना सामान समेटना पड़ता था, और सभी को फिर से शुरू करने के लिए शिक्षक द्वारा सब कुछ सेट अप करने का इंतज़ार करना पड़ता था।
AgentJet इस कक्षा को व्यवस्थित करने का एक नया, स्मार्ट तरीका है। लेखक इसे एक "स्वार्म ट्रेनिंग फ्रेमवर्क" (Swarm Training Framework) कहते हैं। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:
1. "स्वार्म" आर्किटेक्चर: शिक्षक बनाम छात्र
सबको एक ही कमरे में रखने के बजाय, AgentJet काम को दो अलग-अलग समूहों में विभाजित करता है जो एक-दूसरे से बात करते हैं लेकिन जीवित रहने के लिए एक-दूसरे पर निर्भर नहीं हैं:
- स्वार्म सर्वर्स (शिक्षक): ये शक्तिशाली कंप्यूटर हैं जिनमें भारी-भरती ग्राफिक्स कार्ड (GPUs) लगे होते हैं। इनका एकमात्र काम "मस्तिष्क" (AI मॉडल) को थामे रखना और वास्तविक लर्निंग (गणित अपडेट करना) करना है। वे स्थिर और केंद्रित रहते हैं।
- स्वार्म क्लाइंट्स (छात्र): ये हल्के कंप्यूटर हैं (यहाँ तक कि आपका लैपटॉप भी!) जो वास्तविक कार्यों को चलाते हैं। वे एजेंट के रूप में कार्य करते हैं, बाहरी दुनिया से बात करते हैं, टूल्स का उपयोग करते हैं, और गलतियाँ करते हैं।
जादू: यदि कोई "छात्र" कंप्यूटर किसी टूटी हुई वेबसाइट खोलने की कोशिश करने या मेमोरी खत्म होने के कारण क्रैश हो जाता है, तो "शिक्षक" को इसका पता भी नहीं चलता। शिक्षक बस अगली लाइन में एक नए छात्र के आने का इंतज़ार करता है। लर्निंग कभी नहीं रुकती, और कोई प्रगति (progress) नष्ट नहीं होती। यह एक शिक्षक द्वारा पेपर चेक करने जैसा है जबकि छात्र बाहर काम कर रहे हों; यदि एक छात्र लड़खड़ाता है, तो भी शिक्षक अपना काम जारी रखता है।
2. "रिडंडेंट कॉन्टेक्स्ट" की समस्या को हल करना (टाइमलाइन मर्जिंग)
जब एक AI एजेंट लंबे समय तक बाहरी दुनिया से बात करता है, तो वह अक्सर खुद को दोहराता है। कल्पना कीजिए कि एक छात्र हर दिन डायरी लिख रहा है, लेकिन हर नई एंट्री पिछले सप्ताह की पूरी डायरी को कॉपी करके शुरू होती है। यह बहुत सारा कागज (और कंप्यूटर पावर) बर्बाद करता है।
AgentJet में एक विशेष फीचर है जिसे टाइमलाइन मर्जिंग (Timeline Merging) कहा जाता है। यह बातचीत के लंबे इतिहास को देखता है, दोहराए गए हिस्सों को पहचानता है, और उन्हें आपस में "जोड़" देता है।
- परिणाम: यह फालतू बातों को काट देता है। पेपर का दावा है कि यह ट्रेनिंग को 1.5 से 10 गुना तेज़ बनाता है क्योंकि AI बार-बार एक ही निर्देशों को दोबारा पढ़ने में समय बर्बाद नहीं करता है।
3. विभिन्न मॉडलों और कार्यों को मिलाना (द "कॉकटेल" पार्टी)
अतीत में, आप आमतौर पर एक ही प्रकार के रोबोट को एक ही प्रकार का काम करने के लिए प्रशिक्षित करते थे। AgentJet "कॉकटेल ट्रेनिंग" दृष्टिकोण की अनुमति देता है:
- अलग-अलग दिमाग: आप एक छोटा, तेज़ दिमाग (7B पैरामीटर्स) सरल कार्यों के लिए और एक विशाल, बुद्धिमान दिमाग (32B पैरामीटर्स) जटिल प्लानिंग के लिए, एक ही समय में प्रशिक्षित कर सकते हैं। उन्हें एक ही दिमाग साझा करने की आवश्यकता नहीं है; वे पूरी तरह से अलग हो सकते हैं।
- अलग-अलग काम: आपके पास एक छात्र हो सकता है जो गणित का अभ्यास कर रहा है और दूसरा जो कोडिंग का अभ्यास कर रहा है, और वे दोनों अपना होमवर्क एक ही शिक्षक को भेज सकते हैं। शिक्षक बिना भ्रमित हुए दोनों से सीखता है।
4. "हॉट-स्वैप" डिबगिंग (लाइव एडिटिंग)
आमतौर पर, यदि आप एक AI एजेंट का कोड बदलना चाहते हैं, तो आपको पूरे ट्रेनिंग सेशन को बंद करना होता है, कोड ठीक करना होता है, सर्वर को फिर से शुरू करना होता है, और सब कुछ लोड होने के लिए 10 मिनट इंतज़ार करना होता है।
AgentJet के साथ, क्योंकि "छात्र" (कोड) और "शिक्षक" (मॉडल) अलग-अलग हैं, आप छात्र को बदल सकते हैं जबकि शिक्षक काम करना जारी रखता है। यह फुटबॉल मैच में बिना मैच रोके खिलाड़ी बदलने जैसा है। आप कोड को एडिट कर सकते हैं, क्लाइंट को रीस्टार्ट कर सकते हैं, और ट्रेनिंग तुरंत जारी रहती है।
5. ऑटोमेटेड रिसर्चर (द "सेल्फ-ड्राइविंग लैब")
यह पेपर एक ऐसी प्रणाली पेश करता है जहाँ एक AI एक शोधकर्ता (researcher) के रूप में कार्य कर सकता है।
- वर्कफ़्लो: आप AI को एक विषय देते हैं (जैसे, "इस गणित मॉडल के लिए सर्वोत्तम सेटिंग्स खोजें")।
- क्रिया: AI स्वचालित रूप से कोड लिखता है, "छात्रों" और "शिक्षकों" को सेटअप करता है, दिनों तक प्रयोग चलाता है, परिणामों का विश्लेषण करता है, और यहाँ तक कि अपनी गलतियों को भी ठीक करता है।
- दावा: लेखक कहते हैं कि उन्होंने छह अलग-अलग शोध परियोजनाओं (जैसे हाइपरपैरामीटर ट्यूनिंग या मॉडल साइज की तुलना) पर इसका परीक्षण किया और AI ने बिना किसी मानव हस्तक्षेप के इन दीर्घकालिक प्रयोगों को सफलतापूर्वक चलाया।
सारांश जो वे दावा करते हैं
पेपर का दावा है कि "करने" (क्लाइंट्स) को "सीखने" (सर्वर्स) से अलग करके, वे यह कर सकते हैं:
- पूरे ट्रेनिंग प्रोसेस को क्रैश से बचा सकते हैं।
- कुशलतापूर्वक एक साथ विभिन्न प्रकार के AI (अलग-अलग आकार, अलग-अलग काम) को प्रशिक्षित कर सकते हैं।
- AI की मेमोरी से दोहराव वाले टेक्स्ट को हटाकर ट्रेनिंग की गति बढ़ा सकते हैं।
- AI शोधकर्ताओं को अपने स्वयं के प्रयोग चलाने की अनुमति दे सकते हैं, जिससे उबाऊ इंजीनियरिंग कार्यों को संभालना आसान हो जाता है ताकि इंसान बड़े विचारों पर ध्यान केंद्रित कर सकें।
लेखक इस बात पर जोर देते हैं कि यह ओपन-सोर्स है और किसी भी मौजूदा AI एजेंट टूल्स के साथ काम करता है, जिसका अर्थ है कि आपको इसे उपयोग करने के लिए अपने कोड को फिर से लिखने की आवश्यकता नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।