OpenForgeRL: Train Harness-native Agents in Any Environment
OpenForgeRL एक ओपन-सोर्स फ्रेमवर्क है जो एक हल्के प्रॉक्सी और कुबेरनेट्स ऑर्केस्ट्रेटर के माध्यम से इन्फरेंस को ट्रेनिंग से अलग करके, विविध वातावरणों में हार्नेस-नेटिव AI एजेंटों के एंड-टू-एंड प्रशिक्षण को सक्षम बनाता है, जिससे जटिल टूल और GUI बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त होता है और इस बात की अंतर्दृष्टि मिलती है कि हार्नेस के चुनाव और रिइन्फोर्समेंट लर्निंग एजेंट के व्यवहार को कैसे आकार देते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ कंप्यूटर केवल सवालों के जवाब ही नहीं देते, बल्कि आपके लिए काम भी करते हैं। वे कोड लिख सकते हैं, उड़ान बुक कर सकते हैं, या आपकी डिजिटल फाइलों को व्यवस्थित कर सकते हैं। इसे साकार करने के लिए, वैज्ञानिकों ने "AI एजेंट" बनाए हैं—स्मार्ट प्रोग्राम जो सोच सकते हैं, योजना बना सकते हैं और टूल्स का उपयोग कर सकते हैं। लेकिन यहाँ एक पेचीदा बात है: ये एजेंट शून्य में काम नहीं करते। उन्हें एक "हार्नेस" (harness) की आवश्यकता होती है, जो एक जटिल नियंत्रण कक्ष या एक विशेष कॉकपिट की तरह है। यह हार्नेस एजेंट की मेमोरी को प्रबंधित करता है, उसे इंटरनेट से जोड़ता है, और कैलकुलेटर या वेब ब्राउज़र जैसे टूल्स का उपयोग करने में मदद करता है। इस हार्नेस को पायलट की सीट और एजेंट को पायलट समझें; आप एक पायलट को केवल एक वीडियो गेम में प्रशिक्षित करके यह उम्मीद नहीं कर सकते कि वह एक असली 747 विमान उड़ा लेगा। असली विमान में विशिष्ट बटन, आपातकालीन प्रोटोकॉल और कॉकपिट का एक लेआउट होता है जिसे वीडियो गेम ने कभी नहीं दिखाया।
लंबे समय तक, एक बड़ी समस्या थी: "वीडियो गेम्स" (सरल प्रशिक्षण वातावरण) और वास्तविक दुनिया में उपयोग किए जाने वाले जटिल "हार्नेस" (वास्तविक विमान) के बीच तालमेल की कमी थी। शोधकर्ता एजेंटों को आसानी से प्रशिक्षित कर सकते थे, लेकिन जब वे उन्हें वास्तविक, जटिल हार्नेस में डालते थे, तो एजेंट भ्रमित हो जाते थे या विफल हो जाते थे। यह शोध पत्र, जिसका शीर्षक "OpenForge RL" है, ठीक इसी विसंगति को दूर करता है। यह एक नया तरीका पेश करता है जिससे आप इन डिजिटल पायलटों को सीधे उन वास्तविक कॉकपिट्स के भीतर प्रशिक्षित कर सकते हैं जिनमें वे अंततः उड़ेंगे, और एक ऐसा सिस्टम उपयोग करते हैं जो उन्हें एक ही समय में हजारों अलग-अलग "विमानों" पर अभ्यास करने देता है बिना पूरे प्रशिक्षण केंद्र को बाधित किए।
समस्या: वीडियो गेम में प्रशिक्षण बनाम वास्तविक विमान उड़ाना
कल्पित कीजिए कि आप एक रोबोट को कार ठीक करना सिखा रहे हैं। यदि आप उसे एक साधारण वीडियो गेम में प्रशिक्षित करते हैं जहाँ इंजन केवल एक लाल बटन है और टायर एक नीला वर्ग है, तो रोबोट लाल बटन दबाने और नीले वर्ग को पकड़ने के लिए सीख जाता है। लेकिन जब आप उस रोबोट को एक वास्तविक गैरेज में रखते हैं जिसमें एक वास्तविक इंजन, एक वास्तविक टायर और लाखों अन्य उपकरण होते हैं, तो वह सुन्न हो जाता है। वह वास्तविक जटिलता को कैसे संभालना है, यह नहीं जानता।
AI एजेंटों के साथ यही हो रहा है। आधुनिक एजेंट शक्तिशाली हैं, लेकिन वे अपने विचारों और टूल्स को प्रबंधित करने के लिए परिष्कृत "हार्नेस" (जैसे Claude Code या Codex) पर निर्भर करते हैं। ये हार्नेस वास्तविक कॉकपिट की तरह हैं: उनमें स्टेटफुल मेमोरी (यह याद रखना कि पांच कदम पहले क्या हुआ था), मल्टी-प्रोसेस वर्कफ़्लो (एक साथ कई चीजें चलाना), और जटिल टूल कनेक्शन होते हैं। हालाँकि, AI को प्रशिक्षित करने के तरीके (Reinforcement Learning का उपयोग करके) आमतौर पर एक सरल, सपाट वातावरण की धारणा रखते हैं। वे एजेंट को हार्नेस के एक सरलीकृत संस्करण में प्रशिक्षित करने का प्रयास करते हैं, जो एक "ट्रेन-डिप्लॉय मिसमैच" (प्रशिक्षण और तैनाती के बीच अंतर) पैदा करता है। यह एक पायलट को ऐसे सिम्युलेटर पर प्रशिक्षित करने जैसा है जिसमें वास्तविक आपातकालीन ब्रेक नहीं हैं, और फिर उनसे उम्मीद करना कि वे वास्तविक विमान को उतार सकें जब ब्रेक फेल हो जाएं।
समाधान: OpenForge RL (क्लाउड गैरेज)
इस शोध पत्र के लेखकों ने OpenForge RL बनाया है, जो एक विशाल, क्लाउड-आधारित गैरेज की तरह कार्य करता है। वास्तविक, जटिल हार्नेस को एक सरल प्रशिक्षण बॉक्स में जबरदस्ती फिट करने के बजाय, OpenForge RL इसके विपरीत करता है: यह प्रशिक्षण बॉक्स को लेता है और उसे वास्तविक हार्नेस की ओर भेज देता है।
यह कैसे काम करता है, इसके लिए एक मनोरंजक उपमा देखें:
- रिमोट पॉड्स (द क्लाउड गैरेज): कल्पना करें कि आपके पास क्लाउड में छोटे, स्व-चालित गैरेज का एक बेड़ा है। प्रत्येक गैरेज एक कंटेनर है जो एक विशिष्ट "हार्नेस" (जैसे एक विशिष्ट कार मॉडल) को रखता है। OpenForge RL एक "Kubernetes ऑर्केस्ट्रेटर" (एक अत्यंत कुशल गैरेज मैनेजर की तरह) का उपयोग करता है ताकि इन हजारों रिमोट गैरेजों को तुरंत शुरू किया जा सके।
- प्रॉक्सी (दो तरफा दर्पण): प्रत्येक गैरेज के भीतर, AI एजेंट एक कार्य को हल करने का प्रयास करता है। एक "लाइटवेट प्रॉक्सी" दो-तरफा दर्पण की तरह कार्य करता है। यह एजेंट को वास्तविक हार्नेस और वास्तविक वातावरण (जैसे एक वास्तविक कंप्यूटर या वेब ब्राउसर) से बात करने देता है, लेकिन गुप्त रूप से हर एक चाल, विचार और टूल क्लिक को रिकॉर्ड करता है।
- प्रशिक्षण लूप (The Training Loop): प्रॉक्सी इन रिकॉर्ड किए गए "फ्लाइट लॉग्स" को मुख्य प्रशिक्षण मस्तिष्क (जो veRL जैसे मानक उपकरणों का उपयोग करता है) को वापस भेजता है। मस्तिष्क इन वास्तविक दुनिया के लॉग्स से सीखता है, एजेंट के मस्तिष्क को अपडेट करता है, और नए संस्करण को फिर से प्रयास करने के लिए रिमोट गैरेज में वापस भेजता है।
जादू यह है कि प्रशिक्षण वास्तविक हार्नेस के भीतर, वास्तविक वातावरण में होता है, लेकिन उन सभी विभिन्न वातावरणों को प्रबंधित करने का भारी काम क्लाउड द्वारा संभाला जाता है। इसका मतलब है कि शोधकर्ता एक ही समय में "ZeroClaw," "OpenClaw," "Codex," या यहाँ तक कि विजुअल GUI एजेंटों (वे एजेंट जो माउस और कीबोर्ड का उपयोग करते हैं) पर प्रशिक्षण दे सकते हैं, बिना हर नए टूल के लिए अपने प्रशिक्षण कोड को दोबारा लिखे।
उन्होंने क्या पाया: वास्तविक प्रशिक्षण बेहतर काम करता है
टीम ने इन एजेंटों का परीक्षण दो प्रकार के एजेंटों के साथ किया: Claw Agents (जो ईमेल खोजने या फाइलों को प्रबंधित करने जैसे कार्य करने के लिए टेक्स्ट और टूल्स का उपयोग करते हैं) और GUI Agents (जो स्क्रीन देखते हैं और वेब ब्राउज़र या कंप्यूटर में बटन क्लिक करने के लिए माउस का उपयोग करते हैं)।
उन्होंने इन एजेंटों को केवल कुछ सौ से कुछ हजार कार्यों का उपयोग करके प्रशिक्षित किया—जो कि उन विशाल मॉडलों की तुलना में बहुत कम है जो लाखों का उपयोग करते हैं। परिणाम प्रभावशाली थे:
- Claw Agents के लिए: उनके मॉडल, OpenForge-Claw ने ClawEval बेंचमार्क पर 31.7 (pass@3) और QwenClawBench पर 33.7 का स्कोर प्राप्त किया। यह समान आकार (लगभग 30 बिलियन पैरामीटर्स) के अन्य ओपन-सोर्स मॉडलों की तुलना में काफी बेहतर था। वास्तव में, इसने अपने से कई गुना बड़े मॉडलों से बेहतर प्रदर्शन किया।
- GUI Agents के लिए: उनके मॉडल, OpenForge-GUI ने OSWorld-Verified पर 37.7, Online-Mind2Web पर 63.0, और WebVoyager पर 72.3 का स्कोर प्राप्त किया। यह एक बड़ी बात है क्योंकि GUI कार्य अविश्वसनीय रूप से कठिन होते हैं; एजेंट को स्क्रीन को "देखना" पड़ता है और यह तय करना पड़ता है कि कहाँ क्लिक करना है। OpenForge-GUI ने उन मॉडलों की बराबरी की या उन्हें पीछे छोड़ दिया जो बहुत बड़े थे और जिन्हें बहुत अधिक डेटा पर प्रशिक्षित किया गया था।
"हार्नेस" का सबक: सभी कॉकपिट एक जैसे नहीं होते
सबसे दिलचस्प खोज यह नहीं थी कि प्रशिक्षण ने काम किया, बल्कि यह थी कि विभिन्न हार्नेस ने सीखने को कैसे प्रभावित किया। टीम ने चार अलग-अलग हार्नेस में अपने एजेंटों का परीक्षण किया: ReACT (एक सरल लूप), ZeroClaw (हल्का), OpenClaw, और Codex (बहुत जटिल)।
उन्होंने पाया कि कुछ हार्नेस दूसरों की तुलना में सीखने में बहुत कठिन होते हैं।
- सरल, बेहतर-संरेखित (well-aligned) हार्नेस (जैसे ZeroClaw) ने एजेंटों को तेजी से सीखने और बेहतर प्रदर्शन करने की अनुमति दी।
- अधिक जटिल हार्नेस (जैसे Codex) में महारत हासिल करना कठिन था। एजेंटों को संघर्ष करना पड़ा, और हालांकि Reinforcement Learning (RL) ने मदद की, लेकिन सरल हार्नेस की तुलना में लाभ कम थे।
यह सुझाव देता है कि पायलट के प्रशिक्षण जितना ही "कॉकपिट" का डिज़ाइन भी महत्वपूर्ण है। एक अच्छी तरह से डिज़ाइन किया गया हार्नेस एजेंट को स्मार्ट और अधिक विश्वसनीय बनाता है।
RL ने वास्तव में एजेंटों को क्या सिखाया
लेखकों ने यह भी देखा कि बुनियादी प्रशिक्षण (SFT) के ऊपर Reinforcement Learning (RL) जोड़ने पर एजेंटों ने वास्तव में क्या सीखा। उन्होंने पाया कि RL ने एजेंटों को केवल सामान्य अर्थ में "स्मार्ट" नहीं बनाया; इसने विशेष रूप से विश्वसनीयता (reliability) में सुधार किया:
- स्व-सत्यापन (Self-Verification): एजेंटों ने अपने काम की जांच करना शुरू कर दिया। उदाहरण के लिए, यदि उन्होंने एक फ़ाइल बनाई, तो वे यह सुनिश्चित करने के लिए उसे वापस पढ़ने की अधिक संभावना रखते थे कि वह सही है।
- टूल कवरेज (Tool Coverage): वे केवल एक या दो टूल्स तक सीमित रहने के बजाय विविध प्रकार के टूल्स का उपयोग करने लगे।
- त्रुटि सुधार (Error Recovery): यह पेचीदा हिस्सा था। जबकि RL ने एजेंटों को छोटी गलतियों से उबरने में मदद की, त्रुटि सुधार अभी भी कमजोर बना हुआ था। यहाँ तक कि प्रशिक्षण के बाद भी, यदि एजेंट ने कोई बड़ी गलती की, तो वह अक्सर उसे ठीक नहीं कर पाता था और हार मान लेता था। लेखकों का सुझाव है कि इस विशिष्ट कौशल में महारत हासिल करने के लिए विशेष डेटा या अलग प्रशिक्षण विधियों की आवश्यकता हो सकती है।
निष्कर्ष
OpenForge RL यह सिद्ध करता है कि आपको AI एजेंटों को प्रशिक्षित करने के लिए वास्तविक दुनिया को सरल बनाने की आवश्यकता नहीं है। क्लाउड-आधारित सिस्टम का उपयोग करके जो प्रशिक्षण को वातावरण से अलग करता है, आप एजेंटों को सीधे उन जटिल, वास्तविक दुनिया के हार्नेस में प्रशिक्षित कर सकते हैं जिनका वे वास्तव में उपयोग करेंगे।
यह शोध पत्र सुझाव देता है कि यह दृष्टिकोण शोधकर्ताओं को ऐसे एजेंट बनाने की अनुमति देता है जो न केवल अधिक सक्षम हैं, बल्कि अपने विशिष्ट कार्यों में अधिक विश्वसनीय भी हैं। भले ही एजेंट अभी भी जटिल त्रुटि सुधार (error recovery) के लिए संघर्ष कर रहे हैं, लेकिन उन्हें "वीडियो गेम" के बजाय "वास्तविक कॉकपिट" में प्रशिक्षित करने की क्षमता एक बड़ी प्रगति है। इसका मतलब है कि भविष्य में, हम ऐसे AI एजेंट देख सकते हैं जो वास्तव में हमारे साथ काम करने के लिए तैयार हैं, न कि केवल सिमुलेशन में, बल्कि उन वास्तविक डिजिटल टूल्स में जिनका हम रोज उपयोग करते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।