ToolVerse: Unlocking Massive Environments and Long-Horizon Tasks for Agentic Reinforcement Learning
यह शोध पत्र ToolVerse को प्रस्तुत करता है, जो एक व्यापक ढांचा है जो लगभग 400 वास्तविक-दुनिया के प्रोटोकॉल से विशाल प्रशिक्षण वातावरणों का स्वचालित रूप से निर्माण करके, टूल डिपेंडेंसी ग्राफ के माध्यम से लॉन्ग-होरिजन कार्यों को उत्पन्न करके, और जटिल, गतिशील टूल-एकीकृत परिदृश्यों में LLMs की मजबूती और तर्क क्षमता को महत्वपूर्ण रूप से बढ़ाने के लिए एक टर्न-अवेयर रिलेटिव एडवांटेज एल्गोरिदम का उपयोग करके एजेंटिक सुदृढीकरण लर्निंग (reinforcement learning) को स्केल करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बेहद बुद्धिमान, सुपर-फास्ट रोबोट को एक विशाल, अराजक शहर में नेविगेट करना सिखा रहे हैं। आप उसे सीधे लाखों दुकानों, ट्रैफिक लाइटों और अजनबियों से भरे एक हलचल भरे महानगर में नहीं छोड़ेंगे; वह तुरंत खो जाएगा। इसके बजाय, आप शायद एक छोटे, शांत गाँव से शुरुआत करेंगे जहाँ वह ब्रेड खरीदना या रास्ता पूछना सीख सके। यह मूल रूप से वही है जो वैज्ञानिक "AI एजेंटों" को प्रशिक्षित करने के लिए करते हैं—ऐसे कंप्यूटर प्रोग्राम जिन्हें इंसानों की तरह कार्य करने, निर्णय लेने और समस्याओं को हल करने के लिए टूल्स का उपयोग करने के लिए डिज़ाइन किया गया है। ये एजेंट लार्ज लैंग्वेज मॉडल्स (LLMs) द्वारा संचालित होते हैं, जो सुपर-स्मार्ट दिमागों की तरह हैं जिन्होंने इंटरनेट पर लगभग सब कुछ पढ़ा है। वे बातचीत करने और सरल पहेलियों को सुलझाने में बहुत अच्छे हैं, लेकिन जब आप उनसे एक जटिल, बहु-चरणीय मिशन को संभालने के लिए कहते हैं, तो वे अक्सर लड़खड़ा जाते हैं। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: हम इन डिजिटल दिमागों को बिना भ्रमित हुए या हार माने बिना लंबी, जटिल यात्राओं को संभालने के लिए कैसे सिखा सकते हैं?
यहाँ ToolVerse आता है, एक नया फ्रेमवर्क जिसे इन AI एजेंटों के लिए अंतिम "प्रशिक्षण शहर" (training city) के रूप में डिज़ाइन किया गया है। इसे एक विशाल, स्वचालित निर्माण दल के रूप में सोचें जो लगभग 422 वास्तविक दुनिया के टूलकिट्स से एक विस्तृत, इंटरैक्टिव प्लेग्राउंड बनाता है, जिसमें लगभग 4,438 अलग-अलग टूल्स शामिल हैं। AI को बिना किसी दिशा के भटकने देने के बजाय, ToolVerse एक विशिष्ट मानचित्र बनाता है जिसे "टूल डिपेंडेंसी ग्राफ" (Tool Dependency Graph) कहा जाता है। इसकी कल्पना एक खजाने की खोज की तरह करें जहाँ आप अंत में चेस्ट (chest) नहीं खोल सकते जब तक कि आपने चाबी न ढूंढ ली हो, और आप चाबी नहीं पा सकते जब तक कि आपने एक पहेली को हल नहीं कर लिया हो। यह सिस्टम लंबी, बहु-चरणीय खोजों (quests) को उत्पन्न करने के लिए एक चतुर "डायनेमिक अनलॉकिंग" (Dynamic Unlocking) विधि का उपयोग करता है, जिससे यह सुनिश्चित होता है कि AI एक तार्किक क्रम में विभिन्न टूल्स के बीच संबंध बनाना सीखे।
लेकिन एक पेच है: जब कोई AI किसी समस्या को हल करने में लंबा समय लेता है, तो यह जानना कठिन होता है कि कौन सा कदम प्रतिभाशाली चाल थी और कौन सा गलती थी। यह एक छात्र द्वारा व्हाइटबोर्ड पर गणित का सवाल हल करने को देखने जैसा है; यदि वे अंत में सही उत्तर प्राप्त करते हैं, तो क्या वे वहां इसलिए पहुंचे क्योंकि तीसरे चरण में उन्होंने एक किस्मत वाली तुक्का मारा था, या सातवें चरण में एक शानदार अंतर्दृष्टि के कारण? इसे ठीक करने के लिए, शोधकर्ताओं ने एक नई स्कोरिंग प्रणाली पेश की जिसे "टर्न-अवेयर रिलेटिव एडवांटेज" (Turn-Aware Relative Advantage) कहा जाता है। अंत में केवल एक ग्रेड देने के बजाय, यह प्रणाली AI को हर एक कदम के बाद एक छोटा "हाई-फाइव" या एक सौम्य "फिर से कोशिश करें" देती है, और उस सटीक क्षण में अन्य AI एजेंटों द्वारा किए गए उनके कदमों के साथ तुलना करती है। यह AI को बहुत तेज़ी से और अधिक सटीक रूप से सीखने में मदद करता है। परिणाम बताते हैं कि यह दृष्टिकोण जटिल, लंबे समय तक चलने वाले कार्यों को संभालने की AI की क्षमता को महत्वपूर्ण रूप से बढ़ाता है, जिससे अनाड़ी शुरुआती लोगों को व्यस्त शहर के डिजिटल समकक्ष में नेविगेट करने में सक्षम आत्मविश्वासी खोजकर्ताओं में बदल दिया जाता है।
समस्या: AI बड़े शहर में क्यों खो जाता है
कुछ समय से, AI एजेंट छोटे, नियंत्रित वातावरण में बहुत अच्छा प्रदर्शन कर रहे हैं। यदि नियम सरल हैं और रास्ता छोटा है, तो वे कोड लिख सकते हैं या वेब सर्च कर सकते हैं। लेकिन वास्तविक दुनिया एक शांत गाँव नहीं है; यह एक अराजक महानगर है। जब शोधकर्ताओं ने इन एजेंटों को बड़े, जटिल कार्यों को संभालने के लिए बनाने की कोशिश की जिनमें एक विशिष्ट क्रम में कई अलग-अलग टूल्स का उपयोग करने की आवश्यकता होती है, तो चीजें बिखर गईं।
पेपर तीन मुख्य कारणों की पहचान करता है कि क्यों AI इन "विशाल वातावरणों" में संघर्ष करता है:
- बहुत छोटा प्लेग्राउंड: अधिकांश प्रशिक्षण वातावरण केवल AI को एक या दो टूल्स का उपयोग करने देते हैं, जैसे कैलकुलेटर या सर्च इंजन। वास्तविक जीवन में एक साथ दर्जनों टूल्स को संभालने की आवश्यकता होती है।
- खोजों (Quests) को डिजाइन करना कठिन है: ऐसे कार्य बनाना जो तर्क की एक लंबी श्रृंखला की आवश्यकता रखते हों (जैसे "एक यात्रा की योजना बनाएं, होटल बुक करें, फिर टिकट खरीदें") अविश्वसनीय रूप से कठिन है। यदि AI एक भी कदम गलत करता है, तो पूरी योजना विफल हो जाती है, और उसे यह सिखाना कठिन होता है कि कैसे सुधार किया जाए।
- "यह किसने किया?" की समस्या: लंबे कार्यों में, यह जानना कठिन है कि किस विशिष्ट क्रिया ने सफलता या विफलता की ओर ले जाने का काम किया। यदि कोई AI 20 चरणों के बाद विफल होता है, तो क्या वह चरण 1 के कारण विफल हुआ या चरण 19 के कारण? पारंपरिक प्रशिक्षण विधियां अक्सर केवल अंत में इनाम देती हैं, जो एक छात्र को यह बताने जैसा है कि "आप परीक्षा में असफल रहे" बिना यह दिखाए कि उन्होंने कौन सा प्रश्न गलत किया।
समाधान: अंतिम प्रशिक्षण मैदान बनाना
इन समस्याओं को हल करने के लिए, शोधकर्ताओं ने ToolVerse बनाया। यह केवल एक एकल वातावरण नहीं है; यह वातावरण बनाने वाला एक कारखाना है।
1. टूल फैक्ट्री (The Tool Factory)
टीम ने लगभग 422 वास्तविक दुनिया के टूल डेफिनिशन (ओपन-सोर्स प्रोजेक्ट्स और अन्य रिपॉजिटरी से) के एक विशाल संग्रह से शुरुआत की। उन्होंने इन स्थिर डेफिनिशन को कार्यात्मक, निष्पादन योग्य टूल्स में बदलने के लिए एक स्वचालित पाइपलाइन बनाई। उन्होंने निर्देशों को साफ किया, मॉक डेटाबेस (जैसे नकली इन्वेंट्री या यूजर प्रोफाइल) बनाए, और कोड लिखा ताकि हर टूल वास्तव में काम करे। परिणाम? एक विशाल, विविध दुनिया जिसमें लगभग 4,438 टूल्स हैं जिनका एक AI वास्तव में उपयोग और इंटरैक्शन कर सकता है।
2. खजाने की खोज का नक्शा (GUST Dataset)
केवल टूल्स होना ही काफी नहीं है; AI को उन्हें उपयोग करने का एक कारण चाहिए। शोधकर्ताओं ने "टूल डिपेंडेंसी ग्राफ" का उपयोग करके कार्य बनाने का एक नया तरीका डिज़ाइन किया। एक ग्राफ की कल्पना करें जहाँ प्रत्येक टूल एक नोड है, और तीर दिखाते हैं कि किस टूल का उपयोग दूसरे से पहले किया जाना चाहिए।
- डायनेमिक अनलॉकिंग: उन्होंने एक विशेष एल्गोरिदम का उपयोग करके टूल्स को एक-एक करके "अनलॉक" करने के लिए किया। आप "बुक होटल" टूल का उपयोग तब तक नहीं कर सकते जब तक कि आपने "सर्च फ्लाइट" टूल का उपयोग नहीं कर लिया हो। यह AI को एक तार्किक अनुक्रम सीखने के लिए मजबूर करता है।
- GUST डेटासेट: इस प्रक्रिया ने GUST (ग्राफ अनलॉकिंग सैंपलिंग टास्क) नामक एक डेटासेट तैयार किया। ये रैंडम सवाल नहीं हैं; ये सावधानीपूर्वक तैयार किए गए, लंबे समय तक चलने वाले कार्य हैं जिनके लिए AI को कई चरणों को जोड़ने और एक टूल से दूसरे टूल में जानकारी पास करने की आवश्यकता होती है।
3. "टर्न-अवेयर" कोच (TARA)
यह शायद सबसे चतुर हिस्सा है। मानक प्रशिक्षण में, AI को एक लंबे कार्य के अंत में एक एकल स्कोर मिलता है। ToolVerse टर्न-अवेयर रिलेटिव एडवांटेज (TARA) पेश करता है।
- यह कैसे काम करता है: अंत तक प्रतीक्षा करने के बजाय, सिस्टम हर एक टर्न (हर कदम) के बाद AI के प्रदर्शन की जांच करता है।
- तुलना: यह AI की चाल की तुलना उसी समय एक ही कार्य करने वाले अन्य AI एजेंटों की चालों से करता है। यदि आपके AI ने दूसरों की तुलना में एक अच्छी चाल चली, तो उसे बढ़ावा मिलता है। यदि उसने एक खराब चाल चली, तो उसे दंड मिलता है।
- गेटकीपर: उन्होंने एक "कंसिस्टेंसी गेट" जोड़ा। यदि AI चरण 1 में गलती करता है, तो सिस्टम उसे चरण 2 से 10 तक किसी भी "किस्मत वाले" सफल प्रयासों के लिए क्रेडिट देना बंद कर देता है। यह AI को यह सीखने से रोकता है कि "शायद मैं अब गड़बड़ी कर दूँ और बाद में इसे ठीक कर दूँ।" यह AI को सफल होने के लिए हर कदम को सही करने के लिए मजबूर करता है।
उन्होंने क्या पाया
शोधकर्ताओं ने अपने फ्रेमवर्क का परीक्षण कई AI मॉडल्स (Qwen3 और Qwen2.5 सहित) पर किया और उनकी तुलना अन्य विधियों से की।
- लंबे कार्यों में बेहतर: ToolVerse और TARA एल्गोरिदम के साथ प्रशिक्षित मॉडल्स ने मानक विधियों के साथ प्रशिक्षित मॉडल्स की तुलना में जटिल, बहु-चरणीय बेंचमार्क पर काफी बेहतर प्रदर्शन किया। उदाहरण के लिए, ACEBench-Agent नामक एक टेस्ट पर, एक मॉडल ने केवल इस नए प्रशिक्षण तरीके का उपयोग करके अपने स्कोर में 13 अंकों से अधिक का सुधार किया।
- "टर्न-अवेयर" कोच की शक्ति: जब उन्होंने नए TARA मेथड की तुलना मानक "ग्रुप रिलेटिव पॉलिसी ऑप्टिमाइजेशन" (GRPO) से की, तो TARA ने लगातार जीत हासिल की। यह सुझाव देता है कि इनाम को छोटे, चरण-दर-चरण फीडबैक में तोड़ना, अंत में अंतिम ग्रेड की प्रतीक्षा करने की तुलना में बहुत अधिक प्रभावी है।
- अधिक टूल्स = बेहतर दिमाग: उन्होंने पाया कि विविध वातावरणों (100 से 422 अलग-अलग टूलसेट्स तक स्केल करना) पर प्रशिक्षण देने से AI अधिक मजबूत बना और नए, अनदेखे कार्यों के प्रति बेहतर सामान्यीकरण (generalizing) करने में सक्षम हुआ।
निष्कर्ष
ToolVerse यह सुझाव देता है कि AI एजेंटों को वास्तव में वास्तविक दुनिया को संभालने में सक्षम बनाने के लिए, हमें उन्हें छोटे, सरल कमरों में प्रशिक्षित करना बंद करना होगा और उनके लिए स्पष्ट मानचित्र और तत्काल फीडबैक के साथ विशाल, जटिल शहर बनाने शुरू करने होंगे। इन वातावरणों के निर्माण को स्वचालित करके और AI को एक "कोच" देकर जो उसकी हर चाल पर नज़र रखता है, शोधकर्ताओं ने दिखाया है कि यह दृष्टिकोण उन एजेंटों की ओर एक आशाजनक मार्ग है जो बिना रास्ता भटके लंबी, जटिल कार्यों के माध्यम से तर्क कर सकते हैं। हालांकि यह कार्य अभी अनुसंधान के चरण में है और सिमुलेशन और विशिष्ट बेंचमार्क पर निर्भर है, इसके परिणाम संकेत देते हैं कि यह दृष्टिकोण वास्तव में स्वायत्त AI सहायकों की अगली पीढ़ी के लिए एक प्रमुख घटक हो सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।