← नवीनतम पेपर
💬 NLP

ToolOmni: Enabling Open-World Tool Use via Agentic learning with Proactive Retrieval and Grounded Execution

ToolOmni एक एकीकृत एजेंटिक फ्रेमवर्क है जो एक कोल्ड-स्टार्ट मल्टी-टर्न इंटरेक्शन डेटासेट को एक डिकपल्ड मल्टी-ऑब्जेक्टिव GRPO एल्गोरिदम के साथ जोड़कर लार्ज लैंग्वेज मॉडल्स के ओपन-वर्ल्ड टूल उपयोग को बढ़ाता है ताकि प्रोएक्टिव टूल रिट्रीवल और ग्राउंडेड एक्जीक्यूशन दोनों में स्टेट-ऑफ-द-आर्ट प्रदर्शन प्राप्त किया जा सके।

मूल लेखक: Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang

प्रकाशित 2026-04-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shouzheng Huang, Meishan Zhang, Baotian Hu, Min Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली लेकिन अनुभवहीन सहायक है जिसका नाम ToolOmni है। आपका लक्ष्य इस सहायक को डिजिटल टूल्स (जैसे मौसम ऐप, फ्लाइट बुकिंग सिस्टम, या मूवी डेटाबेस) के एक विशाल पुस्तकालय का उपयोग करके जटिल समस्याओं को हल करने के लिए तैयार करना है।

यहाँ समस्या है: लाइब्रेरी बहुत बड़ी है (16,000 से अधिक टूल्स), लगातार बदल रही है, और भ्रमित करने वाले लेबल से भरी हुई है।

पुराना तरीका: "निष्क्रिय लाइब्रेरियन" बनाम "रट्टा मारने वाला"

ToolOmni से पहले, असिस्टेंट टूल्स का उपयोग करने के दो मुख्य तरीके थे:

  1. निष्क्रिय लाइब्रेरियन (एम्बेडिंग रिट्रीवल): आप असिस्टेंट से पूछते हैं, "मुझे मौसम के लिए एक टूल चाहिए।" असिस्टेंट टूल्स की एक सूची देखता है और उन टूल्स को चुनता है जो "मौसम" के सबसे समान लगते हैं।
    • दोष: यह एक लाइब्रेरियन से "अंतरिक्ष के बारे में एक किताब" माँगने जैसा है और वह आपको "अंतरिक्ष यात्रा" की किताब थमा देता है जब आपको वास्तव में अंतरिक्ष यात्रा की किताब चाहिए थी। यह एक सतही मिलान है। यदि लाइब्रेरी 10,000 किताबों तक बढ़ जाती है, तो लाइब्रेरियन घबरा जाएगा और गलत चुनाव करेगा।
  2. रट्टा मारने वाला (पैरामीटर मेमोरी): असिस्टेंट अपने दिमाग के अंदर हर एक टूल के निर्देश मैनुअल को याद रखने की कोशिश करता है।
    • दोष: यदि लाइब्रेरी में एक नया टूल जोड़ा जाता है या पुराने में कोई बदलाव होता है, तो असिस्टेंट फंस जाता है। यह पूरी फोन बुक को याद करने जैसा है; जैसे ही एक नंबर बदलता है, आपकी याददाश्त गलत हो जाती है।

नया तरीका: ToolOmni (एक "सक्रिय जासूस")

ToolOmni खेल बदल देता है। केवल निर्देशों का इंतजार करने या तथ्यों को याद रखने के बजाय, यह एक सक्रिय जासूस (Proactive Detective) की तरह काम करता है जिसे जांच-पड़ताल करना आता है। यह दो-चरणीय प्रक्रिया का उपयोग करता है:

चरण 1: "खोज और चयन" चरण (प्रोएक्टिव रिट्रीवल)

सही टूल्स का अनुमान लगाने के बजाय, ToolOmni सही टूल्स की तलाश करने के लिए सक्रिय रूप से शिकार करता है।

  • उपमा: कल्पना कीजिए कि आपको एक टपकते हुए नल को ठीक करने की आवश्यकता है। एक सामान्य असिस्टेंट शायद जो भी पाना wrench (रिंच) दिखे उसे उठा लेगा। ToolOmni कहता है, "रुको, मुझे एक विशिष्ट आकार चाहिए। मुझे टूलबॉक्स में खोजना चाहिए, लेबल चेक करने चाहिए, शायद अलग-अलग कीवर्ड के साथ फिर से खोज करनी चाहिए, और फिर एकदम सही रिंच चुनना चाहिए।"
  • यह कैसे काम करता है: यह सही टूल्स खोजने के लिए "सर्च इंजन" से कई बार सवाल पूछता है, अपने सवालों को परिष्कृत करता है जब तक कि उसे आवश्यक टूल्स का सटीक सेट न मिल जाए। यह केवल शीर्ष 5 परिणाम नहीं चुनता; यह सही परिणाम चुनता है, भले ही इसके लिए केवल 2 परिणाम ही क्यों न चुनने पड़ें।

चरण 2: "ग्राउंडेड निष्पादन" चरण (Grounded Execution)

एक बार जब इसके पास सही टूल्स आ जाते हैं, तो यह उनका सावधानीपूर्वक उपयोग करता है।

  • उपमा: यदि रिंच फिसल जाता है और बोल्ट टूट जाता है (एक त्रुटि), तो एक सामान्य असिस्टेंट घबरा सकता है या उसी टूटे हुए बोल्ट को बार-बार आज़माता रहेगा। ToolOmni कहता है, "ठीक है, यह काम नहीं किया। मुझे सोचने दें... शायद मुझे एक अलग टूल या एक अलग कोण की आवश्यकता है।" यह वास्तविक समय में अपनी गलती से सीखता है और अपनी योजना को समायोजित करता है।

इसे कैसे सिखाया गया? (ट्रेनिंग कैंप)

आप केवल एक जासूस को बैज देकर यह उम्मीद नहीं कर सकते कि वह तुरंत अच्छा हो जाएगा। शोधकर्ताओं ने ToolOmni को दो चरणों में प्रशिक्षित किया:

  1. "कोल्ड स्टार्ट" (SFT): सबसे पहले, उन्होंने मॉडल को अपराधों को सुलझाने वाले अच्छे जासूसों के हजारों उदाहरण दिखाए। उन्होंने इसे बुनियादी बातें सिखाईं: "यहाँ बताया गया है कि आप प्रश्न कैसे पूछते हैं, यहाँ बताया गया है कि आप टूल का मैनुअल कैसे पढ़ते हैं, और यहाँ बताया गया है कि आप गलती को कैसे सुधारते हैं।" इसने इसे एक ठोस आधार दिया।
  2. "गलती और सुधार" (GRPO के साथ RL): यही असली सीक्रेट सॉस है। उन्होंने मॉडल को एक सिम्युलेटेड दुनिया में अभ्यास करने दिया जहाँ वह विफल हो सकता था।
    • "डिकपल्ड" (Decoupled) ट्रिक: आमतौर पर, यदि आप एक छात्र को "सही किताब खोजने" और "किताब पढ़ने" दोनों के लिए एक साथ पुरस्कृत करते हैं, तो वे भ्रमित हो जाते हैं। ToolOmni इन पुरस्कारों को अलग करता है। इसे सही टूल्स खोजने के लिए एक गोल्ड स्टार मिलता है, और उन्हें सही ढंग से उपयोग करने के लिए एक अलग गोल्ड स्टार मिलता है। यह मॉडल को इस बात के बारे में भ्रमित होने से रोकता है कि उसे काम के किस हिस्से पर ध्यान केंद्रित करने की आवश्यकता है।

यह एक बड़ी बात क्यों है?

शोधकर्ताओं ने ToolBench नामक एक विशाल बेंचमार्क पर अन्य AI मॉडलों के मुकाबले ToolOmni का परीक्षण किया।

  • परिणाम: ToolOmni ने केवल जीत हासिल नहीं की; इसने दबदबा बनाया। इसने अगले सर्वश्रेष्ठ मॉडल की तुलना में 10.8% अधिक कार्यों को हल किया।
  • सुपरपावर: इसने प्रशिक्षण के दौरान देखे गए टूल्स को केवल याद नहीं किया। जब उन्होंने इसे ऐसे नए टूल्स दिए जो इसने पहले कभी नहीं देखे थे (जैसे कि एक नए प्रकार का मौसम ऐप), तब भी इसने समझ लिया कि उनका उपयोग कैसे करना है। इसने केवल विशिष्ट टूल्स का उपयोग करना नहीं सीखा, बल्कि टूल्स का उपयोग करने की अवधारणा को सीखा।

निष्कर्ष

ToolOmni को एक ऐसे पर्यटक और एक स्थानीय गाइड के बीच के अंतर के रूप में देखें जो सड़क बदलने पर भी शहर में रास्ता निकालना जानता है।

  • पुराना AI: "मैं 'Weather' नाम का एक टूल देखता हूँ। मैं इसका उपयोग करूँगा।" (यदि टूल थोड़ा अलग है, तो अक्सर विफल हो जाता है)।
  • ToolOmni: "मुझे मौसम के डेटा की आवश्यकता है। मुझे खोजने दें, टूल को सत्यापित करने दें, जांच लें कि क्या यह काम करता है, और यदि यह विफल हो जाता है, तो मुझे उत्तर प्राप्त करने तक एक अलग दृष्टिकोण आज़माने दें।"

यह AI को एक निष्क्रिय टूल-उपयोगकर्ता से एक सक्रिय समस्या-समाधानकर्ता में बदल देता है जो इंटरनेट की अव्यवस्थित और अप्रत्याशित दुनिया को संभाल सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →