← नवीनतम पेपर
🤖 AI

GOAT: A Training Framework for Goal-Oriented Agent with Tools

यह शोध पत्र GOAT को पेश करता है, जो एक नया प्रशिक्षण ढांचा (training framework) है जो दस्तावेज़ों (documentation) से स्वचालित रूप से लक्ष्य-उन्मुख API निष्पादन डेटा (goal-oriented API execution data) को संश्लेषित करके, बिना मानव एनोटेशन के जटिल टूल उपयोग के लिए ओपन-सोर्स LLM एजेंटों को फाइन-ट्यून करने में सक्षम बनाता है, जिससे मौजूदा बेंचमार्क और एक नए प्रस्तावित GOATBench पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunji Min, Sangwon Jung, Junyoung Sung, Dosung Lee, Leekyeung Han, Paul Hongsuck Seo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन (AI) है जो किताबें पढ़ सकता है और कहानियाँ लिख सकता है। हालाँकि, यदि आप उस लाइब्रेरियन से लाइब्रेरी के पिछले कमरे में जाने, पुराने नक्शों का एक विशिष्ट बॉक्स खोजने, उसमें से एक विशिष्ट पन्ना निकालने और फिर उस पन्ने का उपयोग करके कुकबुक में एक विशिष्ट रेसिपी खोजने के लिए कहते हैं, तो वह अक्सर भटक जाता है। वे गलत बॉक्स चुन सकते हैं, गलत किताब खोल सकते हैं, या रसोई में नक्शे का पन्ना लाना भूल सकते हैं।

यही समस्या वर्तमान AI एजेंटों के साथ है जब वे "टूल्स" (जैसे API, जो डेटाबेस, मौसम सेवाओं या मूवी लिस्ट के डिजिटल कनेक्शन हैं) का उपयोग करने की कोशिश करते हैं। वे बातचीत करने में तो बहुत अच्छे हैं, लेकिन एक ऐसे बहु-चरणीय मिशन की योजना बनाने में बहुत खराब हैं जहाँ एक चरण पूरी तरह से पिछले चरण के परिणाम पर निर्भर करता है।

यह पेपर GOAT (Goal-Oriented Agent with Tools) पेश करता है, जो एक नया प्रशिक्षण तरीका है जिसे उस भ्रमित लाइब्रेरियन को एक कुशल जासूस बनाने के लिए डिज़ाइन किया गया है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:

समस्या: "अनुमान लगाने का खेल"

आमतौर पर, AI को टूल्स का उपयोग करना सिखाने के लिए, शोधकर्ताओं को मनुष्यों को हजारों उदाहरण लिखने के लिए काम पर रखना पड़ता है जैसे: "पहले, बारिश के लिए वेदर API से पूछें। फिर, उस 'बारिश' वाले उत्तर को लें और कपड़ों के API से रेनकोट के लिए पूछें।"
यह महंगा और धीमा है। इन मानव-लिखित उदाहरणों के बिना, AI मॉडल केवल अनुमान लगाते हैं। वे अक्सर उन जटिल कार्यों में विफल हो जाते हैं जिनमें कई चरणों को एक साथ जोड़ने की आवश्यकता होती है।

समाधान: "रिवर्स इंजीनियरिंग" किचन

GOAT के लेखकों ने महसूस किया कि उन्हें निर्देशों को लिखने के लिए मनुष्यों की आवश्यकता नहीं थी। उनके पास "कुकबुक" (API दस्तावेज़) पहले से ही मौजूद थी। AI से तैयार व्यंजन से रेसिपी का अनुमान लगाने के लिए कहने के बजाय, उन्होंने तय किया कि पहले व्यंजन बनाएँ, फिर रेसिपी का वर्णन करें।

वे एक "कॉल-फर्स्ट" (Call-First) रणनीति का उपयोग करते हैं:

  1. किचन का मानचित्र बनाना: सबसे पहले, सिस्टम सभी API मैनुअल को पढ़ता है और एक मानचित्र बनाता है कि टूल्स एक-दूसरे से कैसे जुड़ते हैं। (उदाहरण के लिए, "'वेदर' टूल का आउटपुट 'अम्ब्रेला' टूल के इनपुट में पूरी तरह से फिट बैठता है")।
  2. भोजन पकाना (कॉल-फर्स्ट स्टेप): सिस्टम इस मानचित्र पर एक रास्ता चुनता है और वास्तव में टूल्स को चलाता है। यह वेदर टूल से डेटा मांगता है, परिणाम प्राप्त करता है, और फिर तुरंत उस परिणाम का उपयोग अम्ब्रेला टूल से पूछने के लिए करता है। यह अनुमान नहीं लगाता; यह वास्तविक कदम उठाता है और वास्तविक उत्तर प्राप्त करता है।
  3. रेसिपी लिखना (एब्स्ट्रैक्शन स्टेप): बाद में जब टूल्स अपना काम कर लेते हैं, तो AI घटनाओं की इस पूरी श्रृंखला को देखता है और एक उपयोगकर्ता क्वेरी (User Query) लिखता है जो इससे मेल खाती हो। वह अनिवार्य रूप से कहता है, "ओह, मैंने अभी रेनकोट खोजने के लिए ये सभी चरण पूरे किए। इसलिए, एक उपयोगकर्ता जो 'अगर बारिश हो रही है तो मुझे क्या पहनना चाहिए?' पूछता है, वह वही है जिसे मैंने अभी हल किया है।"

इस तरह उलटे क्रम में (Action \rightarrow Question) करके, AI बिना किसी मानव द्वारा निर्देश लिखे, टूल्स के जुड़ने के सही तर्क को सीख जाता है। यह पहले काम करके, फिर उसे समझाने के माध्यम से सीखता है।

परिणाम: एक सुपर-हेल्पर

लेखकों ने अपने नए "GOAT" से प्रशिक्षित एजेंटों का परीक्षण कई चुनौतियों पर किया:

  • RestBench और API-Bank: ये ऐसी परीक्षाएँ हैं जहाँ AI को टूल्स की एक श्रृंखला का उपयोग करके मूवी रिव्यू या संगीत की सिफारिशें ढूंढनी होती हैं।
  • GOAT-Bench: लेखकों ने इन प्रकार के जटिल, बहु-चरणीय कार्यों के लिए एक नया, बड़ा एग्जाम विशेष रूप रूप से बनाया है।

निष्कर्ष स्पष्ट थे:

  • ओपन-सोर्स मॉडल: GOAT से पहले, छोटे, ओपन-सोर्स AI मॉडल (जो मुफ्त हैं और सभी के लिए उपलब्ध हैं) इन जटिल कार्यों में लगभग बेकार थे। वे लगभग 100% बार विफल हो जाते थे।
  • GOAT के बाद: इस नए तरीके से प्रशिक्षित होने के बाद, वे समान ओपन-सोर्स मॉडल इन कार्यों में अविश्वसनीय रूप से अच्छे हो गए। कुछ मामलों में, वे महंगे, क्लोज्ड-सोर्स मॉडल (जैसे GPT-4) से भी बेहतर प्रदर्शन करते हैं जो आमतौर पर इन परीक्षणों में दबदबा रखते हैं।
  • मानव की आवश्यकता नहीं: पूरा प्रशिक्षण डेटासेट सिस्टम द्वारा स्वचालित रूप से API मैनुअल का उपयोग करके बनाया गया था। किसी भी इंसान को बैठकर चरण-दर-चरण निर्देश लिखने की आवश्यकता नहीं पड़ी।

मुख्य बात

GOAT, AI एजेंटों को पहले वास्तविक काम का अभ्यास करने देकर, फिर लक्ष्य का वर्णन करना सिखाकर, टूल्स का उपयोग करने और योजना बनाने का एक तरीका है। यह ओपन-सोर्स AI मॉडल को महंगे मानव शिक्षकों की आवश्यकता के बिना "भ्रमित अनुमान लगाने वालों" से "विश्वसनीय योजनाकारों" में बदल देता है। लेखकों ने अपने कोड और अपने नए टेस्ट सूट (GOAT-Bench) को दूसरों के उपयोग के लिए उपलब्ध करा दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →