← नवीनतम पेपर
💬 NLP

The Tool Decathlon: Benchmarking Language Agents for Diverse, Realistic, and Long-Horizon Task Execution

यह शोधपत्र Toolathlon को प्रस्तुत करता है, जो 32 विविध अनुप्रयोगों और सत्यापन योग्य निष्पादन वाले 108 यथार्थवादी, दीर्घ-क्षितिज (long-horizon) कार्यों वाला एक व्यापक बेंचमार्क है, जिसे जटिल, वास्तविक दुनिया के बहु-चरणीय वर्कफ़्लो में वर्तमान अत्याधुनिक भाषा एजेंटों की महत्वपूर्ण सीमाओं का कठोरता से मूल्यांकन करने और उन्हें उजागर करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xin
प्रकाशित 2026-02-27
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Junlong Li, Wenshuo Zhao, Jian Zhao, Weihao Zeng, Haoze Wu, Xiaochen Wang, Rui Ge, Yuxuan Cao, Yuzhen Huang, Wei Liu, Junteng Liu, Zhaochen Su, Yiyang Guo, Fan Zhou, Lueyang Zhang, Juan Michelini, Xingyao Wang, Xiang Yue, Shuyan Zhou, Graham Neubig, Junxian He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक नया पर्सनल असिस्टेंट (व्यक्तिगत सहायक) रख रहे हैं। अतीत में, आप शायद उनका परीक्षण "मौसम कैसा है?" या "मेरी माँ को एक छोटा ईमेल लिखें" जैसे सरल प्रश्नों के साथ करते। यदि वे इन्हें सही कर लेते, तो आप सोचते, "शानदार, वे वास्तविक दुनिया के लिए तैयार हैं!"

लेकिन वास्तविक दुनिया सरल नहीं होती। यह अव्यवस्थित, जटिल है और इसमें एक साथ कई चीजों को संभालने की आवश्यकता होती है।

यह शोध पत्र टूल डेकाथलॉन (TOOLATHLON) को पेश करता है, जो AI सहायकों (जिन्हें "लैंग्वेज एजेंट्स" कहा जाता है) के लिए एक नया, बहुत कठिन परीक्षण है, ताकि यह देखा जा सके कि क्या वे वास्तव में वास्तविक जीवन की नौकरियों के लिए तैयार हैं।

यहाँ बताया गया है कि उन्होंने क्या किया, कुछ रोजमर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. पुराने परीक्षण बनाम वास्तविक दुनिया

पुराना तरीका: पिछले परीक्षण एक वीडियो गेम की तरह थे। AI को एक नकली, सरल दुनिया दी जाती थी जहाँ सब कुछ पूरी तरह से काम करता था। यदि AI को "ईमेल भेजना" होता, तो परीक्षण केवल यह जाँचता था कि उसने सही शब्द टाइप किए या नहीं। इसने वास्तव में ईमेल नहीं भेजा, और "इनबॉक्स" खाली और साफ था।
नया तरीका (TOOLATHLONE): यह एक वास्तविक जीवन की इंटर्नशिप की तरह है। AI को एक वास्तविक, अव्यवस्थित कार्यालय में छोड़ दिया जाता है।

  • इनबॉक्स खाली नहीं है; इसमें 50 ईमेल हैं, जिनमें कुछ स्पैम और कुछ जरूरी होमवर्क असाइनमेंट भी हैं।
  • कैलेंडर मीटिंगों से भरा हुआ है।
  • कंप्यूटर में वास्तविक फाइलें हैं, जिनमें से कुछ खराब या गायब हैं।
  • काम पूरा करने के लिए AI को 32 अलग-अलग वास्तविक सॉफ्टवेयर ऐप्स (जैसे गूगल कैलेंडर, नोशन, एक वास्तविक डेटाबेस और यहाँ तक कि एक नकली ऑनलाइन स्टोर) का उपयोग करना होगा।

2. "बाधा दौड़" (डेकाथलॉन)

"डेकाथलॉन" नाम ओलंपिक खेल से आता है जहाँ एथलीटों को दौड़ना, कूदना, फेंकना और तैरना पड़ता है। यह केवल एक कौशल नहीं है; यह सब कुछ का मिश्रण है।

TOOLATHLON AI के लिए एक बाधा दौड़ है जिसमें 108 अलग-अलग कार्य हैं।

  • उदाहरण कार्य 1: "होमवर्क सबमिशन के लिए मेरा ईमेल चेक करें, कोड डाउनलोड करें, यह देखने के लिए इसे अपने कंप्यूटर पर चलाएं कि क्या यह टूट जाता है, और यदि यह काम करता है, तो छात्र को ग्रेडिंग वेबसाइट पर 10/10 दें। यदि यह टूट जाता है, तो उन्हें 0 दें।"
    • यह कठिन क्यों है: AI को एक ईमेल पढ़ना, एक फ़ाइल सहेजना, टर्मिनल में कमांड टाइप करना, त्रुटियों की जांच करना और फिर ग्रेडिंग साइट में लॉग इन करना होगा। यदि वह किसी भी चरण में गलती करता है, तो पूरा कार्य विफल हो जाता है।
  • उदाहरण कार्य 2: "हमारे ग्राहक सहायता डेटाबेस को देखें। यदि कोई टिकट बहुत लंबे समय से लंबित है, तो यह देखने के लिए मैनुअल पढ़ें कि क्या करना है, फिर ग्राहक को माफी का ईमेल और मैनेजर को रिमाइंडर भेजें।"
    • यह कठिन क्यों है: AI को सही डेटा खोजना होगा, एक PDF मैनुअल (जो भ्रमित करने वाला हो सकता है) को पढ़ना होगा, और फिर सही लहजे के साथ दो अलग-अलग ईमेल लिखने होंगे।

3. "धुंधले" निर्देश

वास्तविक जीवन में, बॉस आदर्श, चरण-दर-चरण निर्देश नहीं देते। वे कहते हैं, "हे, क्या आप होमवर्क ग्रेडिंग संभाल सकते हैं?" बिना यह बताए कि इसे ठीक से कैसे करना है।

TOOLATHLON इसे दर्शाता है। निर्देश अस्पष्ट और "धुंधले" (fuzzy) हैं।

  • पुराना परीक्षण: "चरण 1: ईमेल खोलें। चरण 2: अटैचमेंट डाउनलोड करें। चरण 3: कोड चलाएं।"
  • TOOLATHLON: "होमवर्क ग्रेड करें।"
    AI को खुद यह पता लगाना होगा कि कैसे करना है। उसे पर्यावरण (फाइलों, ईमेल) को देखना होगा और यह अनुमान लगाना होगा कि क्या करना है, ठीक वैसे ही जैसे एक इंसान करेगा।

4. परिणाम: AI अभी भी एक नौसिखिया है

शोधकर्ताओं ने दुनिया के सबसे स्मार्ट AI मॉडल (जैसे Claude, GPT-5, और DeepSeek) का इस नए, कठिन कोर्स पर परीक्षण किया।

स्कोरकार्ड:

  • सबसे अच्छा AI (Claude-4.5-Sonnet): लगभग 39% कार्यों को सही ढंग से पूरा कर पाया।
  • ओपन-सोर्स AI (DeepSeek): लगभग 20% सही कर पाया।

इसका क्या अर्थ है?
यहाँ तक कि "सबसे स्मार्ट" AI भी इस नए, कठिन कोर्स पर उन कार्यों में विफल हो रहा है जिन्हें एक सक्षम मानव इंटर्न शायद समझ लेता।

वे क्यों विफल हो रहे हैं?

  1. शोर में खो जाना: जब AI को फाइलों की एक बड़ी सूची या एक लंबा ईमेल थ्रेड देखना पड़ता है, तो वह भ्रमित हो जाता है और भूल जाता है कि वह क्या कर रहा था।
  2. टूल कन्फ्यूजन (उपकरणों का भ्रम): वह गलत टूल का उपयोग करने की कोशिश करता है (जैसे पेचकश की जगह हथौड़ा इस्तेमाल करना) या ऐसे टूल को कॉल करता है जो मौजूद ही नहीं है।
  3. जल्दी हार मान लेना: कुछ कार्यों में बहुत समय लगता है (जैसे 100 फाइलें चेक करना)। AI थक जाता है, सोचता है कि उसका काम हो गया, और काम पूरा करने से पहले ही रुक जाता है।

5. यह क्यों मायने रखता है

TOOLATHLON को एक रियलिटी चेक (वास्तविकता की जाँच) के रूप में देखें।

लंबे समय से, हमें लगा कि AI हमारी नौकरियों को संभालने के लिए लगभग तैयार है। यह शोध पत्र कहता है, "अभी नहीं।" यह हमें दिखाता है कि AI कहाँ कमजोर है। यह यह नहीं है कि AI भाषा को नहीं समझ सकता; बल्कि यह है कि वह वास्तविक सॉफ्टवेयर के साथ काम करने की अव्यवस्थित, लंबी, बहु-चरणीय वास्तविकता को नहीं संभाल सकता।

इस कठिन परीक्षण को बनाकर, शोधकर्ता उम्मीद करते हैं कि वे AI डेवलपर्स को अधिक स्मार्ट, अधिक मजबूत सहायक बनाने के लिए मजबूर करेंगे जो वास्तव में वास्तविक दुनिया की अराजकता को संभाल सकें, न कि केवल सरल वीडियो-गेम परीक्षणों को पास कर सकें।

संक्षेप में: TOOLATHLON AI सहायकों के लिए "फाइनल एग्जाम" है, और फिलहाल, अधिकांश फेल हो रहे हैं। लेकिन अब हमें पता है कि पास होने के लिए उन्हें क्या पढ़ने की जरूरत है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →