← नवीनतम पेपर
🤖 AI

AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios

यह शोध पत्र AsyncTool को प्रस्तुत करता है, जो सिम्युलेटेड लेटेंसी (simulated latency) के साथ मल्टी-टास्क परिदृश्यों में LLM-आधारित एजेंटों की एसिंक्रोनस टूल-कॉलिंग क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल विलंबित टूल प्रतिक्रियाओं को संभालने के दौरान टेम्पोरल कोऑर्डिनेशन (temporal coordination) और दक्षता के मामले में संघर्ष करते हैं।

मूल लेखक: Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shiting Huang (University of Science and Technology of China), Avery Nie (Universit
प्रकाशित 2026-05-28
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kou Shi (University of Science and Technology of China), Ziao Zhang (University of Science and Technology of China), Shiting Huang (University of Science and Technology of China), Avery Nie (University of Toronto), Zhen Fang (University of Science and Technology of China), Qiuchen Wang (University of Science and Technology of China), Lin Chen (University of Science and Technology of China), Huaian Chen (University of Science and Technology of China), Zehui Chen (University of Science and Technology of China), Feng Zhao (University of Science and Technology of China)

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ AsyncTool पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।

मुख्य विचार: "व्यस्त बरिस्ता" (Busy Barista) की समस्या

कल्पना कीजिए कि आप एक व्यस्त कॉफी शॉप में एक कुशल बरिस्ता (AI एजेंट) हैं। आपके पास कुछ ऑर्डर्स की सूची है:

  1. ऑर्डर A: एक जटिल एस्प्रेसो बनाना (इसमें 30 सेकंड लगेंगे)।
  2. ऑर्डर B: लाटे के लिए बीन्स पीसना (इसमें 5 सेकंड लगेंगे)।
  3. ऑर्डर C: काउंटर साफ करना (इसमें 2 सेकंड लगेंगे)।

पुराना तरीका (Synchronous):
अतीत में, AI बरिस्ता के अधिकांश परीक्षण केवल यह जाँचते थे कि क्या वे एक ड्रिंक पूरी तरह से बना सकते हैं। यदि वे ऑर्डर A शुरू करते, तो वे एस्प्रेसो मशीन को देखते हुए वहीं खड़े रहते, और 30 सेकंड पूरे होने तक कुछ और नहीं करते। उसके बाद ही वे ऑर्डर B पर बढ़ते। यह अविश्वसनीय रूप से अक्षम (inefficient) है।

नई वास्तविकता (Asynchronous):
वास्तविक दुनिया में, आप केवल स्थिर होकर खड़े नहीं रहते। जब एस्प्रेसो बन रहा होता है, तब एक स्मार्ट बरिस्ता ऑर्डर B के लिए बीन्स लेता है और ऑर्डर C के लिए काउंटर साफ करता है। जैसे ही एस्प्रेसो तैयार होता है, वे तुरंत वापस एस्प्रेसो की ओर मुड़ जाते हैं। इसे ही एसिंक्रोनस टूल कॉलिंग (Asynchronous Tool Calling) कहा जाता है।

AsyncTool क्या है?

इस पेपर के लेखकों ने महसूस किया कि वर्तमान AI परीक्षण "पुराने तरीके" की तरह हैं। वे यह जाँचते हैं कि क्या एक AI टूल्स (जैसे वेब सर्च करना या कोड चलाना) का उपयोग कर सकता है, लेकिन वे यह मान लेते हैं कि टूल्स तुरंत जवाब देते हैं। वास्तव में, टूल्स को जवाब देने में समय लगता है।

AsyncTool एक नया "एग्जाम" (परीक्षा) है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या एक AI "व्यस्त बरिस्ता" वाली स्थिति को संभाल सकता है। यह तीन विशिष्ट कौशलों का परीक्षण करता है:

  1. इंतज़ार करना (Waiting): क्या AI यह समझ पाता है कि टूल "सोच" रहा है और वह केवल अनुमान लगाने के बजाय सही उत्तर का इंतज़ार कर सकता है?
  2. बदलना (Switching): क्या AI कार्य A को रोक सकता है, कार्य B पर जा सकता है, और फिर उत्तर आने पर कार्य A पर वापस आने को याद रख सकता है?
  3. ट्रैकिंग (Tracking): क्या AI बिना भ्रमित हुए यह ट्रैक रख सकता है कि कौन सा टूल किस कार्य से संबंधित है?

उन्होंने टेस्ट कैसे बनाया (रेसिपी)

इस परीक्षा को बनाने के लिए, शोधकर्ताओं ने केवल मनगढ़ंत प्रश्न नहीं बनाए। उन्होंने एक सावधानीपूर्वक रेसिपी का पालन किया:

  1. सामग्री एकत्र की (Gathered Ingredients): उन्होंने अन्य बेंचमार्क्स से मौजूदा, उच्च-गुणवत्ता वाले सिंगल-टास्क डेटा (जैसे "फ्लाइट खोजें") लिए।
  2. मार्ग का पुनर्निर्माण किया (Reconstructed the Path): उन्होंने इन कार्यों को स्पष्ट, चरण-दर-चरण निर्देशों के साथ फिर से लिखने के लिए एक शक्तिशाली AI (Gemini 2.5 Pro) का उपयोग किया।
  3. मानवीय प्रूफरीडिंग (Human Proofreading): मनुष्यों ने काम की जाँच की ताकि यह सुनिश्चित हो सके कि चरण वास्तव में तर्कसंगत हैं और टूटे हुए नहीं हैं।
  4. "मिश्रण" (The Mix): उन्होंने इन एकल कार्यों को समूहों में मिलाया। कभी-कभी उन्होंने AI को दो समान कार्य दिए (जैसे दो फ्लाइट सर्च), और कभी-कभी दो बहुत अलग कार्य (जैसे एक फ्लाइट सर्च और एक फाइल मैनेजमेंट जॉब)।
  5. देरी का अनुकरण किया (Simulated the Delay): उन्होंने टेस्ट को इस तरह प्रोग्राम किया कि जब AI कोई प्रश्न पूछता, तो "टूल" जवाब देने से पहले कहता, "मैं इस पर काम कर रहा हूँ, थोड़ा इंतज़ार करें," और फिर उत्तर देता।

वे AI को कैसे ग्रेड करते थे

उन्होंने केवल अंतिम परिणाम नहीं देखा। उन्होंने एक शिक्षक की तरह तीन स्तरों पर AI को ग्रेड किया:

  • स्टेप लेवल (Step Level): क्या AI ने सही शब्दों के साथ सही सवाल पूछा? (उदाहरण के लिए, क्या उसने टूल का नाम सही वर्तनी के साथ लिखा?)
  • सब-टास्क लेवल (Sub-Task Level): क्या उसने एक छोटा काम सही ढंग से पूरा किया? (उदाहरण के लिए, क्या उसने सफलतापूर्वक फ्लाइट ढूँढ ली?)
  • टास्क लेवल (Task Level): क्या उसने अपने सभी अलग-अलग ऑर्डर्स को पूरा करते हुए पूरा असाइनमेंट सफलतापूर्वक खत्म किया?

उन्होंने एक विशेष "एफिशिएंसी स्कोर" (Efficiency Score) भी जोड़ा। इसने मापा कि AI कितनी बार कार्यों के बीच स्विच करता था। एक अच्छा स्कोर यह दर्शाता है कि AI कुशल होने के लिए पर्याप्त बार स्विच करता था, लेकिन इतना भी नहीं कि वह भ्रमित हो जाए।

उन्हें क्या मिला (परिणाम)

शोधकर्ताओं ने 19 अलग-अलग AI मॉडल (बड़े कमर्शियल मॉडल जैसे GPT-4.1 और ओपन-सोर्स दोनों) का परीक्षण किया। यहाँ क्या हुआ:

  • "समय" का झटका (The "Time" Shock): जब टूल्स में देरी हुई, तो लगभग हर AI काफी खराब प्रदर्शन करने लगा। यह ऐसा था जैसे कोई परीक्षा देते समय लगातार आपके कंधे पर थपथपा रहा हो।
  • "हैलुसिनेशन" का जाल (The "Hallucination" Trap): कई कमजोर AI इंतज़ार नहीं कर सके। जब उन्होंने किसी डेटा के लिए टूल से पूछा, तो उन्होंने उत्तर का इंतज़ार नहीं किया। इसके बजाय, उन्होंने उत्तर का अनुमान लगाया और आगे बढ़ गए। इससे गलतियाँ हुईं।
  • "भूलने" की समस्या (The "Forgetfulness" Issue): कुछ AI कार्य A शुरू करते, कार्य B पर स्विच करते, और फिर पूरी तरह भूल जाते कि कार्य A अस्तित्व में भी है। वे कार्य B को पूरा करते और कह देते, "काम पूरा हुआ!" जबकि कार्य A अभी भी इंतज़ार कर रहा था।
  • विजेता (The Winners): सबसे अच्छे मॉडल (जैसे GPT-4.1) वे थे जो तालमेल (juggle) बिठा सकते थे। वे जानते थे कि कब कार्यों के बीच स्विच करना है और कब इंतज़ार करना है। वे बेतरतीब ढंग से स्विच नहीं करते थे; वे रणनीतिक रूप से स्विच करते थे।

मुख्य निष्कर्ष

पेपर यह निष्कर्ष निकालता है कि टूल्स का उपयोग करने में अच्छा होने का मतलब केवल यह जानना नहीं है कि कौन सा टूल उपयोग करना है। यह समय (timing) के बारे में है।

वास्तविक दुनिया में एक प्रभावी AI एजेंट बनने के लिए, उसे एक अच्छा प्रोजेक्ट मैनेजर होना चाहिए। उसे पता होना चाहिए:

  • "मैं इस परिणाम का इंतज़ार कर रहा हूँ, इसलिए मैं इंतज़ार करते समय यह दूसरा काम करूँगा।"
  • "ओह, परिणाम आ गया! मुझे अपना काम रोकना होगा और पहले उस कार्य को पूरा करना होगा।"

पेपर का तर्क है कि भविष्य के AI सिस्टम को वास्तव में उपयोगी होने के लिए इस "टेम्पोरल कोऑर्डिनेशन" (समय और प्रतीक्षा का प्रबंधन) में बेहतर होने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →