AsyncTool: Evaluating the Asynchronous Function Calling Capability under Multi-Task Scenarios
यह शोध पत्र AsyncTool को प्रस्तुत करता है, जो सिम्युलेटेड लेटेंसी (simulated latency) के साथ मल्टी-टास्क परिदृश्यों में LLM-आधारित एजेंटों की एसिंक्रोनस टूल-कॉलिंग क्षमताओं का मूल्यांकन करने के लिए डिज़ाइन किया गया एक नया बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान मॉडल विलंबित टूल प्रतिक्रियाओं को संभालने के दौरान टेम्पोरल कोऑर्डिनेशन (temporal coordination) और दक्षता के मामले में संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ AsyncTool पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए हिंदी अनुवाद दिया गया है।
मुख्य विचार: "व्यस्त बरिस्ता" (Busy Barista) की समस्या
कल्पना कीजिए कि आप एक व्यस्त कॉफी शॉप में एक कुशल बरिस्ता (AI एजेंट) हैं। आपके पास कुछ ऑर्डर्स की सूची है:
- ऑर्डर A: एक जटिल एस्प्रेसो बनाना (इसमें 30 सेकंड लगेंगे)।
- ऑर्डर B: लाटे के लिए बीन्स पीसना (इसमें 5 सेकंड लगेंगे)।
- ऑर्डर C: काउंटर साफ करना (इसमें 2 सेकंड लगेंगे)।
पुराना तरीका (Synchronous):
अतीत में, AI बरिस्ता के अधिकांश परीक्षण केवल यह जाँचते थे कि क्या वे एक ड्रिंक पूरी तरह से बना सकते हैं। यदि वे ऑर्डर A शुरू करते, तो वे एस्प्रेसो मशीन को देखते हुए वहीं खड़े रहते, और 30 सेकंड पूरे होने तक कुछ और नहीं करते। उसके बाद ही वे ऑर्डर B पर बढ़ते। यह अविश्वसनीय रूप से अक्षम (inefficient) है।
नई वास्तविकता (Asynchronous):
वास्तविक दुनिया में, आप केवल स्थिर होकर खड़े नहीं रहते। जब एस्प्रेसो बन रहा होता है, तब एक स्मार्ट बरिस्ता ऑर्डर B के लिए बीन्स लेता है और ऑर्डर C के लिए काउंटर साफ करता है। जैसे ही एस्प्रेसो तैयार होता है, वे तुरंत वापस एस्प्रेसो की ओर मुड़ जाते हैं। इसे ही एसिंक्रोनस टूल कॉलिंग (Asynchronous Tool Calling) कहा जाता है।
AsyncTool क्या है?
इस पेपर के लेखकों ने महसूस किया कि वर्तमान AI परीक्षण "पुराने तरीके" की तरह हैं। वे यह जाँचते हैं कि क्या एक AI टूल्स (जैसे वेब सर्च करना या कोड चलाना) का उपयोग कर सकता है, लेकिन वे यह मान लेते हैं कि टूल्स तुरंत जवाब देते हैं। वास्तव में, टूल्स को जवाब देने में समय लगता है।
AsyncTool एक नया "एग्जाम" (परीक्षा) है जिसे यह देखने के लिए डिज़ाइन किया गया है कि क्या एक AI "व्यस्त बरिस्ता" वाली स्थिति को संभाल सकता है। यह तीन विशिष्ट कौशलों का परीक्षण करता है:
- इंतज़ार करना (Waiting): क्या AI यह समझ पाता है कि टूल "सोच" रहा है और वह केवल अनुमान लगाने के बजाय सही उत्तर का इंतज़ार कर सकता है?
- बदलना (Switching): क्या AI कार्य A को रोक सकता है, कार्य B पर जा सकता है, और फिर उत्तर आने पर कार्य A पर वापस आने को याद रख सकता है?
- ट्रैकिंग (Tracking): क्या AI बिना भ्रमित हुए यह ट्रैक रख सकता है कि कौन सा टूल किस कार्य से संबंधित है?
उन्होंने टेस्ट कैसे बनाया (रेसिपी)
इस परीक्षा को बनाने के लिए, शोधकर्ताओं ने केवल मनगढ़ंत प्रश्न नहीं बनाए। उन्होंने एक सावधानीपूर्वक रेसिपी का पालन किया:
- सामग्री एकत्र की (Gathered Ingredients): उन्होंने अन्य बेंचमार्क्स से मौजूदा, उच्च-गुणवत्ता वाले सिंगल-टास्क डेटा (जैसे "फ्लाइट खोजें") लिए।
- मार्ग का पुनर्निर्माण किया (Reconstructed the Path): उन्होंने इन कार्यों को स्पष्ट, चरण-दर-चरण निर्देशों के साथ फिर से लिखने के लिए एक शक्तिशाली AI (Gemini 2.5 Pro) का उपयोग किया।
- मानवीय प्रूफरीडिंग (Human Proofreading): मनुष्यों ने काम की जाँच की ताकि यह सुनिश्चित हो सके कि चरण वास्तव में तर्कसंगत हैं और टूटे हुए नहीं हैं।
- "मिश्रण" (The Mix): उन्होंने इन एकल कार्यों को समूहों में मिलाया। कभी-कभी उन्होंने AI को दो समान कार्य दिए (जैसे दो फ्लाइट सर्च), और कभी-कभी दो बहुत अलग कार्य (जैसे एक फ्लाइट सर्च और एक फाइल मैनेजमेंट जॉब)।
- देरी का अनुकरण किया (Simulated the Delay): उन्होंने टेस्ट को इस तरह प्रोग्राम किया कि जब AI कोई प्रश्न पूछता, तो "टूल" जवाब देने से पहले कहता, "मैं इस पर काम कर रहा हूँ, थोड़ा इंतज़ार करें," और फिर उत्तर देता।
वे AI को कैसे ग्रेड करते थे
उन्होंने केवल अंतिम परिणाम नहीं देखा। उन्होंने एक शिक्षक की तरह तीन स्तरों पर AI को ग्रेड किया:
- स्टेप लेवल (Step Level): क्या AI ने सही शब्दों के साथ सही सवाल पूछा? (उदाहरण के लिए, क्या उसने टूल का नाम सही वर्तनी के साथ लिखा?)
- सब-टास्क लेवल (Sub-Task Level): क्या उसने एक छोटा काम सही ढंग से पूरा किया? (उदाहरण के लिए, क्या उसने सफलतापूर्वक फ्लाइट ढूँढ ली?)
- टास्क लेवल (Task Level): क्या उसने अपने सभी अलग-अलग ऑर्डर्स को पूरा करते हुए पूरा असाइनमेंट सफलतापूर्वक खत्म किया?
उन्होंने एक विशेष "एफिशिएंसी स्कोर" (Efficiency Score) भी जोड़ा। इसने मापा कि AI कितनी बार कार्यों के बीच स्विच करता था। एक अच्छा स्कोर यह दर्शाता है कि AI कुशल होने के लिए पर्याप्त बार स्विच करता था, लेकिन इतना भी नहीं कि वह भ्रमित हो जाए।
उन्हें क्या मिला (परिणाम)
शोधकर्ताओं ने 19 अलग-अलग AI मॉडल (बड़े कमर्शियल मॉडल जैसे GPT-4.1 और ओपन-सोर्स दोनों) का परीक्षण किया। यहाँ क्या हुआ:
- "समय" का झटका (The "Time" Shock): जब टूल्स में देरी हुई, तो लगभग हर AI काफी खराब प्रदर्शन करने लगा। यह ऐसा था जैसे कोई परीक्षा देते समय लगातार आपके कंधे पर थपथपा रहा हो।
- "हैलुसिनेशन" का जाल (The "Hallucination" Trap): कई कमजोर AI इंतज़ार नहीं कर सके। जब उन्होंने किसी डेटा के लिए टूल से पूछा, तो उन्होंने उत्तर का इंतज़ार नहीं किया। इसके बजाय, उन्होंने उत्तर का अनुमान लगाया और आगे बढ़ गए। इससे गलतियाँ हुईं।
- "भूलने" की समस्या (The "Forgetfulness" Issue): कुछ AI कार्य A शुरू करते, कार्य B पर स्विच करते, और फिर पूरी तरह भूल जाते कि कार्य A अस्तित्व में भी है। वे कार्य B को पूरा करते और कह देते, "काम पूरा हुआ!" जबकि कार्य A अभी भी इंतज़ार कर रहा था।
- विजेता (The Winners): सबसे अच्छे मॉडल (जैसे GPT-4.1) वे थे जो तालमेल (juggle) बिठा सकते थे। वे जानते थे कि कब कार्यों के बीच स्विच करना है और कब इंतज़ार करना है। वे बेतरतीब ढंग से स्विच नहीं करते थे; वे रणनीतिक रूप से स्विच करते थे।
मुख्य निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि टूल्स का उपयोग करने में अच्छा होने का मतलब केवल यह जानना नहीं है कि कौन सा टूल उपयोग करना है। यह समय (timing) के बारे में है।
वास्तविक दुनिया में एक प्रभावी AI एजेंट बनने के लिए, उसे एक अच्छा प्रोजेक्ट मैनेजर होना चाहिए। उसे पता होना चाहिए:
- "मैं इस परिणाम का इंतज़ार कर रहा हूँ, इसलिए मैं इंतज़ार करते समय यह दूसरा काम करूँगा।"
- "ओह, परिणाम आ गया! मुझे अपना काम रोकना होगा और पहले उस कार्य को पूरा करना होगा।"
पेपर का तर्क है कि भविष्य के AI सिस्टम को वास्तव में उपयोगी होने के लिए इस "टेम्पोरल कोऑर्डिनेशन" (समय और प्रतीक्षा का प्रबंधन) में बेहतर होने की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।