Building Interactive Real-Time Agents with Asynchronous I/O and Speculative Tool Calling
यह शोध पत्र एक ऐसे ढांचे का प्रस्ताव करता है जो जटिल मल्टी-टर्न टूल कॉलिंग के साथ वास्तविक समय, कम-विलंबता वाले एजेंटिक इंटरैक्शन को सक्षम करने के लिए एसिंक्रोनस आई/ओ (Asynchronous I/O) और स्पेक्युलेटिव टूल कॉलिंग (Speculative Tool Calling) को संयोजित करता है, जिससे स्वीकार्य सटीकता बनाए रखते हुए क्लाउड और एज-स्केल मॉडल्स दोनों के लिए महत्वपूर्ण गति प्राप्त होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े धीमे सहायक को निर्देशों का एक जटिल सेट देने की कोशिश कर रहे हैं। पुराने तरीके में (मानक विधि), आपको तब तक इंतज़ार करना पड़ता जब तक कि आप अपना पूरा वाक्य समाप्त न कर लें, इससे पहले कि सहायक वास्तव में सोचने के बारे में भी सोच सके कि क्या करना है। फिर, यदि सहायक को कोई फ़ोन नंबर देखना हो या कोई टेक्स्ट भेजना हो, तो वे बोलना बंद कर देते, वह कार्य करने जाते, परिणाम का इंतज़ार करते, और फिर आपको बताते कि क्या हुआ। यह आने-जाने की प्रक्रिया बहुत सारी चुप्पी और प्रतीक्षा पैदा करती है, जिससे बातचीत अटपटी और अस्वाभाविक लगती है।
यह शोध पत्र AI एजेंटों के काम करने का एक नया तरीका पेश करता है जो वास्तविक समय की मानवीय बातचीत जैसा महसूस होता है। वे इस पद्धति को Asynchronous I/O और Speculative Tool Calling कहते हैं। यह सरल उपमाओं का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:
1. "मल्टीटास्किंग शेफ" (Asynchronous I/O)
एक मानक AI एजेंट को एक ऐसे शेफ के रूप में सोचें जो एक समय में केवल एक ही काम कर सकता है: वे आपके ऑर्डर पूरा करने का इंतज़ार करते हैं, फिर सब्जियां काटते हैं, फिर चूल्हा गर्म होने का इंतज़ार करते हैं, फिर खाना पकाते हैं।
नया तरीका AI को एक मल्टीटास्किंग शेफ में बदल देता है।
- जब आप अभी बोल ही रहे होते हैं: शेफ आपके द्वारा बोले गए पहले कुछ शब्दों के आधार पर सब्जियां काटना शुरू कर देते हैं। वे आपके वाक्य को समाप्त करने का इंतज़ार नहीं करते।
- चूल्हे के इंतज़ार के दौरान: यदि शेफ को किसी टूल (जैसे डेटाबेस लुकअप) के पूरा होने का इंतज़ार करना पड़ता है, तो वे केवल दीवार को घूरते हुए खड़े नहीं रहते। वे उस प्रतीक्षा समय का उपयोग अगले चरण की योजना बनाने या यहाँ तक कि अगली सामग्री की तैयारी शुरू करने के लिए करते हैं।
तकनीकी शब्दों में, इसका मतलब है कि AI आपके बोलने से अपनी सोच को "डिकपल" (अलग) कर देता है। यह आपके या बाहरी दुनिया से जानकारी मिलने का इंतज़ार करते समय स्थिर होने के बजाय काम करता रहता है।
2. "सुरक्षा जाल के साथ जुआरी" (Speculative Tool Calling)
कभी-कभी, AI को एक अनुमान लगाना पड़ता है। कल्पना कीजिए कि आप कहते हैं, "जो (Joe) को कॉल करो..." और AI जानता है कि उसे किसी को कॉल करने की आवश्यकता है, लेकिन वह अभी तक नहीं जानता कि कौन सा जो।
- पुराना तरीका: AI कहेगा, "रुकिए, कौन सा जो?" और स्पष्टीकरण मिलने तक सब कुछ रोक देगा।
- नया तरीका: AI एक अनुमानित (speculative) कदम उठाता है। वह कहता है, "ठीक है, मैं 'जो स्मिथ' को खोजने जा रहा हूँ, बस इस मामले में।" वह प्रक्रिया तुरंत शुरू कर देता है।
सुरक्षा जाल (Safety Net):
शोध पत्र "सुरक्षित" और "असुरक्षित" अनुमानों के बीच एक महत्वपूर्ण अंतर बनाता है:
- सुरक्षित टूल्स (Read-Only): यदि AI केवल फ़ोन नंबर ढूँढ रहा है, तो वह इसे तुरंत कर सकता है। यदि आप बाद में कहते हैं, "दरअसल, मेरा मतलब जो जोन्स से था," तो AI बस नंबर बदल सकता है। इससे कुछ बुरा नहीं हुआ।
- असुरक्षित टूल्स (Write-Only): यदि AI कोई टेक्स्ट मैसेज भेजने या फ़ाइल हटाने वाला है, तो वह केवल अनुमान नहीं लगा सकता। वह उस क्रिया को एक "लंबित" (pending) बॉक्स में रखता है। वह संदेश तैयार करता है लेकिन वास्तव में "भेजें" बटन दबाने से पहले अंतिम "ग्रीन लाइट" (यह पुष्टि कि आप बोलना समाप्त कर चुके हैं) का इंतज़ार करता है।
यदि AI गलत अनुमान लगाता है और आप अपना विचार बदल लेते हैं, तो वह क्रिया के होने से पहले ही उसे रद्द कर सकता है। यह एक शेफ द्वारा प्याज काटना शुरू करने जैसा है, लेकिन यदि आप कहें, "दरअसल, मैं शाकाहारी हूँ," तो चाकू बोर्ड को छूने से पहले ही रुक जाता है।
3. "घड़ी-आधारित प्रशिक्षण" (Clock-Based Training)
AI को यह सिखाने के लिए, शोधकर्ताओं ने केवल उसे "तेज़ होने" के लिए नहीं कहा। उन्होंने एक विशेष प्रशिक्षण जिम बनाया जिसमें एक घड़ी थी।
- इस जिम में, AI को यह उम्मीद करने के लिए प्रशिक्षित किया जाता है कि जानकारी (जैसे आपकी आवाज़ या किसी टूल का उत्तर) विशिष्ट, विलंबित क्षणों पर आएगी।
- AI इन देरी के दौरान काम करना सीख जाता है।
- उन्होंने प्रशिक्षण डेटा में नकली "गलतियाँ" भी बनाईं जहाँ AI ने शुरुआत में गलत अनुमान लगाया, जिससे उसे बिना घबराए बाद में इन गलतियों को सुधारना सीखने के लिए मजबूर किया गया।
परिणाम
उन्होंने दो प्रकार के AI पर इसका परीक्षण किया:
- बड़े क्लाउड मॉडल: शक्तिशाली मौजूदा AI API (जैसे OpenAI के) का उपयोग करते समय, इस पद्धति ने उन्हें सटीकता में मामूली गिरावट के साथ 1.3 से 1.7 गुना तेज़ बना दिया।
- छोटे एज मॉडल्स (Edge Models): जब उन्होंने अपने विशेष "घclock" तरीके का उपयोग करके छोटे AI मॉडल (जैसे कि वे जो लैपटॉप पर चल सकते हैं) को प्रशिक्षित किया, तो ये मॉडल उच्च सटीकता बनाए रखते हुए 1.6 से 2.2 गुना तेज़ हो गए।
संक्षेप में: शोध पत्र यह दिखाता है कि AI एजेंटों को सोचने या प्रतीक्षा करने के दौरान "रुकने" से कैसे रोका जाए। उन्हें प्रतीक्षा करते समय काम करने देने और उन्हें बाद में सुधारा जा सकने वाले सुरक्षित अनुमान लगाने की अनुमति देकर, वे वास्तविक समय में मनुष्यों के साथ बातचीत कर सकते हैं, जिससे वॉयस असिस्टेंट बहुत अधिक स्वाभाविक और उत्तरदायी महसूस होते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।