← नवीनतम पेपर
🤖 machine learning

AOSpec: Action and Observation Co-Speculation for Low-Latency Agent Serving

AOSpec एक लॉसलेस फ्रेमवर्क है जो एक्सपेक्टेड वैल्यू डिकोडिंग और जॉइंट एक्शन-स्टेट वेरिफिकेशन के माध्यम से एक्शन्स और ऑब्जर्वेशन्स को को-स्पेक्टुलेट करके एजेंट सर्विंग लेटेंसी को कम करता है, जिससे लुकअहेड-एक्यूरेसी ट्रेडऑफ टूट जाता है और विविध बेंचमार्क में महत्वपूर्ण एंड-टू-एंड लेटेंसी कमी प्राप्त होती है।

मूल लेखक: Hao Mark Chen, Jinnan Guo, Wayne Luk, Hongxiang Fan

प्रकाशित 2026-08-04
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Mark Chen, Jinnan Guo, Wayne Luk, Hongxiang Fan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, उच्च-गति वाले ऑर्केस्ट्रा के कंडक्टर हैं जहाँ संगीतकार बहुत बुद्धिमान कंप्यूटर (लार्ज लैंग्वेज मॉडल्स) हैं और मंच एक जटिल, जीवित दुनिया है जो टूल्स, फाइलों और प्रोग्रामों से भरी है। इस डिजिटल सिम्फनी में, कंप्यूटर एक संगीत नोट (एक क्रिया/एक्शन) के बारे में सोचता है, फिर मंच को उस नोट को भौतिक रूप से बजाना (टूल निष्पादित करना) होता है, और उसके बाद ही कंप्यूटर परिणाम सुन सकता है और अगले नोट का निर्णय ले सकता है। लंबे समय तक, यह प्रक्रिया एक सख्त रिले रेस की तरह थी: कंप्यूटर को चुपचाप इंतजार करना पड़ता था जब तक कि मंच नोट न बजा दे, इससे पहले कि वह अगले नोट के बारे में सोच सके। जैसे-जैसे कंप्यूटर सोचने में तेज़ होते जा रहे हैं, मंच द्वारा नोट्स बजाने का प्रतीक्षा समय एक बाधा (बोतलनैक) बन गया है, जिससे पूरा प्रदर्शन धीमा हो गया है। वैज्ञानिकों ने अगले नोट का अनुमान लगाकर (एक्शन स्पेक्यूलेशन) या होने वाली ध्वनि का अनुमान लगाकर (ऑब्जर्वेशन स्पेक्यूलेशन) इसे ठीक करने की कोशिश की है, लेकिन ये एकल अनुमान अक्सर विफल हो जाते हैं क्योंकि मंच अप्रत्याशित है, और नोट्स के पूरे क्रम का अनुमान लगाना शोर-शराबे और त्रुटियों का कारण बनता है।

यह पेपर एक नई कंडक्टर तकनीक पेश करता है जिसे AOSpec (एक्शन एंड ऑब्जर्वेशन को-स्पेक्यूलेशन) कहा जाता है। केवल एक चीज़ का अनुमान लगाने के बजाय, AOSpec एक चतुर, समानांतर रिहर्सल चलाता है जहाँ यह अगले कदम और होने वाली ध्वनि दोनों का एक साथ अनुमान लगाता है, लेकिन एक सुरक्षा जाल के साथ। यह अपने अनुमानों को सबसे धीमी, सबसे अधिक समय लेने वाले हिस्सों पर केंद्रित करने के लिए एक स्मार्ट रणनीति का उपयोग करता है, और यह "सुरक्षित क्षेत्र" (अलग सैंडबॉक्स) बनाता है जहाँ यह वास्तविक मंच को गड़बबड़ किए बिना जोखिम भरे कदम आज़मा सकता है। यदि अनुमान सही निकलता है, तो शो तुरंत आगे बढ़ जाता है; यदि यह गलत होता है, तो रिहर्सल को शांति से हटा दिया जाता है, और वास्तविक शो बिना किसी बाधा के चलता रहता है। लेखकों ने विभिन्न जटिल कार्यों पर इसे मापा और पाया कि यह विधि कुल प्रतीक्षा समय को औसतन 32.5% तक कम कर सकती है, और सबसे धीमी, सबसे निराशाजनक देरी के लिए, यह समय को लगभग 43% तक कम कर सकती है, जिससे डिजिटल ऑर्केस्ट्रा बिना कोई लय खोए बहुत तेज़ी से बजता है।

समस्या: प्रतीक्षा का खेल

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आपका पात्र एक जीनियस रणनीतिकार है। हर बार जब आप "खजाने का संदूक खोलें" जैसा कमांड टाइप करते हैं, तो आपके पात्र को सोचने के लिए रुकना पड़ता है और गेम इंजन के वास्तव में संदूक खोलने, उसके अंदर की जाँच करने और आपको सोना दिखाने का इंतज़ार करना पड़ता है। यदि संदूक खुलने में 10 सेकंड लगते हैं, तो आपका पात्र उन 10 सेकंड के लिए कुछ भी न करते हुए बैठा रहता है।

जैसे-जैसे कंप्यूटर चिप्स तेज़ होते जा रहे हैं, आपका पात्र मिलीसेकंड में सोचने लगता है। लेकिन संदूक खोलना (टूल निष्पादन) अभी भी सेकंडों में चलता है। यह एक निराशाजनक अंतर पैदा करता है: विचारक बिजली की तरह तेज़ है, लेकिन करने वाला धीमा है। पेपर बताता है कि अधिकांश प्रतीक्षा समय केवल कुछ बहुत धीमी क्रियाओं से आता है, जैसे एक विशाल तिजोरी खोलना, जबकि कई अन्य क्रियाएं तेज़ होती हैं। पुराने तरीकों ने समय बचाने के लिए अगले कमांड का अनुमान लगाने की कोशिश की, लेकिन वे अक्सर गलत अनुमान लगाते थे क्योंकि उन्होंने इस तथ्य को ध्यान में नहीं रखा कि कुछ परिणामों (जैसे संदूक के अंदर की सामग्री) का अनुमान बिना उसे खोले नहीं लगाया जा सकता।

समाधान: "सुरक्षित रिहर्सल" रणनीति

इंपीरियल कॉलेज लंदन के लेखकों ने इस समस्या को हल करने के लिए AOSpec नामक एक सिस्टम बनाया है। इसे एक ऐसे निर्देशक के रूप में सोचें जो केवल अभिनेता को एक दृश्य समाप्त करने के बाद अगले दृश्य की योजना बनाने का इंतज़ार नहीं करता है। इसके बजाय, निर्देशक एक समानांतर ब्रह्मांड में "सुरक्षित रिहर्सल" चलाता है।

यहाँ तीन मुख्य तरकीबें कैसे काम करती हैं:

  1. स्मार्ट जुआरी (एक्सपेक्टेड वैल्यू डिकोडिंग):
    सभी अनुमान समान मूल्य के नहीं होते। एक त्वरित "नमस्ते" कमांड के परिणाम का अनुमान लगाना आसान है लेकिन इससे बहुत कम समय बचता है। "मूवी डाउनलोड करने" के कमांड के परिणाम का अनुमान लगाना कठिन है, लेकिन यदि आप इसे सही कर लेते हैं, तो आप बहुत सारा प्रतीक्षा समय बचा सकते हैं। AOSpec एक्सपेक्टेड वैल्यू डिकोडिंग (EVD) नामक एक विधि का उपयोग करता है। केवल सबसे संभावित परिणाम का अनुमान लगाने के बजाय, यह उस परिणाम का अनुमान लगाता है जो सबसे अधिक समय की बचत प्रदान करता है। यह एक ऐसे जुआरी की तरह है जो छोटे, सुरक्षित दांवों को अनदेखा करता है और केवल उच्च-दांव, उच्च-इनाम वाले कदमों पर ध्यान केंद्रित करता है। यदि अनुमान सही है, तो सिस्टम पूरी प्रतीक्षा को छोड़ देता है।

  2. सुरक्षित सैंडबॉक्स (आइसोलेटेड फोर्क्स):
    कुछ चीजें सीधे तौर पर अनुमानित नहीं की जा सकतीं। आप यह नहीं जान सकते कि कोई फ़ाइल दूषित है या सर्वर डाउन है जब तक कि आप वास्तव में उसे खोलने का प्रयास नहीं करते। इसे संभालने के लिए, AOSpec एक "सुरक्षित सैंडबॉक्स" या एक समानांतर ब्रह्मांड बनाता है। यह इस अलग दुनिया में जोखिम भरी क्रिया (जैसे फ़ाइल खोलना) को लॉन्च करता है। यदि क्रिया गलत होती है, तो सैंडबॉक्स को बस फेंक दिया जाता है, और वास्तविक दुनिया अछूती रहती है। यदि क्रिया सही होती है, तो सिस्टम परिणाम प्राप्त करता है और उसका तुरंत उपयोग करता है। यह सिस्टम को वास्तविक शो को क्रैश करने के जोखिम के बिना खतरनाक या धीमी क्रियाओं को "प्री-प्ले" करने की अनुमति देता है।

  3. दोहरा चेक (जॉइंट एक्शन-स्टेट वेरिफिकेशन):
    भविष्य की लंबी क्रियाओं की श्रृंखला का अनुमान लगाने की सबसे बड़ी समस्या यह है कि एक छोटी सी गलती पूरी श्रृंखला को बर्बाद कर देती है। यदि आप चरण 1, 2 और 3 का अनुमान लगाते हैं, और चरण 2 गलत है, तो चरण 1 और 3 बेकार हो जाते हैं। AOSpec ऐसा करके इससे बचता है—यह पूरी श्रृंखला का अनुमान नहीं लगाता। इसके बजाय, यह केवल लक्ष्य क्रिया (वह क्रिया जो सबसे अधिक समय बचाएगी) का अनुमान लगाता है और जाँच करता है कि सैंडबॉक्स की "शुरुआती स्थिति" वास्तविक दुनिया से मेल खाती है या नहीं। यह यह जाँचने जैसा है कि क्या अभिनेता के मंच पर आने से पहले मंच सही ढंग से तैयार है। यदि मंच मेल खाता है, तो प्री-प्ले की गई क्रिया वैध है। यदि नहीं, तो सिस्टम अनुमान को हटा देता है और नए सिरे से शुरू करता है। यह "सटीकता बनाम गति" के ट्रेड-ऑफ को तोड़ देता है, जिससे सिस्टम हर बीच के कदम के लिए पूर्ण क्रिस्टल बॉल की आवश्यकता के बिना काफी आगे देखने में सक्षम होता है।

उन्होंने क्या पाया

शोधकर्ताओं ने कोडिंग पहेलियों को हल करने से लेकर जटिल कंप्यूटर सिस्टम को प्रबंधित करने तक, विभिन्न प्रकार के AI मॉडल और विभिन्न गतियों का उपयोग करके विविध कार्यों पर AOSpec का परीक्षण किया। उन्होंने इसकी तुलना मौजूदा तकनीकों से की जो या तो केवल क्रियाओं का अनुमान लगाती थीं या केवल प्रेक्षणों (observations) का।

परिणाम स्पष्ट थे:

  • गति में वृद्धि: AOSpec ने कार्यों को पूरा करने में लगने वाले कुल समय को औसतन 11.8% से 32.5% तक कम कर दिया।
  • सबसे धीमी क्षणों को ठीक करना: सबसे बड़ी जीत "टेल लेटेंसी" (tail latency) में मिली—सबसे धीमी, सबसे निराशाजनक देरी। सबसे धीमे 1% कार्यों (p99) के लिए, AOSpec ने प्रतीक्षा समय को 42.8% तक कम कर दिया।
  • उच्च गति पर बेहतर प्रदर्शन: जैसे-जैसे AI की सोचने की गति बढ़ी (20 मिलीसेकंड प्रति शब्द से घटकर 1 मिलीसेकंड तक), AOSpec के लाभ और भी बड़े होते गए। ऐसा इसलिए है क्योंकि AI जितना तेज़ सोचता है, टूल्स के लिए प्रतीक्षा करने में उतना ही अधिक समय बर्बाद होता है, और AOSpec उस प्रतीक्षा समय को छिपाने में सबसे अच्छा है।
  • पुनः प्रशिक्षण की आवश्यकता नहीं: यह सिस्टम बिना किसी पुन: प्रशिक्षण के कार्यों के एक पूरी तरह से नए सेट (SWE-bench) पर भी समान रूप से काम करता है, जो दर्शाता है कि यह तरीका मजबूत और सामान्य है।

यह क्यों महत्वपूर्ण है

यह पेपर सुझाव देता है कि तेज़ AI एजेंटों का भविष्य केवल AI को तेज़ी से सोचने के बारे में नहीं है, बल्कि यह है कि पूरे लूप (सोचने और करने के चक्र) को अधिक कुशल कैसे बनाया जाए। स्मार्ट अनुमान लगाने और सुरक्षित, समानांतर परीक्षण को जोड़कर, AOSpec दिखाता है कि हम AI एजेंटों के "प्रतीक्षा कक्ष" के समय को छिपा सकते हैं, जिससे वे भारी, जटिल काम करते समय भी तत्काल और उत्तरदायी महसूस होते हैं। यह साबित करता है कि आपको सटीकता और गति के बीच चुनाव करने की आवश्यकता नहीं है; सही सुरक्षा जाल के साथ, आप दोनों पा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →