Agent JIT Compilation for Latency-Optimizing Web Agent Planning and Scheduling
यह शोध पत्र एजेंट JIT कंपाइलेशन (Agent JIT Compilation) को प्रस्तुत करता है, जो एक योजनाकार (planner), शेड्यूलर (scheduler) और इनवेरिएंट-एनफोर्सिंग प्रोटोकॉल (invariant-enforcing protocol) से बना एक ढांचा है जो प्राकृतिक भाषा के कार्यों को निष्पादन योग्य कोड में परिवर्तित करता है ताकि पारंपरिक अनुक्रमिक वेब एजेंट लूपों की तुलना में महत्वपूर्ण गति और सटीकता में सुधार प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को आपके लिए कोई जटिल काम करने के लिए तैयार करने की कोशिश कर रहे हैं, जैसे कि "टैको बेल से सबसे सस्ता टैको ऑर्डर करना।"
वर्तमान में, अधिकांश रोबोट एक बहुत ही सावधान, धीमे मानव सहायक की तरह काम करते हैं। वे स्क्रीन देखते हैं, अगले कदम के लिए एक सुपर-इंटेलिजेंट मस्तिष्क (एक AI) से पूछते हैं, एक बटन क्लिक करते हैं, स्क्रीन बदलने का इंतज़ार करते हैं, फिर से मस्तिष्क से पूछते हैं, एक शब्द टाइप करते हैं, और फिर से पूछते हैं। यह "देखो-सोचो-करो" (look-think-act) लूप बार-बार चलता रहता है। यह धीमा है, महंगा है (क्योंकि हर बार मस्तिष्क से पूछने पर AI की लागत आती है), और गलतियों की संभावना अधिक होती है क्योंकि यदि स्क्रीन थोड़ी अलग दिखती है तो रोबोट गलत चीज़ पर क्लिक कर सकता है।
यह पेपर इस नए तरीके को पेश करता है जिससे ये रोबोट तेज़ और स्मार्ट बन सकते हैं, जिसे एजेंट JIT कंपाइलेशन (Agent JIT Compilation) कहा जाता है। इसे "कदम-दर-कदम निर्देश पुस्तिका" से "एक कस्टम सॉफ्टवेयर स्क्रिप्ट लिखने" में स्विच करने के रूप में समझें, इससे पहले कि रोबोट वास्तव में हिलना शुरू करे।
यह कैसे काम करता है, यहाँ तीन सरल भागों में दिया गया है:
1. "प्री-फ्लाइट" प्लानर (JIT-Planner)
हर कदम पर AI से यह पूछने के बजाय कि "मुझे आगे क्या करना चाहिए?", सिस्टम पहले आपके अनुरोध ("सबसे सस्ता टैको ऑर्डर करें") को लेता है और तुरंत कई अलग-अलग कंप्यूटर प्रोग्राम (कोड) बनाता है जो उस समस्या को हल कर सकते हैं।
- उपमा (Analogy): कल्पना कीजिए कि आपको न्यूयॉर्क से बोस्टन तक गाड़ी चलानी है।
- पुराना तरीका: आप हर गैस स्टेशन पर रुककर स्थानीय व्यक्ति से पूछते हैं, "बोस्टन किस दिशा में है?" आप एक मील चलते हैं, फिर पूछते हैं, एक मील चलते हैं, फिर पूछते हैं, और फिर पूछते हैं।
- नया तरीका: निकलने से पहले, आप एक मैप ऐप से तीन अलग-अलग रूट बनाने के लिए कहते हैं। यह ट्रैफिक, सड़क की स्थिति और दूरी की जांच करता है। यह सबसे तेज़ रूट चुनता है और आपके कार के नेविगेशन सिस्टम में एक बार GPS निर्देशांक (coordinates) लिख देता है। फिर, आप बस गाड़ी चलाते हैं।
- जादू (The Magic): सिस्टम इन उत्पन्न मार्गों की जांच करता है ताकि यह सुनिश्चित हो सके कि वे तार्किक हैं (उदाहरण के लिए, आप "कार्ट में जोड़ें" पर क्लिक करने से पहले "ऑर्डर करें" पर क्लिक नहीं कर सकते)। यह उस रूट को चुनता है जिसमें सबसे कम "मस्तिष्क शक्ति" (AI कॉल्स) और समय लगता है।
2. "ट्रैफिक पुलिस" (JIT-Scheduler)
एक बार जब रोबोट के पास एक योजना हो जाती है, तो उसे यह तय करने की आवश्यकता होती है कि इसे कैसे चलाना है। क्या इसे सब कुछ एक-एक करके करना चाहिए? क्या इसे एक साथ तीन चीजें करने की कोशिश करनी चाहिए? या क्या इसे एक ही कार्य को तीन बार समानांतर (parallel) रूप से करने की कोशिश करनी चाहिए और बस पहले वाले का उपयोग करना चाहिए जो समाप्त हो जाता है?
- उपमा (Analogy): कल्पना कीजिए कि आप पार्टी के लिए खाना ऑर्डर कर रहे हैं।
- सीरियल (एक-एक करके): आप एक रेस्टोरेंट को कॉल करते हैं, उत्तर का इंतज़ार करते हैं, फिर दूसरे को कॉल करते हैं, इंतज़ार करते हैं...
- पैरेलल (समानांतर): आप एक ही समय में तीन रेस्टोरेंट्स को कॉल करते हैं।
- हेजिंग (Hedging): आप तीन रेस्टोरेंट्स को कॉल करते हैं, लेकिन आपको केवल पहले वाले से मतलब है जो फोन उठाता है। यदि एक धीमा है, तो आप इंतज़ार नहीं करते; आप बस तेज़ वाले से जवाब ले लेते हैं।
- जादू (The Magic): सिस्टम विशिष्ट कार्य को देखता है और पिछले डेटा का उपयोग करके अनुमान लगाता है कि कौन सी रणनीति सबसे अच्छी है। यदि कार्य सरल है, तो यह एक-एक करके जाता है। यदि कार्य कठिन है और फंस सकता है, तो यह एक साथ कई रास्तों को आज़माता है (हेजिंग) ताकि यह सुनिश्चित हो सके कि यह जल्दी पूरा हो जाए। यह उस रणनीति को चुनता है जो सबसे अधिक समय बचाती है।
3. "नियम पुस्तिका" (Invariant-Enforcing Protocol)
यह सुनिश्चित करने के लिए कि रोबोट क्रैश न हो या गलत बटन पर क्लिक न करे, प्रत्येक टूल जिसका रोबोट उपयोग करता है (जैसे "बटन क्लिक करें" या "टेक्स्ट टाइप करें"), उसके साथ एक सख्त नियम पुस्तिका आती है।
- उपमा (Analogy): एक वेंडिंग मशीन के बारे में सोचें।
- पुराना तरीका: आप बस बेतरतीब ढंग से बटन दबाते हैं। कभी-कभी आप "स्नैक" दबाते हैं जब मशीन खाली होती है, और कुछ नहीं होता है।
- नया तरीका: मशीन में एक सेंसर होता है। यह जांचता है: "क्या मशीन चालू है? क्या इसके अंदर पैसे हैं? क्या दरवाजा बंद है?" यदि शर्तें पूरी नहीं होती हैं, तो मशीन आपको बटन दबाने से मना कर देती है।
- जादू (The Magic): कोड चलाने से पहले, सिस्टम इन नियमों की जांच करता है। यदि कोई योजना "ऑर्डर" करने की कोशिश करती है जबकि "कार्ट" खाली है, तो सिस्टम उस गलती को रोबोट के शुरू होने से पहले ही पकड़ लेता है, जिससे त्रुटियों और समय की बर्बादी को रोका जा सकता है।
परिणाम
लेखकों ने पांच अलग-अलग वेबसाइटों (जैसे फूड डिलीवरी, ईमेल और शॉपिंग साइट्स) पर इसका परीक्षण किया। परिणाम प्रभावशाली थे:
- गति (Speed): उनका नया तरीका मानक "हर कदम पर AI से पूछने" वाले तरीके की तुलना में 10 गुना तेज़ था।
- सटीकता (Accuracy): यह 28% अधिक सटीक भी था, जिसका अर्थ है कि इसने वास्तव में 28% अधिक बार सही टैको प्राप्त किया।
- तुलना (Comparison): अन्य उन्नत AI एजेंटों (जैसे OpenAI या Anthropic के एजेंट) की तुलना में भी, उनका तरीका 2.4 गुना तेज़ और 9% अधिक सटीक था।
सारांश
संक्षेप में, यह पेपर कहता है: AI को हर कदम पर कार चलाने के लिए मत कहें। इसके बजाय, AI को पूरे ड्राइविंग रूट को एक स्क्रिप्ट के रूप में लिखने दें, यह जांच लें कि वह रूट सुरक्षित है, इसे चलाने का सबसे तेज़ तरीका चुनें, और फिर बस उस स्क्रिप्ट को चलाएं। यह एक धीमी, अटकती हुई बातचीत को एक सुचारू, उच्च-गति निष्पादन (execution) में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।