← नवीनतम पेपर
🤖 AI

Real-Time Execution with Autoregressive Policies

यह शोधपत्र यह प्रदर्शित करता है कि टोकेनाइजेशन क्षितिज (tokenization horizons) को समायोजित करके और नियंत्रित डिकोडिंग (constrained decoding) लागू करके, ऑटोरेग्रेसिव नीतियां सख्त विलंबता सीमाओं (latency bounds) के साथ वास्तविक समय निष्पादन प्राप्त कर सकती हैं, जिससे वे कार्य पूर्णता की गति और सामान्यीकरण दोनों में फ्लो-मैचिंग समकक्षों से बेहतर प्रदर्शन करती हैं।

मूल लेखक: Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sangkyu Lee, Seohyeon Park, Tackgeun You, Avi Caciularu, Idan Szpektor, Hwasup Lim, Youngjae Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई कार्य करना सिखा रहे हैं, जैसे कपों को एक के ऊपर एक रखना या किसी खिलौने को उठाना। ऐसा करने के लिए, रोबोट एक "मस्तिष्क" (एक बड़ा AI मॉडल) का उपयोग करता है, जो दुनिया को देखता है, सोचता है कि क्या करना है, और फिर उसके हाथों को निर्देश भेजता है।

इन बड़े AI मस्तिष्क के साथ समस्या यह है कि वे सोचने में धीमे होते हैं। उन्हें जानकारी को प्रोसेस करने के लिए समय चाहिए होता है। पुराने तरीके में (Synchronous Inference), रोबोट को पूरी तरह से रुकना पड़ता था, मस्तिष्क के सोचने तक इंतज़ार करना पड़ता था, और फिर दोबारा चलना पड़ता था। यह एक ऐसे ड्राइवर की तरह है जिसे हर लाल बत्ती पर कार रोकनी पड़ती है, लाइट हरी होने का इंतज़ार करना पड़ता है, और फिर से गाड़ी शुरू करनी पड़ती है। यह रोबोट को अनाड़ी, धीमा और प्रतिक्रियाहीन बना देता है।

इसे ठीक करने के लिए, शोधकर्ताओं ने आमतौर पर एक अलग प्रकार के "मस्तिष्क" (जिसे Diffusion Policies कहा जाता है) का उपयोग करने की कोशिश की, जो तेज़ी से सोच सके। लेकिन इस पेपर के लेखकों ने पूछा: क्या होगा अगर हम मूल, धीमे "Autoregressive" मस्तिष्क को वास्तविक समय (real-time) में भी उतना ही अच्छा काम करने के योग्य बना सकें?

उन्होंने इसे कैसे किया, यहाँ एक सरल उपमा (analogy) के माध्यम से दिया गया है:

"शेफ और वेटर" की उपमा

कल्पना कीजिए कि रोबोट का मस्तिष्क एक शेफ (AI मॉडल) है और रोबोट का हाथ एक वेटर है।

पुरानी समस्या (Synchronous):
वेटर शेफ से पूछता है, "मुझे आगे क्या करना चाहिए?" शेफ खाना बनाना रोकता है, काफी देर तक सोचता है, कागज पर एक पूरा 10-चरणों वाला नुस्खा (recipe) लिखता है, और वेटर को थमा देता है। वेटर उस पूरे नुस्खे को पढ़ता है और फिर चरणों को करना शुरू करता है। जब वेटर पहले 5 चरणों को करने में व्यस्त होता है, तो शेफ अगले नुस्खे के बारे में सोचने के बजाय वहीं बैठा खाली बैठा रहता है। इससे रोबोट "रुक" जाता है और पीछे रह जाता है।

नया समाधान (Autoregressive Policies के साथ Real-Time Execution):
लेखकों ने महसूस किया कि वे शेफ के मस्तिष्क को बदले बिना, शेफ और वेटर के बीच बातचीत करने के तरीके को बदल सकते हैं।

  1. छोटे बैच (The Tokenization Horizon):
    शेफ से एक बार में पूरा 10-चरणों वाला नुस्खा लिखने के लिए कहने के बजाय, वे एक बार में केवल 2 चरण मांगते हैं। यह लिखना बहुत तेज़ है।
    उपमा: शेफ एक छोटा सा नोट लिखता है: "चरण 1: कप उठाएं। चरण 2: प्लेट की ओर बढ़ें।" वेटर तुरंत इस नोट को पकड़ता है और हिलना शुरू कर देता है।

  2. एक्शन क्यू (The Action Queue - द कन्वेयर बेल्ट):
    वेटर इन छोटे नोट्स का एक छोटा ट्रे (क्यू) रखता है। जैसे ही वेटर पहला नोट पूरा करता है, वह ट्रे से अगला नोट उठा लेता है।
    उपमा: वेटर कभी भी हिलना बंद नहीं करता क्योंकि ट्रे पर हमेशा एक नोट तैयार रहता है। शेफ अगला नोट लिखते समय व्यस्त होता है, जबकि वेटर वर्तमान वाले नोट को पहले से ही पूरा कर रहा होता है। यह Asynchronous Inference (चलते हुए सोचना) है।

  3. सुरक्षा गार्ड (The Safety Guard - Constrained Decoding):
    चूंकि शेफ तेज़ी से लिख रहा है, इसलिए यह जोखिम है कि वे कुछ ऐसा लिख दें जो बहुत लंबा हो या जिसका कोई अर्थ न हो (जैसे कि एक ऐसा नुस्खा जो कहता है "चाँद पर कूदें")। लेखकों ने एक "सुरक्षा गार्ड" जोड़ा जो शेफ के काम की जाँच करता है।
    उपमा: सुरक्षा गार्ड यह सुनिश्चित करता है कि शेफ केवल ऐसे नोट्स लिखे जो इतने छोटे हों जिन्हें वेटर के पास समय खत्म होने से पहले पढ़ा जा सके। यदि शेफ बहुत लंबा वाक्य लिखने की कोशिश करता है, तो गार्ड उसे काट देता है या एक सरल संस्करण बनाने के लिए मजबूर करता है। यह गारंटी देता है कि वेटर को कभी भी रुककर इंतज़ार नहीं करना पड़ेगा।

  4. "सबसे अच्छा अनुमान" रणनीति (The "Best Guess" Strategy - Multi-Trajectory Decoding):
    जब वेटर व्यस्त होता है, तो शेफ के पास थोड़ा अतिरिक्त समय होता है। केवल एक नोट लिखने के बजाय, शेफ जल्दी से अगले चरण के चार अलग-अलग संस्करण तैयार करता है और उनमें से सबसे अच्छा चुनता है।
    उपमा: शेफ सोचता है, "विकल्प A: बाईं ओर बढ़ें। विकल्प B: दाईं ओर बढ़ें। विकल्प C: ऊपर उठाएं। विकल्प D: नीचे उठाएं।" सुरक्षा गार्ड इन चारों की तेज़ी से जाँच करता है, और वेटर निष्पादित करने के लिए सबसे अच्छे को चुनता है। यह रोबोट को धीमे किए बिना स्मार्ट और अधिक सटीक बनाता है।

उन्हें क्या मिला?

शोधकर्ताओं ने कंप्यूटर सिमुलेशन और वास्तविक दुनिया दोनों में रोबोट पर इस नए तरीके का परीक्षण किया।

  • "धीमे" मस्तिष्क से तेज़: भले ही मूल "Autoregressive" मस्तिष्क को धीमा माना जाता था, इस नए तरीके ने इसे इतना सुचारू बना दिया कि इसने कई कार्यों में नए, "तेज़" Diffusion मस्तिष्क को भी पछाड़ दिया
  • निर्देशों का पालन करने में बेहतर: क्योंकि Autoregressive मस्तिष्क स्वाभाविक रूप से जटिल भाषा (जैसे इंसान द्वारा नुस्खा पढ़ना) को समझने में अच्छा है, इसलिए यह अन्य प्रकार के रोबोटों की तुलना में निर्देशों का बेहतर पालन करता है, भले ही वह तेज़ी से चल रहा हो।
  • कोई ठहराव नहीं: रोबोट कभी भी हिलना बंद नहीं करता। वह बदलावों पर तुरंत प्रतिक्रिया देता है क्योंकि "शेफ" हमेशा एक कदम आगे होता है, अगला नोट लिखते समय जबकि "वेटर" अभी भी चल रहा होता है।

मुख्य निष्कर्ष

यह पेपर सिद्ध करता है कि रोबोट को रियल-टाइम में चलाने के लिए आपको उसके AI मस्तिष्क के प्रकार को बदलने की आवश्यकता नहीं है। आपको बस मस्तिष्क से निर्देश मांगने का तरीका बदलने की आवश्यकता है। निर्देशों को छोटे टुकड़ों में तोड़कर, उनकी गति की जाँच करके, और रोबोट के चलते समय मस्तिष्क को सोचने देने से, आप यहाँ तक कि "धीमे" सोचने वालों को भी तेज़, सुचारू और अत्यधिक प्रतिक्रियाशील बना सकते हैं।

संक्षेप में: इंजन को न बदलें; बस ट्रांसमिशन बदलें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →