← नवीनतम पेपर
💻 computer science

DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors

यह शोध पत्र DiscreteRTC का प्रस्ताव करता है, जो एक ऐसा फ्रेमवर्क है जो फिजिकल एआई के लिए कुशल, फाइन-ट्यूनिंग-मुक्त एसिंक्रोनस निष्पादन को सक्षम करने के लिए डिस्क्रीट डिफ्यूजन पॉलिसियों की नेटिव अनमास्किंग क्षमता का लाभ उठाता है, जो मौजूदा फ्लो-मैचिंग-आधारित दृष्टिकोणों की तुलना में काफी उच्च सफलता दर और कम इन्फरेंस लागत प्राप्त करता है।

मूल लेखक: Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pengcheng Wang, Kaiwen Hong, Chensheng Peng, Katherine Driggs-Campbell, Masayoshi Tomizuka, Chenfeng Xu, Chen Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ शोध पत्र "DiscreteRTC: Discrete Diffusion Policies are Natural Asynchronous Executors" का सरल भाषा और रोज़मर्रा के उदाहरणों का उपयोग करते हुए विवरण दिया गया है।

बड़ी समस्या: "सोचने बनाम कार्य करने" का द्वंद्व (The "Thinking vs. Acting" Dilemma)

कल्पना कीजिए कि आप एक तेज़ गति वाला वीडियो गेम खेल रहे हैं, जैसे कंप्यूटर के खिलाफ टेनिस मैच।

  • रोबोट का काम: रोबोट को गेंद को हिट करना है।
  • समस्या: रोबोट का मस्तिष्क (AI) एक आदर्श स्विंग की गणना करने में थोड़ा समय लेता है। जब तक वह "सोच" रहा होता है, गेंद उड़ती रहती है।
  • पुराना तरीका (Synchronous): रोबोट रुकता है, सोचता है, गणना करता है, और फिर स्विंग करता है। जब तक वह स्विंग करता है, गेंद पहले ही निकल चुकी होती है। गतिशील कार्यों (dynamic tasks) के लिए यह घातक है।
  • बेहतर तरीका (Asynchronous): रोबोट को चलते समय भी सोचना चाहिए। उसे अपने पिछले विचार के आधार पर स्विंग करना जारी रखना चाहिए और साथ ही अगले स्विंग की गणना भी करनी चाहिए।

वर्तमान समाधान: "रियल-टाइम चंकिंग" (Real-Time Chunking - RTC)

इस समस्या को हल करने के लिए, इंजीनियर रियल-टाइम चंकिंग (RTC) नामक विधि का उपयोग करते हैं।

  • उदाहरण: कल्पना कीजिए कि रोबोट एक बार में 10 शब्दों के टुकड़ों (chunks) में एक कहानी लिख रहा है।
    1. वह शब्द 1-10 लिखता है।
    2. जब वह शब्द 11-20 लिख रहा होता है, तब वह शब्द 1-10 को निष्पादित (execute) करना शुरू कर देता है।
    3. खराबी (The Glitch): जब रोबोट पहले टुकड़े से दूसरे टुकड़े पर स्विच करता है, तो संक्रमण (transition) झटकेदार हो सकता है। यह ऐसा है जैसे कोई लेखक वाक्य के बीच में अचानक अपनी लिखावट की शैली बदल दे। रोबोट अपना हाथ झटका दे सकता है क्योंकि नया प्लान पुराने प्लान से पूरी तरह मेल नहीं खाता।

इस झटके को ठीक करने के लिए, वर्तमान सबसे अच्छा तरीका (Flow-Matching) इस संक्रमण को "पेंट करने" (paint over) की कोशिश करता है। यह उन शब्दों को फ्रीज कर देता है जो वह पहले ही लिख चुका है और बाकी के हिस्से को "इनपेंट" (inpaint - भरने) की कोशिश करता है ताकि यह सुचारू (smooth) हो सके।

  • चुनौती: यह "इनपेंटिंग" एक ऐसे पेंटर से पेंटिंग ठीक करने के लिए कहने जैसा है जो अभी भी पेंट मिला रहा है। इसके लिए एक विशेष, जटिल गाइड (heuristic) की आवश्यकता होती है जो AI को मिश्रण बनाने के लिए बताए। यह धीमा है, इसके लिए अतिरिक्त प्रशिक्षण की आवश्यकता होती है, और यह अक्सर अटपटा लगता है।

नया समाधान: DiscreteRTC

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे DiscreteRTC कहा जाता है। वे रोबोट के "मस्तिष्क" (policy) को बदलकर एक डिस्क्रीट डिफ्यूजन पॉलिसी (Discrete Diffusion Policy) का उपयोग करते हैं।

उदाहरण: "खाली स्थान भरें" का खेल (The "Fill-in-the-Blanks" Game)
कल्पना कीजिए कि रोबोट शून्य से कहानी नहीं लिख रहा है। इसके बजाय, वह "खाली स्थान भरने" (जैसे Mad Libs या क्रॉसवर्ड पहेली) का खेल खेल रहा है।

  • यह कैसे काम करता है: रोबोट को एक ऐसे वाक्य को देखने के लिए प्रशिक्षित किया जाता है जिसमें कुछ शब्द छिपे हुए (masked) होते हैं और गायब शब्दों का अनुमान लगाने के लिए कहा जाता है।
  • जादू: क्योंकि रोबोट पहले से ही गायब शब्दों का अनुमान लगाने में विशेषज्ञ है, इसलिए उसे संक्रमण को "इनपेंट" करने के लिए किसी विशेष ट्रिक को सीखने की आवश्यकता नहीं है। वह बस वही करता है जिसके लिए वह बना है।

यहाँ बताया गया है कि यह नया तरीका क्यों एक गेम-चेंजर है, जैसा कि शोध पत्र में कहा गया है:

1. कोई अतिरिक्त प्रशिक्षण आवश्यक नहीं (Fine-Tuning Free)

  • पुराना तरीका: आपको रोबोट को प्रशिक्षित करने के बाद एक विशेष "ट्रांजिशन स्किल" सिखानी पड़ती थी, जो कठिन और जोखिम भरा था।
  • नया तरीका: रोबोट पहले से ही खाली स्थान भरने के लिए प्रशिक्षित है। जब उसे टुकड़ों को बदलने की आवश्यकता होती है, तो वह इसे एक नए "खाली स्थान भरने" वाले पहेली के रूप में देखता है। यह बिना किसी अतिरिक्त मेहनत के सीधे काम करता है।

2. प्राकृतिक मार्गदर्शन (कोई जटिल नियम नहीं)

  • पुराना तरीका: इंजीनियरों को जटिल, मैन्युअल नियम (heuristics) लिखने पड़ते थे जो AI को पुराने और नए के बीच तालमेल बिठाने के लिए बताते थे। यह कार चलाने के बजाय ड्राइवर को स्टीयरिंग करने के मैनुअल देने जैसा था।
  • नया तरीका: रोबोट स्वाभाविक रूप से संक्रमण को संभालने का तरीका जानता है। यदि उसने नए टुकड़े के पहले कुछ शब्दों को पहले ही समझ लिया है, तो वह वहीं रुक जाता है और अगले विचार का इंतज़ार करता है। "अनमास्क्ड" (unmasked) शब्द बिना किसी मैनुअल के स्वाभाविक रूप से अगले कदम का मार्गदर्शन करते हैं।

3. तेज़ और सस्ता (कम इन्फरेंस लागत)

  • पुराना तरीका: "पेंटिंग ओवर" विधि के लिए रोबोट को दोगुना काम करना पड़ता था (मूल योजना की गणना करना + सुधार करना), जिससे वह धीमा हो जाता था।
  • नया तरीका: चूंकि रोबोट को केवल उन शब्दों को "अनमास्क" (प्रकट) करने की आवश्यकता है जिन्हें उसने अभी तक नहीं समझा है, इसलिए वह उस काम को छोड़ देता है जो वह पहले ही कर चुका है। यह एक ऐसी किताब पढ़ने जैसा है जहाँ आप केवल उन पृष्ठों को पढ़ते हैं जिन्हें आपने अभी तक नहीं देखा है, बजाय इसके कि हर बार पन्ना पलटने पर पूरी किताब फिर से पढ़ें।
    • परिणाम: यह पुराने तरीके की तुलना में लगभग 30% तेज़ (0.7x गणना) है।

परिणाम: क्या यह वास्तव में काम करता है?

लेखकों ने इसे दो तरीकों से परखा:

  1. सिमुलेटेड दुनिया (Kinetix): चलते हुए लक्ष्यों के साथ एक डिजिटल प्लेग्राउंड।
    • परिणाम: नए तरीके ने पुराने तरीके की तुलना में कार्यों को अधिक बार सफलतापूर्वक पूरा किया और देरी (delays) को बहुत बेहतर ढंग से संभाला।
  2. असली रोबोट (Real World): एक भौतिक रोबोटिक हाथ जो चलती हुई वस्तुओं को उठाने और उन्हें चलते हुए प्लेटफार्मों पर रखने की कोशिश कर रहा है।
    • परिणाम: पुराना तरीका सबसे कठिन गतिशील कार्यों पर पूरी तरह विफल (0% सफलता) रहा। नया तरीका 95-100% समय सफल रहा।
    • गति: नया तरीका वास्तविक समय के निष्पादन (real-time execution) में भी तेज़ था।

एक वाक्य में सारांश

DiscreteRTC रोबोट के चलने के दौरान सोचने का एक नया तरीका है जो एक्शन प्लानिंग को "खाली स्थान भरने" के खेल की तरह मानता है, जिससे यह मौजूदा बोझिल तरीकों की तुलना में स्वाभाविक रूप से अधिक सुचारू, तेज़ और बिना किसी अतिरिक्त प्रशिक्षण के काम करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →