← नवीनतम पेपर
🤖 machine learning

KERV: Kinematic-Rectified Speculative Decoding for Embodied VLA Models

KERV एक काइनेमैटिक-रेक्टिफाइड स्पेकुलेटिव डिकोडिंग फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स के लिए है, जो महंगी री-इन्फरेंस के बजाय काइनेमैटिक प्रेडिक्शन्स के माध्यम से टोकन त्रुटियों की भरपाई करके रोबोट कंट्रोल इन्फरेंस को त्वरित करने के लिए कलमन फिल्टर और एक डायनेमिक एडजस्टमेंट स्ट्रैटेजी का उपयोग करता है।

मूल लेखक: Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Zihao Zheng, Zhihao Mao, Maoliang Li, Jiayu Chen, Xinhao Sun, Zhaobo Zhang, Donggang Cao, Hong Mei, Xiang Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं। वर्तमान में, रोबोट एक "मस्तिष्क" का उपयोग करता है जिसे VLA मॉडल (विज़न-लैंग्वेज-एक्शन) कहा जाता है। यह मस्तिष्क अविश्वसनीय रूप से स्मार्ट है—यह ब्रेड देख सकता है, "सैंडविच बनाओ" कमांड को समझ सकता है, और गतिविधियों की योजना बना सकता है।

हालाँकि, एक समस्या है: यह मस्तिष्क एक धीमा विचारक है। यह हर एक छोटे "टोकन" (एक डिजिटल निर्देश) के माध्यम से सब कुछ प्रोसेस करता है। यदि रोबोट को हर एक सूक्ष्म-मूवमेंट (micro-movement) से पहले तीन सेकंड तक सोचना पड़ता है, तो सैंडविच बनाने की प्रक्रिया दर्दनाक रूप से धीमी और झटकेदार हो जाती है।

इस गति को बढ़ाने के लिए, शोधकर्ता Speculative Decoding (SD) नामक एक तरकीब का उपयोग करते हैं। इसे एक "तेज़ इंटर्न" (एक छोटा, त्वरित मॉडल) और एक "सीनियर एक्सपर्ट" (एक बड़ा, स्मार्ट VLA मॉडल) के रूप में समझें। इंटर्न तेज़ी से अगले कुछ मूव्स का अनुमान लगाता है, और एक्सपर्ट जल्दी से उनकी जाँच करता है। यदि इंटर्न सही है, तो रोबोट तेज़ी से चलता है। यदि इंटर्न गलत है, तो एक्सपर्ट सब कुछ रोक देता है, गलती सुधारता है, और फिर से शुरुआत करता है। यही "रुकने और शुरू करने" वाला सुधार ही रोबोट को फिर से धीमा बना देता है।

समस्या: "अनाड़ी इंटर्न" और "कठोर बॉस"

शोधकर्ताओं ने इस सेटअप में दो मुख्य समस्याएं पाईं:

  1. महंगी सुधार प्रक्रिया (The Costly Correction): हर बार जब इंटर्न गलती करता है, तो एक्सपर्ट को बहुत अधिक "फिर से सोचने" की आवश्यकता होती है, जिससे समय बर्बाद होता है।
  2. कठोर नियम पुस्तिका (The Strict Rulebook): एक्सपर्ट यह तय करने के लिए एक निश्चित नियम का उपयोग करता है कि इंटर्न का अनुमान "पर्याप्त अच्छा" है या नहीं। लेकिन वास्तविक दुनिया में, कुछ छोटी गलतियाँ ठीक हैं, जबकि अन्य आपदाएँ होती हैं। एक निश्चित नियम या तो बहुत सख्त है (रोबोट को धीमा कर देता है) या बहुत ढीला (रोबोट को क्रैश होने से रोकता है)।

समाधान: KERV (द "स्मूथ ऑपरेटर")

शोधकर्ताओं ने KERV बनाया, जो डिजिटल मस्तिष्क में "भौतिक सामान्य समझ" (Physical Common Sense) का एक स्तर जोड़ता है। उन्होंने महसूस किया कि जबकि डिजिटल मस्तिष्क टोकन में सोचता है, रोबोट भौतिकी और गति (kinematics) की दुनिया में रहता है।

उन्होंने दो नए शानदार उपकरण पेश किए:

1. "सेफ्टी नेट" (कलमन फ़िल्टर कंपन - Kalman Filter Compensation)

एक्सपर्ट को हर बार रोकने और फिर से सोचने के बजाय कि इंटर्न कब लड़खड़ाता है, KERV एक कलमन फ़िल्टर का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि आप कार चला रहे हैं और अचानक एक छोटे से गड्ढे से टकरा जाते हैं। पुराने तरीके के विपरीत, जहाँ आप ब्रेक लगाकर अपना पूरा रास्ता फिर से कैलकुलेट करते, आप बस उस झटके को महसूस करते हैं, अपने मोमेंटम (momentum) के आधार पर स्टीयरिंग को थोड़ा एडजस्ट करते हैं, और सुचारू रूप से चलते रहते हैं।
  • यह कैसे काम करता है: यदि इंटर्न मूवमेंट में छोटी सी गलती करता है, तो KERV रोबोट के वास्तविक भौतिक मोमेंटम पर आधारित गणित का उपयोग करता है ताकि वह "खाली जगहों को भर सके" और गति को सुचारू बना सके। यह रोबोट को बड़े मस्तिष्क के दोबारा शुरू होने का इंतज़ार किए बिना चलते रहने की अनुमति देता है।

2. "स्मार्ट सुपरवाइजर" (डायनेमिक थ्रेशोल्ड एडजस्टमेंट)

एक निश्चित नियम पुस्तिका के बजाय, KERV एक सुपरवाइजर का उपयोग करता है जो यह देखता है कि रोबोट के मूवमेंट कितने "कांपते" (shaky) हैं।

  • उपमा: कल्पना कीजिए कि एक शिक्षक छात्र को ग्रेड दे रहा है। यदि छात्र एक बहुत ही सरल कार्य कर रहा है (जैसे सीधी रेखा खींचना), तो शिक्षक गलतियों के प्रति बहुत सख्त होता है। लेकिन यदि छात्र एक जटिल, उच्च-गति वाला नृत्य कर रहा है, तो शिक्षक थोड़ी बहुत डगमगाहट की अनुमति देता है।
  • यह कैसे काम करता है: KERV "काइनेमैटिक वेरिएबिलिटी" (Kinematic Variability - रोबोट का भौतिक पथ कितना उतार-चढ़ाव भरा है) को मापता है। यदि मूवमेंट स्थिर है, तो यह इंटर्न को अनुमान लगाने के लिए अधिक स्वतंत्रता देता है। यदि मूवमेंट अनियमित हो जाता है, तो यह सटीकता सुनिश्चित करने के लिए नियमों को कड़ा कर देता है।

परिणाम: तेज़ और स्मार्ट

डिजिटल मस्तिष्क (VLA) को भौतिक सामान्य समझ (Kinematics) के साथ जोड़कर, KERV रोबोट को बनाता है:

  • बहुत तेज़: यह प्रक्रिया को 27% से 37% तक तेज़ कर देता है।
  • उतना ही सटीक: यह यह गति बिना रोबोट को उसके कार्यों में विफल किए प्राप्त करता है।

संक्षेप में: KERV रोबोट को न केवल तेज़ी से "सोचना" सिखाता है, बल्कि भौतिकी के नियमों का उपयोग करके अपनी डिजिटल त्रुटियों को ठीक करके अधिक स्मार्ट तरीके से "चलना" भी सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →