← नवीनतम पेपर
💻 computer science

Enabling Dynamic Tracking in Vision-Language-Action Models via Time-Discrete and Time-Continuous Velocity Feedforward

यह शोध पत्र दो मॉडल-अज्ञेय (model-agnostic) विधियों—टाइम-डिस्क्रीट फाइनाइट-डिफरेंस एप्रोक्सिमेशन और कंटीन्यूअस क्यूबिक बी-स्प्लाइन एक्शन स्पेसेस—का प्रस्ताव करता है, ताकि विजन-लैंग्वेज-एक्शन मॉडल्स में वेलोसिटी फीडफॉरवर्ड को एकीकृत किया जा सके, जिससे कठोर औद्योगिक रोबोट हेरफेर (manipulation) में अनुपालन (compliance) और प्रतिक्रियाशीलता (responsiveness) के बीच के संतुलन को हल किया जा सके।

मूल लेखक: Johannes Hechtl, Philipp Schmitt, Georg von Wichert, Wolfram Burgard

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Johannes Hechtl, Philipp Schmitt, Georg von Wichert, Wolfram Burgard

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोटिक हाथ को एक नाजुक काम करना सिखा रहे हैं, जैसे कि एक घन (cube) को एक छोटे से छेद में खिसकाना। यह एक ऐसा काम है जिसके लिए गति (ताकि घन को छेद तक जल्दी पहुँचाया जा सके) और कोमलता (ताकि अगर निशाना चूक जाए तो घन या छेद टूट न जाए) के मिश्रण की आवश्यकता होती है।

लंबे समय तक, AI (जिसे विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है) द्वारा प्रशिक्षित रोबोट इस तरह के कार्यों में संघर्ष करते रहे हैं। वे एक ऐसे ड्राइवर की तरह हैं जो केवल यह जानता है कि कार को रोकना कहाँ है, लेकिन उसे यह नहीं पता कि उसकी गति कितनी है या उसे कितनी जोर से ब्रेक लगाना चाहिए।

यहाँ वह सरल विवरण दिया गया है कि इस शोध पत्र ने इस समस्या को कैसे ठीक किया है।

समस्या: "रुकने और चलने वाला" ड्राइवर (The "Stop-and-Go" Driver)

अधिकांश रोबोट AI मॉडल "रुकने और चलने" (stop-and-go) के तरीके से काम करते हैं। हर सेकंड के कुछ हिस्से में, AI कहता है, "ठीक है, हाथ को इस विशिष्ट स्थान पर ले जाओ।"

  • रोबोट की दुविधा: रोबोट का निचला मस्तिष्क (कंट्रोलर) इसे सुनता है और वहां पहुँचने की कोशिश करता है। लेकिन क्योंकि AI ने यह नहीं बताया कि कितनी तेजी से जाना है, इसलिए रोबोट को अनुमान लगाना पड़ता है।
  • समझौता (The Trade-off):
    • यदि रोबोट कठोर (stiff) है (जैसे एक धातु का हाथ), तो वह लक्ष्य स्थान पर सटीक रूप से पहुँच सकता है, लेकिन यदि वह छेद से थोड़ा भी गलत टकराता है, तो वह चीजों को तोड़ देगा।
    • यदि रोबोट कोमल (compliant, जैसे रबर का हाथ) है, तो वह सुरक्षित है, लेकिन वह धीरे चलता है और पीछे रह जाता है, जिससे काम पूरा करने में बहुत समय लगता है।

यह कार पार्क करने की कोशिश करने जैसा है जहाँ आप हर 5 सेकंड में केवल पार्किंग स्पॉट को देखते हैं। आप अपनी गति को सुचारू रूप से समायोजित नहीं कर सकते, इसलिए या तो आप बहुत तेज गाड़ी चलाते हैं और टकरा जाते हैं, या आप बहुत धीरे चलते हैं और कभी वहाँ पहुँच ही नहीं पाते।

समाधान: रोबोट को "स्पीडोमीटर" देना

लेखकों ने महसूस किया कि AI को न केवल यह बताना चाहिए कि कहाँ जाना है, बल्कि यह भी बताना चाहिए कि वहाँ कितनी तेजी से पहुँचना है। वे इसे "वेलोसिटी फीडफॉरवर्ड" (Velocity Feedforward) कहते हैं। इसे एक स्पीडोमीटर और क्रूज कंट्रोल सेटिंग के साथ GPS निर्देशांक देने के रूप में समझें।

उन्होंने रोबोट को यह गति की जानकारी देने के दो तरीके आजमाए:

विधि 1: "गणितीय शॉर्टकट" (Finite Difference)

यह एक आसान, त्वरित समाधान है।

  • यह कैसे काम करता है: AI अभी भी केवल स्थानों की एक सूची देता है (जैसे रुकने और चलने वाली सूची)। रोबोट का कंप्यूटर बस एक त्वरित गणितीय ट्रिक करता है: "यदि मैं एक सेकंड पहले स्थान A पर था, और अब मैं स्थान B पर हूँ, तो मेरी गति X रही होगी।"
  • उपमा: यह आपकी कार के ओडोमीटर को देखकर आपकी औसत गति का अनुमान लगाने जैसा है। यह एकदम सटीक नहीं है, लेकिन यह रोबोट को पहले की तुलना में बहुत अधिक तेज़ और सुचारू रूप से चलाने के लिए पर्याप्त है।
  • परिणाम: इस विधि ने रोबोट को कार्य करने में काफी तेज़ बना दिया।

विधि 2: "सुचारू वक्र" (Cubic B-Splines)

यह एक फैंसी, हाई-टेक समाधान है।

  • यह कैसे काम करता है: बिंदुओं की एक सूची देने के बजाय, AI सभी बिंदुओं को जोड़ने वाली एक चिकनी, निरंतर रेखा (वक्र/curve) खींचता है।
  • उपमा: कल्पना कीजिए कि पहली विधि सीढ़ियों के पत्थरों की एक श्रृंखला है। आपको एक से दूसरे पर कूदना पड़ता है। यह विधि एक चिकनी स्लाइड (slide) बनाने जैसी है। रोबोट किसी भी गति से उस वक्र पर फिसल सकता है, और गणित यह गारंटी देता है कि गति पूरी तरह से सुचारू है, जिसमें कोई झटकेदार उछाल नहीं है।
  • परिणाम: इस विधि ने रोबोट को बहुत अधिक तेज़ तो नहीं बनाया, लेकिन इसने गतिविधियों को अविश्वसनीय रूप से सुचारू बना दिया। दिलचस्प बात यह है कि गति में मामूली "लहरें" (jiggles) वास्तव में रोबोट की मदद करती थीं ताकि यदि घन थोड़ा गलत संरेखित (misaligned) हो, तो वह उसे छेद में फिट करने के लिए हिल सके, जिससे सफलता दर बहुत अधिक रही।

यह क्यों महत्वपूर्ण है

सबसे बड़ी सफलता यह है कि उन्हें रोबोट के दिमाग (AI मॉडल) को फिर से बनाने की आवश्यकता नहीं पड़ी। उन्होंने केवल यह बदला कि डेटा कैसे एकत्र किया जाता है और रोबोट के 'मांसपेशियों' (कंट्रोलर) द्वारा कमांड को कैसे समझा जाता है।

  • पहले: रोबोट एक कठोर, धीमा या अनाड़ी कार्यकर्ता था।
  • अब: रोबोट एक तेज़, सुचारू और सुरक्षित कार्यकर्ता है। यह कमरे में तेज़ी से घूम सकता है (क्योंकि इसे अपनी गति पता है) लेकिन यह अभी भी एक घन को बिना तोड़े छोटे से छेद में धीरे से घुसा सकता है।

मुख्य निष्कर्ष (The Takeaway)

यह शोध पत्र दिखाता है कि वास्तविक कारखानों (जहाँ उन्हें तेज़ लेकिन सुरक्षित होने की आवश्यकता है) में रोबोटों को कुशलता से काम करने के लिए, हमें उन्हें केवल बिंदु A से बिंदु B तक जाने के रूप में देखना बंद करना होगा। हमें उन्हें वेग (velocity - गति और दिशा) को समझने के लिए सिखाना होगा।

रोबोट की दैनिक कार्य सूची में केवल एक "गति सीमा" (speed limit) और "त्वरण" (acceleration) निर्देश जोड़कर, हम औद्योगिक रोबोटों को एक सौम्य, उच्च-गति वाले कलाकार की तरह व्यवहार करने के योग्य बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →