← नवीनतम पेपर
🤖 AI

TempoVLA: Learning Speed-Controllable Vision-Language-Action Policies

TempoVLA एक गति-नियंत्रणीय विजन-लैंग्वेज-एक्शन पॉलिसी पेश करता है जो वेरिएबल-स्पीड ट्राजेक्टरी ऑग्मेंटेशन (VSTA) और स्पष्ट स्पीड कंडीशनिंग का लाभ उठाता है ताकि रोबोटों को तेज़ ट्रांजिट और धीमी, सटीक संपर्क चरणों, दोनों के लिए अपनी निष्पादन गति को गतिशील रूप से समायोजित करने में सक्षम बनाया जा सके, जिससे मौजूदा मॉडलों की निश्चित-गति सीमाओं को दूर किया जा सके।

मूल लेखक: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

प्रकाशित 2026-06-05
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dong Jing, Jingchen Nie, Tianqi Zhang, Jiaqi Liu, Huaxiu Yao, Zhiwu Lu, Mingyu Ding

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक रोबोट है जिसने किसी इंसान को एक बार काम करते हुए देखकर कोई कार्य सीखा है, जैसे कपों को एक के ऊपर एक रखना या तौलिया तह करना। समस्या यह है कि वह रोबोट एक "एक-गति" (one-speed) वाली दुनिया में फंसा हुआ है। यदि इंसान का प्रदर्शन धीमा था, तो रोबोट हमेशा धीरे ही चलेगा। यदि इंसान का प्रदर्शन तेज़ था, तो रोबोट हमेशा तेज़ी से दौड़ता रहेगा। वह काम के किसी नाजुक हिस्से के लिए धीमा होने या खाली जगह में चलते समय तेज़ होने का निर्णय नहीं ले सकता।

TempoVLA एक नया सिस्टम है जो रोबोट को उसकी गति के लिए एक "वॉल्यूम नॉब" (volume knob) देता है। यह एक ही रोबोट मस्तिष्क को एक ही कार्य को कमांड पर 0.5x गति (सुपर स्लो और सावधान), 1x गति (सामान्य), या 2x गति (सुपर फास्ट) पर करने की अनुमति देता है।

उन्होंने इसे कैसे किया, इसे दो सरल भागों में विभाजित किया गया है:

1. "वीडियो एडिटर" (डेटा पक्ष)

रोबोट को सिखाने से पहले, शोधकर्ताओं को प्रशिक्षण वीडियो को ठीक करना था। उन्होंने एक चतुर टूल बनाया जिसे VSTA (Variable-Speed Trajectory Augmentation) कहा जाता है।

एक रोबोट के प्रदर्शन को एक फिल्म की तरह समझें।

  • तेज़ बनाने के लिए: एडिटर कई क्रमिक फ्रेम लेता है और उन्हें एक बड़े जंप (jump) में मिला देता है। यह फिल्म के उबाऊ हिस्सों को छोड़कर सीधे एक्शन तक पहुँचने जैसा है।
  • धीमा बनाने के लिए: एडिटर एक बड़ी गति को लेकर उसे कई छोटे, धीमे चरणों में विभाजित कर देता है। यह किसी विशिष्ट दृश्य में "स्लो-मोशन" प्रभाव जोड़ने जैसा है।

महत्वपूर्ण बात यह है कि यह संपादन इस बात को नहीं बदलता कि रोबकल क्या कर रहा है (semantics), बल्कि केवल यह कि वह इसे कितनी तेज़ी से करता है। उन्होंने एक मूल प्रदर्शन को लिया और उसे छह अलग-अलग गतियों पर किए गए एक ही कार्य की लाइब्रेरी में बदल दिया।

2. "स्पीड डायल" (मॉडल पक्ष)

एक बार जब रोबोट के पास तेज़ और धीमी गति के उदाहरणों की यह लाइब्रेरी हो जाती है, तो वे उसे एक नया करतब सिखाते हैं। वे रोबोट को एक सरल "स्पीड डायल" (एक नंबर जैसे 0.5, 1.0, या 1.5) देते हैं जिसे वह काम करते समय देख सकता है।

  • यदि आप रोबोट को कहते हैं, "इसे 1.5x गति पर करो," तो रोबोट अपने प्रशिक्षण डेटा को देखता है, तेज़ उदाहरणों को देखता है, और बड़े, साहसी मूव्स (moves) का अनुमान लगाता है।
  • यदि आप कहते हैं, "इसे 0.5x गति पर करो," तो वह धीमे उदाहरणों को देखता है और बहुत छोटे, सतर्क मूव्स का अनुमान लगाता है।

रोबोट को हर नई गति के लिए शून्य से फिर से प्रशिक्षित करने की आवश्यकता नहीं है। वह बस "स्पीड डायल" को सुनने और उसके अनुसार अपनी मांसपेशियों की गतिविधियों को समायोजित करने के लिए सीख जाता है।

"स्मार्ट पायलट" बोनस

पेपर यह भी दिखाता है कि आप इस रोबोट को एक "स्मार्ट पायलट" (एक बड़ा AI लैंग्वेज मॉडल) के साथ जोड़ सकते हैं। आपको "धीरे हो जाओ" टाइप करने के बजाय, स्मार्ट पायलट रोबोट के कैमरा फीड को देखता है।

  • परिदृश्य: रोबोट एक खाली मेज के ऊपर से हाथ बढ़ा रहा है।
    • स्मार्ट पायलट: "रास्ता साफ़ है! तेज़ चलो!" (रोबोट तेज़ हो जाता है)।
  • परिदृश्य: रोबोट एक नाजुक कप को पकड़ने वाला है।
    • स्मार्ट पायलट: "खतरा क्षेत्र! धीमा हो जाओ!" (रोबोट बहुत धीमी गति पर आ जाता है)।

यह एक ऐसा रोबोट बनाता है जो सुरक्षित होने पर स्वाभाविक रूप से तेज़ होता है और जब उसे सटीकता की आवश्यकता होती है तो धीमा हो जाता है, और यह सब बिना मानवीय हस्तक्षेप के होता है।

उन्होंने क्या पाया

  • लचीलापन (Flexibility): रोबोट सफलतापूर्वक चलते समय अपनी गति बदल सकता है।
  • बेहतर प्रदर्शन: आश्चर्यजनक रूप से, इन मिश्रित गतियों पर रोबोट को प्रशिक्षित करने से वह सामान्य गति (1x) पर भी बेहतर प्रदर्शन करता है, जो केवल सामान्य गति पर प्रशिक्षित रोबोटों से बेहतर है। ऐसा लगता है कि विभिन्न गतियों पर चलना सीखने से रोबोट कार्य को बेहतर ढंग से समझने में मदद मिलती है।
  • सीमाएँ: एक भौतिक सीमा है। यदि आप रोबोट को बहुत तेज़ (जैसे 4x गति) जाने के लिए कहते हैं, तो रोबोट के भौतिक मोटर और कंट्रोलर उसके मस्तिष्क के निर्देशों के साथ तालमेल नहीं बिठा पाते, और वह अपने लक्ष्य को चूकने लगता है। लेकिन एक उचित सीमा (0.5x से 1.5x) के भीतर, यह पूरी तरह से काम करता है।

संक्षेप में, TempoVLA एक कठोर, एकल-गति वाले रोबोट को एक लचीले कार्यकर्ता में बदल देता है जो अपनी गति खुद चुन सकता है, जिससे यह नाजुक कार्यों के लिए सुरक्षित और नियमित कार्यों के लिए तेज़ बन जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →