← नवीनतम पेपर
💻 computer science

TBD-VLA: Temporal Block Diffusion Vision Language Action Model

TBD-VLA एक नवीन डिस्क्रीट विज़न-लैंग्वेज-एक्शन फ्रेमवर्क है जो रोबोटिक मैनिपुलेशन कार्यों में उच्च इन्फरेंस गति और मजबूत टेम्पोरल कोहेरेंस दोनों प्राप्त करने के लिए ऑटोरेग्रेसिव ब्लॉक जनरेशन को मास्क डिस्क्रीट डिफ्यूजन के साथ जोड़ता है।

मूल लेखक: Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

प्रकाशित 2026-06-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sung-Wook Lee, Xuhui Kang, Yen-Ling Kuo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखा रहे हैं, जैसे कि एक सैंडविच बनाना। रोबोट को सामग्री को देखने (दृष्टि/vision), आपके वॉयस कमांड को समझने (भाषा/language), और फिर अपने हाथों को चलाने (क्रिया/actions) की आवश्यकता होगी ताकि वह ब्रेड उठा सके, पीनट बटर फैला सके और जैली रख सके।

यह शोध पत्र पेश करता है कि रोबोट को यह सब सिखाने का एक नया तरीका क्या है, जिसे TBD-VLA कहा जाता है। यह समझने के लिए कि यह विशेष क्यों है, आइए देखते हैं कि रोबवट आमतौर पर कैसे सीखती है बनाम यह नया तरीका कैसे काम करता है।

पुराना तरीका: धीमा, एक-एक करके सोचने वाला रोबोट

अधिकांश वर्तमान रोबोट एक व्यक्ति की तरह सोचते हैं जो एक बार में एक अक्षर लिखकर वाक्य लिखता है। वे पहले पहला मूवमेंट तय करते हैं, फिर दूसरा, फिर तीसरा, और इसी तरह।

  • समस्या: यह बहुत धीमा है। यदि रोबोट को एक कप उठाने के लिए 100 सूक्ष्म गतिविधियों की योजना बनानी है, तो उसे लगातार 100 बार "सोचना" पड़ता है। जब तक वह सोचने का काम पूरा करता है, तब तक कप हिल चुका होता है, या रोबोट वास्तविक समय (real-time) में प्रतिक्रिया देने के लिए बहुत धीमा हो जाता है।
  • विकल्प: कुछ शोधकर्ताओं ने रोबोट को "चंक्स" (जैसे एक बार में पूरा शब्द लिखना) में सोचने के लिए प्रेरित किया ताकि गति बढ़ सके। लेकिन इससे अक्सर रोबोट अनाड़ी हो जाता था क्योंकि वह समय के साथ यह भूल जाता था कि गतिविधियाँ एक-दूसरे से कैसे जुड़ी हैं। यह एक ऐसा वाक्य लिखने जैसा है जहाँ शब्द तो तेज़ हैं, लेकिन व्याकरण टूटा हुआ है।

नया तरीका: TBD-VLA (द "ब्लॉक डिफ्यूजन" शेफ)

लेखकों ने एक ऐसा सिस्टम बनाया है जो दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है। वे इसे टेम्पोरल ब्लॉक डिफ्यूजन (Temporal Block Diffusion) कहते हैं। यह कैसे काम करता है, इसके लिए एक सरल उपमा (analogy) देखते हैं:

1. "ब्लॉक" रणनीति (रेसिपी कार्ड)
हर एक उंगली की हरकत के बारे में व्यक्तिगत रूप से सोचने के बजाय, रोबोट कार्य को ब्लॉक्स (एक रेसिपी के पन्नों की तरह) में विभाजित करता है।

  • ब्लॉक्स के बीच: रोबोट ब्लॉक्स के बारे में एक-एक करके सोचता है (पेज 1, फिर पेज 2)। यह सुनिश्चित करता है कि कहानी समझ में आए और चरण एक तार्किक क्रम का पालन करें।
  • एक ब्लॉक के अंदर: एक बार जब वह "पेज 1" पर काम करने का निर्णय ले लेता है, तो वह उस पेज की सभी गतिविधियों को एक ही समय में तय करता है।

2. "डिफ्यूजन" रणनीति (इरेज़र और पेंसिल)
रोबोट एक ब्लॉक के भीतर गतिविधियों को इतनी तेज़ी से कैसे समझता है? यह डिस्क्रीट डिफ्यूजन (Discrete Diffusion) नामक तकनीक का उपयोग करता है।

  • कल्पना कीजिए कि रोबोट एक खाली कागज से शुरू करता है जहाँ सभी निर्देश छिपे हुए (मास्क किए हुए) हैं।
  • वह एक ही समय में सभी गतिविधियों का एक "अनुमान" लगाता है।
  • फिर, वह अपने अनुमान को देखता है, देखता है कि कौन से हिस्से गलत हैं, और अच्छे अनुमानों को रखते हुए गलत अनुमानों को "मिटा" देता है।
  • यह प्रक्रिया कई बार दोहराई जाती है, जिससे पूरे ब्लॉक की गतिविधियों को एक साथ परिष्कृत (refine) किया जाता है जब तक कि तस्वीर स्पष्ट न हो जाए।

परिणाम: रोबोट तेज़ चलता है क्योंकि उसे हर एक कदम के बारे में अलग से नहीं सोचना पड़ता। वह समूहों में सोचता है, और पूरे समूह को एक साथ परिष्कृत करता है।

"रियल-टाइम चंकिंग" की सुपरपावर

शोध पत्र एक शानदार विशेषता पर प्रकाश डालता है जिसे रियल-टाइम चंकिंग (RTC) कहा जाता है।

  • परिदृश्य: कल्पना कीजिए कि रोबोट वर्तमान में दूध डाल रहा है (एक्शन A)। जबकि वह यह कर रहा है, उसे यह सोचने की भी आवश्यकता है कि आगे क्या करना है (एक्शन B)।
  • समस्या: आमतौर पर, रोबंग को एक्शन B के बारे में सोचना शुरू करने से पहले एक्शन A के 100% समाप्त होने का इंतजार करना पड़ता है। इससे "लैग" या देरी होती है।
  • TBD-VLA समाधान: क्योंकि यह मॉडल "खाली जगहों को भरने" (जिसे इन-पेंटिंग कहा जाता है) के लिए प्रशिक्षित है, यह वर्तमान में की जा रही क्रिया को देख सकता है और कह सकता है, "मैं अभी क्या कर रहा हूँ, यह मैं जानता हूँ, इसलिए मैं वर्तमान कार्य को करते समय ही यह अनुमान लगाना शुरू कर सकता हूँ कि आगे क्या होगा।"
  • उपमा: यह एक संगीतकार द्वारा गाना बजाने जैसा है। गाने के खत्म होने का इंतज़ार करने के बजाय, वे वर्तमान नोट बजाते समय ही अगली पंक्ति गुनगुनाना शुरू कर देते हैं। यह रोबोट को बहुत तेज़ और अधिक प्रतिक्रियाशील बनाता है।

उन्होंने क्या साबित किया?

शोधकर्ताओं ने इस रोबोट मस्तिष्क का दो तरह से परीक्षण किया:

  1. सिमुलेशन में: उन्होंने रोबोट को एक आभासी दुनिया में रखा जहाँ कई अलग-अलग कार्य थे (जैसे ब्लॉक को स्टैक करना या वस्तुओं को हिलाना)। TBD-VLA पिछले तरीकों की तुलना में तेज़ और अधिक सफल रहा, भले ही रोबोट प्रकाश व्यवस्था या कैमरा एंगल में बदलाव से "विचलित" हो रहा हो।
  2. वास्तविक दुनिया में: उन्होंने एक वास्तविक रोबोट आर्म (Franka Research 3) पर टेबलटॉप कार्यों जैसे ब्रेड को टोस्टर में डालना या तरल पदार्थ स्थानांतरित करना जैसे कार्यों के लिए इसका परीक्षण किया।
    • परिणाम: कठिन और बदलते वास्तविक दुनिया के हालातों में TBD-VLA लगभग 67% बार सफल रहा, जबकि पिछला सबसे अच्छा तरीका केवल लगभग 50% बार सफल हो पाया।
    • गति: यह काफी तेज़ भी था, एक निर्णय लेने में एक सेकंड के दसवें हिस्से से भी कम समय लेता है, जो वास्तविक समय के नियंत्रण के लिए पर्याप्त तेज़ है।

सारांश

TBD-VLA रोबोट की गतिविधियों की योजना बनाने का एक नया तरीका है। एक-एक करके धीरे-धीरे सोचने के बजाय, यह कदमों के समूहों में सोचता है जिन्हें यह एक साथ परिष्कृत करता है। यह रोबोट को स्मार्ट (घटनाओं के क्रम को समझना) और तेज़ (वास्तविक समय में प्रतिक्रिया देना) दोनों बनाता है, जिससे यह वास्तविक दुनिया में जटिल कार्यों को संभालने में बहुत बेहतर हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →