← नवीनतम पेपर
💻 computer science

Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models

यह शोध पत्र लेटेंट रीजनिंग वीएलए (LaRA-VLA) का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो स्पष्ट रीजनिंग दृष्टिकोणों की तुलना में 90% तक कम इन्फरेंस लेटेंसी के साथ कुशल, वास्तविक समय के एम्बोडीड कंट्रोल को प्राप्त करने के लिए निरंतर लेटेंट रिप्रेजेंटेशन में मल्टी-मोडल चेन-ऑफ-थॉट रीजनिंग को आंतरिक रूप से समाहित करता है।

मूल लेखक: Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

प्रकाशित 2026-05-12
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Shuanghao Bai, Jing Lyu, Wanqi Zhou, Zhe Li, Dakai Wang, Lei Xing, Xiaoguang Zhao, Pengwei Wang, Zhongyuan Wang, Cheng Chi, Badong Chen, Shanghang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को सैंडविच बनाना सिखा रहे हैं।

पुराना तरीका (Explicit Chain-of-Thought):
वर्तमान में, अधिकांश उन्नत रोबोट मस्तिष्क एक ऐसे छात्र की तरह काम करते हैं जिसे एक भी कदम उठाने से पहले अपनी हर एक सोच को डायरी में लिखने के लिए मजबूर किया जाता है।

  • रोबोट देखता है: "मुझे एक सैंडविच चाहिए।"
  • रोबोट सोचता है (ज़ोर से): "ठीक है, सबसे पहले मुझे ब्रेड ढूँढनी होगी। मैं बाईं ओर एक लोफ देख रहा हूँ। अब मुझे चाकू उठाना होगा। मैं दाईं ओर चाकू देख रहा हूँ। मुझे अपना हाथ धीरे-धीरे हिलाना होगा..."
  • रोबोट कार्य करता है: यह पूरा पैराग्राफ लिखने के बाद ही अपने हाथ को हिलाता है।

समस्या: यह अविश्वसनीय रूप से धीमा है। जब तक रोबोट अपनी "डायरी प्रविष्टि" लिखना समाप्त करता है, तब तक सैंडविच ठंडा हो चुका होता है, या रोबोट ब्रेड पकड़ने का मौका खो देता है। साथ ही, शब्दों (डिस्क्रीट टोकन) में लिखना एक रोबोट के लिए थोड़ा अटपटा है जिसे अपने हाथ को सुचारू, निरंतर वक्रों (curves) में घुमाने की आवश्यकता होती है। यह एक कार चलाने जैसा है जहाँ आपको केवल 1-इंच के जंप में चलने की अनुमति दी जाए।

नया तरीका (LaRA-VLA):
यह पेपर LaRA-VLA (Latent Reasoning VLA) पेश करता है। इसे ऐसे समझें जैसे आप रोबोट को कुछ भी लिखे बिना अपने मन में सोचने के लिए सिखा रहे हैं।

लंबा पैराग्राफ उगलने के बजाय, रोबोट अपनी तर्क प्रक्रिया को एक संक्षिप्त, निरंतर "एहसास" या "वाइब" (एक लेटेंट रिप्रेजेंटेशन) में आंतरिक रूप से समाहित कर लेता है।

  • रोबोट देखता है: "मुझे एक सैंडविच चाहिए।"
  • रोबोट सोचता है (मन ही मन): वह ब्रेड, चाकू की स्थिति और अपने हाथ के रास्ते को एक ही बार में, एक सहज मानसिक स्नैपशॉट में तुरंत प्रोसेस कर लेता है।
  • रोबोट कार्य करता है: वह तुरंत कार्य करता है।

तीन-चरणीय प्रशिक्षण शिविर (Curriculum Learning)

पेपर बताता है कि आप रोबोट को सीधे "मन में सोचना" नहीं सिखा सकते। इसके लिए तीन चरणों वाला एक प्रशिक्षण शिविर चाहिए:

  1. चरण 1: "अपना काम दिखाओ" चरण।
    रोबोट को अपने विचार (टेक्स्ट) लिखने और अगली तस्वीर कैसी दिखेगी, इसका अनुमान लगाने के लिए मजबूर किया जाता है। वह खेल के नियम सीखता है, जैसे स्पष्ट रूप से कहना, "मैं कप को बाईं ओर ले जा रहा हूँ।"

  2. चरण 2: "फुसफुसाहट" चरण।
    प्रशिक्षक रोबोट के लिखे हुए वाक्यों को "फुसफुसाहटों" (लेटेंट टोकन) से बदलना शुरू कर देते हैं। शुरुआत में, रोबोट आधा वाक्य लिखता है और बाकी हिस्सा फुसफुसाता है। धीरे-धीरे, वह कम लिखता है और अधिक फुसफुसाता है। वह अपने जटिल विचारों को एक छोटे, कुशल मानसिक पैकेज में संकुचित करना सीख जाता है।

  3. चरण 3: "मौन मास्टर" चरण।
    रोबोट अब कुछ भी ज़ोर से नहीं लिखता और न ही फुसफुसाता है। उसने तर्क प्रक्रिया को पूरी तरह से आत्मसात कर लिया है। वह दृश्य को देखता है, अपने मन में "फुसफुसाहट" को प्रोसेस करता है, और तुरंत कार्य को निष्पादित करता है।

यह बेहतर क्यों है?

  • गति: क्योंकि रोबोट डायरी प्रविष्टि टाइप करने में समय बर्बाद नहीं कर रहा है, वह 90% तेज़ी से प्रतिक्रिया दे सकता है। पेपर का दावा है कि इसने सोचने के समय को 7 सेकंड से घटाकर केवल 0.13 सेकंड (135 मिलीसेकंड) कर दिया है। यह वास्तविक समय के नियंत्रण के लिए पर्याप्त तेज़ है।
  • सुचारूता (Smoothness): चूंकि रोबोट "निरंतर अहसासों" में सोचता है न कि "डिस्क्रीट शब्दों" में, इसलिए उसकी गतिविधियाँ अधिक सुचारू होती हैं और वास्तविक दुनिया के अनुरूप होती हैं।
  • मजबूती (Robustness): पेपर में परीक्षण किया गया कि रोबोट ने धुंधले या शोर वाले कैमरा फीड (जैसे धुंधली खिड़की से देखना) के साथ कैसा प्रदर्शन किया। "मौन विचारक" (LaRA-VLA) ने "डायरी लिखने वालों" की तुलना में इस अव्यवस्था को बहुत बेहतर तरीके से संभाला, जो बताता है कि उनके आंतरिक मानसिक मॉडल अधिक स्थिर हैं।

परिणाम

परीक्षणों में, इस नई पद्धति ने लगभग सभी शीर्ष-स्तरीय रोबोट मॉडलों को पछाड़ दिया। यह लंबे, जटिल कार्यों (जैसे फल छाँटना या कटोरे सजाना) में बेहतर था और इसने यह सब बहुत तेज़ी से किया।

संक्षेप में: LaRA-VLA रोबोट्स को किसी कार्य के माध्यम से "बोलकर" जाने के बजाय उसे "महसूस" करना सिखाता है, जिसके परिणामस्वरूप एक ऐसा रोबोट मिलता है जो एक जीनियस प्लानर और एक बिजली की तरह तेज़ वर्कर दोनों है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →