← नवीनतम पेपर
💻 computer science

BitVLA: 1-bit Vision-Language-Action Models for Robotics Manipulation

BitVLA रोबोटिक मैनिपुलेशन के लिए एक पूर्णतः नेटिव 1-बिट विजन-लैंग्वेज-एक्शन मॉडल पेश करता है जो नेटिव टर्नरी पैरामीटर डिज़ाइन और विजन बैकबोन के लिए एक नवीन 'क्वांटाइज-देन-डिस्टिल' रणनीति के माध्यम से मेमोरी फुटप्रिंट और लेटेंसी को महत्वपूर्ण रूप से कम करते हुए फुल-प्रिसिजन बेसलाइन के तुलनीय प्रदर्शन प्राप्त करता है।

मूल लेखक: Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen

प्रकाशित 2026-03-03
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Hongyu Wang, Chuyan Xiong, Ruiping Wang, Xilin Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक प्रतिभाशाली, अति-बुद्धिमान रोबोट शेफ (रसोइया) है। यह शेफ रेसिपी (भाषा) पढ़ने, सामग्री (दृष्टि) देखने और काटने, चलाने या पकाने का निर्णय लेने (क्रिया) में अविश्वसनीय रूप से निपुण है। रोबोटिक्स की दुनिया में, इसे विज़न-लैंग्वेज-एक्शन (VLA) मॉडल कहा जाता है।

हालाँकि, एक बड़ी समस्या है: यह शेफ वर्तमान में एक विशालकाय (giant) है। इस शेफ के दिमाग को चलाने के लिए, आपको एक विशाल, महंगे सुपरकंप्यूटर की आवश्यकता होती है। यह एक पूरी लाइब्रेरी को बैकपैक में फिट करने की कोशिश करने जैसा है। आप इस शेफ को एक छोटी रसोई, एक कारखाने के फर्श या एक होम रोबोट के पास नहीं ले जा सकते क्योंकि इसका "दिमाग" बहुत भारी और धीमा है।

यहाँ आता है BitVLA। इस शोध पत्र के पीछे के शोधकर्ताओं ने एक सरल प्रश्न पूछा: "क्या होगा यदि हम इस विशाल शेफ को एक पॉकेट कैलकुलेटर के आकार तक छोटा कर सकें, बिना उनके खाना पकाने के कौशल को खोए?"

उन्होंने इसे कैसे किया, यहाँ सरल उपमाओं (analogies) के माध्यम से समझाया गया है:

1. "टेरनरी" शेफ (1-बिट का जादू)

अधिकांश कंप्यूटर दिमाग उन संख्याओं के साथ काम करते हैं जो कुछ भी हो सकती हैं (जैसे 3.14159...)। यह उन्हें भारी और धीमा बनाता है।
BitVLA टीम ने अपने रोबोट शेफ को केवल तीन सरल संख्याओं में सोचना सिखाने का निर्णय लिया: -1, 0, और 1

  • उपमा: कल्पना कीजिए कि एक सामान्य शेफ जिसके पास हजारों अलग-अलग मसालों का भंडार है, जिनमें से प्रत्येक का एक अनूठा, जटिल स्वाद है। BitVLA एक ऐसा शेफ है जो केवल तीन सामग्रियों का उपयोग करता है: नमक (-1), कुछ नहीं (0), और चीनी (1)
  • परिणाम: केवल इन तीन "सामग्रियों" के साथ भी, शेफ अभी भी एक शानदार भोजन बना सकता है। अपने दिमाग को इन तीन मानों तक सीमित करके, मॉडल 11 गुना छोटा और 4.4 गुना तेज़ हो जाता है। यह एक भारी पत्थर की मूर्ति को एक हल्के, टिकाऊ प्लास्टिक संस्करण से बदलने जैसा है जो बिल्कुल वैसा ही दिखता है और वैसा ही व्यवहार करता है।

2. "टीचर-स्टूडेंट" ट्रिक (क्वांटाइज-देन-डिस्टिल)

आप एक विशाल दिमाग को लेकर उसे एक छोटे दिमाग में नहीं कुचल सकते; वह टूट जाएगा। शोधकर्ताओं ने एक चतुर प्रशिक्षण पद्धति का उपयोग किया जिसे "क्वांटाइज-देन-डिस्टिल" (Quantize-then-Distill) कहा जाता है।

  • उपमा: कल्पना कीजिए कि एक मास्टर शेफ (शिक्षक) है जो सब कुछ जानता है और जिसके पास एक विशाल, पूर्ण-परिशुद्धता वाला दिमाग है। उन्होंने एक स्टूडेंट शेफ (BitVLA) को काम पर रखा है जिसके पास केवल एक छोटी नोटबुक है जिसमें प्रति पृष्ठ तीन संख्याएँ आ सकती हैं।
  • प्रक्रिया: मास्टर शेफ केवल छात्र को रेसिपी नहीं देता; वे छात्र के साथ खाना बनाते समय उनके पास खड़े रहते हैं। हर बार जब मास्टर शेफ सोचते हैं, "एक चुटकी नमक डालें," तो स्टूडेंट शेफ केवल अपनी छोटी नोटबुक का उपयोग करके उस एहसास की नकल करने की कोशिश करता है।
  • परिणाम: छात्र मास्टर की तरह सोचना सीख जाता है, लेकिन केवल अपने सीमित उपकरणों का उपयोग करके। यह सुनिश्चित करता है कि छोटा होने पर भी रोबोट अपनी बुद्धिमत्ता न खोए।

3. यह क्यों महत्वपूर्ण है ("एज" क्रांति)

वर्तमान में, यदि आप चाहते हैं कि एक रोबोट जटिल कार्य करे (जैसे कपड़े तह करना या कार असेंबल करना), तो आपको आमतौर पर इसे क्लाउड में स्थित एक विशाल सर्वर से जोड़ना पड़ता है। यह धीमा (हाई लेटेंसी) है और जोखिम भरा है (क्या होगा यदि इंटरनेट कट जाए?)।

  • BitVLA का लाभ: क्योंकि BitVLA इतना छोटा और कुशल है, यह सीधे रोबोट पर ही (ऑन द "एज") चल सकता है।
  • वास्तविक दुनिया का प्रभाव:
    • गति: रोबट किसी दूर के सर्वर से संकेत मिलने का इंतजार करने के बजाय, तुरंत प्रतिक्रिया देता है, जैसे कि एक रिफ्लेक्स (प्रतिवर्त)।
    • लागत: आपको $10,000 के सुपरकंप्यूटर की आवश्यकता नहीं है; आप इसे एक मानक लैपटॉप या छोटे रोबोट के ऑनबोर्ड चिप पर चला सकते हैं।
    • ऊर्जा: यह बहुत कम बैटरी पावर का उपयोग करता है, जिसका अर्थ है कि रोबोट रिचार्ज किए बिना लंबे समय तक काम कर सकते हैं।

निचोड़ (The Bottom Line)

यह शोध पत्र BitVLA को पेश करता है, जो पहला रोबोट मस्तिष्क है जो छोटा होने के लिए ही "नेटिव" (मूल रूप से निर्मित) है। यह केवल एक बड़े दिमाग को एक छोटे बॉक्स में नहीं दबाता है; इसे शुरू से ही छोटा होने के लिए डिज़ाइन किया गया था।

इस तरह सोचें: पहले, हम एक हाथी को मिनी कूपर में फिट करने की कोशिश कर रहे थे। BitVLA एक ऐसा हाथी होने के बजाय एक अत्यधिक कुशल, छोटे रोबोट के रूप में खुद को पहचानने जैसा है जो बिल्कुल वही काम करता है, एक AA बैटरी पर चलता है, और आपकी जेब में समा जाता है। यह स्मार्ट रोबोटों के अंततः हमारे घरों, कारखानों और अस्पतालों में मौजूद होने का द्वार खोलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →