← नवीनतम पेपर
🤖 AI

CoTinyVLA: Chain-of-Thought Distillation for a Sub-Billion-Parameter Vision-Language-Action Model

CoTinyVLA एक बिलियन से कम पैरामीटर वाला विजन-लैंग्वेज-एक्शन मॉडल है जो मॉडल का आकार बढ़ाने के बजाय संरचित पर्यवेक्षण तकनीकों—जिसमें डुअल-व्यू टेम्पोरल इनपुट्स, पदानुक्रमित चेन-ऑफ-थॉट डिस्टिलेशन और पैराफ्रेस ऑगमेंटेशन शामिल हैं—का लाभ उठाकर LIBERO-Plus बेंचमार्क पर अत्याधुनिक मजबूती (state-of-the-art robustness) प्राप्त करता है।

मूल लेखक: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

प्रकाशित 2026-07-29
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minhyeok Lee, Chiyoung Kim, Chanhoe Gu, Seongrok Kim, Sanghyuk Roy Choi, Donghwan Hwang, Donghun Ryu, Seokhyun Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ रोबोट केवल कठोर कोड का पालन करने वाली बेजान मशीनें नहीं हैं, बल्कि मददगार साथी हैं जो हमारे बोले गए शब्दों को समझते हैं और यह समझ सकते हैं कि काम पूरा करने के लिए उन्हें अपने हाथ कैसे चलाने हैं। यह "एम्बोडीड एआई" (embodied AI) का सपना है, एक ऐसा क्षेत्र जहाँ कंप्यूटर कैमरों के माध्यम से दुनिया को देखना, मानवीय भाषा को समझना और उन दोनों को शारीरिक क्रियाओं में बदलना सीखते हैं। लंबे समय तक, सबसे स्मार्ट रोबोटों को विशाल मस्तिष्क—ऐसे कंप्यूटर मॉडल जिनमें अरबों "न्यूरॉन्स" होते हैं—की आवश्यकता होती थी ताकि वे काम संभाल सकें। ये विशाल मॉडल सुपरकंप्यूटर की तरह थे जिन्हें चलाने के लिए बहुत बड़े, महंगे सर्वर की आवश्यकता होती थी, जिससे उन्हें घर में घूमते रहने वाले या रसोई में मदद करने वाले छोटे रोबोट के अंदर फिट करना असंभव हो जाता था। शोधकर्ता लंबे समय से एक ही सवाल पूछ रहे थे: क्या हम एक ऐसा रोबोट बना सकते हैं जो उतना ही स्मार्ट और भरोसेमंद हो, लेकिन इतना छोटा हो कि एक बैकपैक में समा सके?

यह शोध पत्र एक नया रोबोट मस्तिष्क पेश करता है जिसे CoTinyVLA कहा जाता है। इसे एक छोटे, अत्यंत कुशल रोबोट मस्तिष्क के रूप में समझें जो क्षेत्र में नेतृत्व करने वाले विशाल, भारी-भरकम मॉडलों से बेहतर प्रदर्शन करने में सफल रहा है, और वह भी बहुत कम मेमोरी का उपयोग करके। शोधकर्ताओं ने केवल इसके मस्तिष्क को छोटा नहीं किया; उन्होंने इसे बेहतर तरीके से सोचने का तरीका सिखाया। हर स्थिति को रटने के बजाय, उन्होंने रोबोट को तर्क करने के लिए एक "चीट शीट" (cheat sheet) दी। उन्होंने इसे एक बड़े कार्य को एक सरल योजना (जैसे कि टू-डू लिस्ट) में तोड़ने और फिर हिलने-डुलने से पहले प्रत्येक छोटे कदम के बारे में सोचने के लिए प्रशिक्षित किया। उन्होंने इसे एक विशेष जोड़ी आँखें भी दीं—एक दूर से देखने वाली जो पूरे कमरे को देख सके, और एक उसकी कलाई पर जो यह देख सके कि उसका हाथ वास्तव में क्या छू रहा है—और इसे पिछले कुछ सेकंड के वीडियो को देखने के लिए भी प्रशिक्षित किया ताकि यह गति को समझ सके। परिणाम एक ऐसा रोबोट मॉडल है जिसमें केवल 0.9 बिलियन पैरामीटर्स हैं (7-बिलियन पैरामीटर वाले दिग्गजों की तुलना में बहुत छोटा) जो आठ गुना बड़े मॉडलों की तुलना में जटिल, वास्तविक दुनिया की स्थितियों को बेहतर ढंग से संभाल सकता है।

समस्या: बड़े मस्तिष्क, छोटे रोबोट

वर्षों से, निर्देशों का पालन करने के लिए सबसे अच्छे रोबोट विशाल, भारी टैंकों की तरह रहे हैं। "नीले कप को उठाओ और उसे मेज पर रख दो" जैसे आदेश को समझने के लिए, इन रोबोटों के पास 3 से 7 बिलियन पैरामीटर वाले विशाल कंप्यूटर मॉडल होते हैं। हालांकि ये मॉडल अविश्वसनीय रूप से स्मार्ट हैं, लेकिन वे भी बहुत बड़े हैं। उन्हें चलाने के लिए लगभग 20 गीगाबाइट कंप्यूटर मेमोरी की आवश्यकता होती है। यह एक बैकपैक में पूरी लाइब्रेरी रखने की कोशिश करने जैसा है; यह मोबाइल रोबोट या सहायक उपकरणों में पाए जाने वाले छोटे, बैटरी से चलने वाले कंप्यूटरों में फिट ही नहीं बैठता।

शोधकर्ता जानना चाहते थे: क्या हमें वास्तव में इतने विशाल मस्तिष्क की आवश्यकता है? या क्या हम एक छोटा, कुशल रोबोट बना सकते हैं जो वास्तविक दुनिया की अप्रत्याशित अव्यवस्था को संभालने में उतना ही अच्छा हो?

समाधान: एक बड़ी रणनीति वाला छोटा मस्तिष्क

टीम ने CoTinyVLA बनाया, जो केवल 0.9 बिलियन पैरामीटर वाला एक रोबोट मस्तिष्क है। इस छोटे मॉडल को दिग्गजों जितना मजबूत बनाने के लिए, उन्होंने केवल इसे अधिक डेटा नहीं दिया; उन्होंने इसे सीखने के तरीके और इस बात को बदला कि यह किस चीज़ पर ध्यान देता है। उन्होंने तीन मुख्य तरकीबों का उपयोग किया, जिन्हें वे "स्ट्रक्चर्ड सुपरविज़न" (structured supervision) कहते हैं, ताकि रोबोट को बेहतर तरीके से सोचना सिखाया जा सके।

1. "दो-आँखों" वाली टाइम मशीन
कल्पना कीजिए कि आप एक गेंद को पकड़ने की कोशिश कर रहे हैं। यदि आप गेंद की केवल एक तस्वीर देखते हैं, तो आपको यह पता नहीं चलेगा कि वह आपकी ओर आ रही है या आपसे दूर जा रही है। आपको गति को समझने के लिए एक छोटा वीडियो देखने की आवश्यकता है।
CoTinyVLA को एक ही समय में दो अलग-अलग "आँखों" के माध्यम से दुनिया को देखने के लिए प्रशिक्षित किया गया है:

  • थर्ड-पर्सन आई (Third-Person Eye): एक कैमरा जो पूरे कमरे को देखता है ताकि यह देखा जा सके कि सब कुछ कहाँ है।
  • रिस्ट आई (Wrist Eye): रोबोट के हाथ पर लगा एक कैमरा ताकि यह देखा जा सके कि ग्रिपर वास्तव में क्या छू रहा है।
    केवल वर्तमान क्षण को देखने के बजाय, रोबोट पिछले 16 फ्रेमों (प्रत्येक आँख से 8) का एक छोटा "मूवी" देखता है। यह उसे समय और गति का बोध कराता है, जिससे उसे यह समझने में मदद मिलती है कि चीजें कितनी तेजी से चल रही हैं और वे कहाँ जा रही हैं।

2. "योजना और सोच" की चीट शीट
यह सबसे महत्वपूर्ण तरकीब है। हिलने से पहले, रोबोट को एक कहानी लिखने के लिए प्रशिक्षित किया जाता है।

  • योजना (The Plan): कार्य की शुरुआत में, रोबोट एक उच्च-स्तरीय "टू-डू लिस्ट" लिखता है (जैसे, "पहले, कप पकड़ो। दूसरा, उसे उठाओ। तीसरा, उसे मेज पर रखो")। यह योजना पूरे कार्य के लिए समान रहती है।
  • सोच (The Think): हर छोटी हरकत से पहले, रोबдноत रोबोट एक संक्षिप्त नोट लिखता है कि वह अभी क्या कर रहा है (जैसे, "मैं अपना ग्रिपर बंद कर रहा हूँ," या "मैं कप को उठा रहा हूँ")।
    रोबोट इसे एक बहुत बड़े, स्मार्ट रोबोट (एक 35-बिलियन पैरामीटर वाले "शिक्षक") को उन्हीं कार्यों को हल करते हुए देखकर सीखता है। छोटा रोबोट शिक्षक की सोचने की प्रक्रिया की नकल करता है। यह छोटे रोबोट को यह समझने में मदद करता है कि वह कुछ क्यों कर रहा है, न कि केवल यह कि वह क्या कर रहा है।

3. "पैराफ्रेस" (Paraphrase) गेम
रोबोट अक्सर भ्रमित हो जाते हैं यदि आप एक ही बात को अलग तरीके से कहते हैं। यदि एक रोबोट को केवल "कप उठाओ" वाक्यांश पर प्रशिक्षित किया गया है, तो यदि आप "मग पकड़ो" कहते हैं, तो वह अटक सकता है।
इसे ठीक करने के लिए, शोधकर्ताओं ने रोबोट को 40 बुनियादी निर्देशों के साथ प्रशिक्षित किया लेकिन उन्हें 800 विभिन्न संस्करणों में विस्तारित किया। उन्होंने शब्दों को बदला (जैसे "pick" को "grab" या "lift" में बदलना), वस्तुओं के विवरण बदले (जैसे "काले कटोरे" को "गहरे कटोरे" में बदलना), और यहाँ तक कि "कृपया..." जैसे विनम्र वाक्यांश भी जोड़े। इसने रोबोट को केवल विशिष्ट शब्दों को नहीं, बल्कि कमांड के अर्थ को समझने के लिए प्रशिक्षित किया।

परिणाम: छोटा जीतता है बड़ा

शोधकर्ताओं ने CoTinyVLA का परीक्षण LIBERO-Plus पर किया, जो एक कठिन टेस्ट सुइट है जिसे यह देखने के लिए डिज़ाइन किया गया है कि रोबोट दुनिया में बदलावों को कितनी अच्छी तरह संभालते हैं। इस परीक्षण में 10,000 से अधिक अलग-अलग परिदृश्य शामिल हैं जहाँ चीजें गड़बड़ हैं: रोबोट एक अजीब स्थिति में शुरू होता है, लाइटिंग बदल जाती है, बैकग्राउंड अलग होता है, या निर्देश अजीब तरह से लिखे जाते हैं।

परिणाम आश्चर्यजनक थे। Co-TinyVLA, अपने छोटे 0.9 बिलियन पैरामीटर्स के साथ, सभी चार प्रमुख परीक्षण श्रेणियों में सबसे मजबूत 7-बिलियन पैरामीटर वाले मॉडलों को पछाड़ गया:

  • स्पेशियल (Spatial): 90.8% सफलता (बड़े मॉडलों से 4.7 अंक अधिक)।
  • ऑब्जेक्ट (Object): 87.3% सफलता (बड़े मॉडलों से 2.8 अंक अधिक)।
  • गोल (Goal): 86.6% सफलता (बड़े मॉडलों से पूरे 15.9 अंक अधिक)।
  • लॉन्ग (Long): 80.7% सफलता (बड़े मॉडलों से 3.0 अंक अधिक)।

सबसे बड़ी जीत "गोल" श्रेणी में थी, जहाँ छोटा रोबोट सबसे बड़े विशाल रोबोट से लगभग 16 अंक बेहतर था। यह विशेष रूप से प्रभावशाली है क्योंकि छोटा रोबोट एक ऐसे कंप्यूटर पर चलता है जो केवल 2.25 GiB मेमोरी का उपयोग करता है, जो कई वास्तविक दुनिया के रोबोटों पर फिट होने के लिए पर्याप्त छोटा है।

यह क्यों मायने रखता है

यह शोध पत्र दिखाता है कि एक स्मार्ट रोबोट बनने के लिए आपको विशाल मस्तिष्क की आवश्यकता नहीं है। एक छोटे रोबोट को संरचित तरीके से "सोचने" (योजना बनाना और अपने चरणों की जाँच करना) के लिए प्रशिक्षित करके और उसे सही प्रकार का विजुअल और लैंग्वेज ट्रेनिंग देकर, वह बहुत बड़े मॉडलों की तुलना में वास्तविक दुनिया की अव्यवस्था को बेहतर ढंग से संभाल सकता है।

शोधकर्ताओं ने यह भी पाया कि सोचने की प्रक्रिया का "प्लान" वाला हिस्सा अत्यंत महत्वपूर्ण है। यदि आप रोबोट से योजना लिखने की क्षमता छीन लेते हैं, तो इसकी सफलता दर 40 से 45 अंक तक गिर जाती है। यह साबित करता है कि रोबोट केवल अनुमान नहीं लगा रहा है; वह वास्तव में योजना का उपयोग अपने कार्यों को निर्देशित करने के लिए कर रहा है।

संक्षेप में, CoTinyVLA यह सिद्ध करता है कि सही शिक्षण विधियों के साथ, एक छोटा, कुशल रोबोट एक विशाल सुपरकंप्यूटर के समान सक्षम हो सकता है, जो हमें अपने घरों और कार्यस्थलों में सहायक, बुद्धिमान रोबोटों के करीब लाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →