← नवीनतम पेपर
💻 computer science

A Pragmatic VLA Foundation Model

यह शोध पत्र LingBot-VLA को प्रस्तुत करता है, जो कि 20,000 घंटों के वास्तविक दुनिया के ड्यूल-आर्म रोबोट डेटा पर प्रशिक्षित एक व्यावहारिक विजन-लैंग्वेज-एक्शन फाउंडेशन मॉडल है, जो कई प्लेटफॉर्म्स पर बेहतर सामान्यीकरण (generalization) प्रदर्शित करता है और एक अत्यधिक कुशल प्रशिक्षण कोडबेस प्रदान करता है, जिसके सभी संसाधन रोबोट लर्निंग के क्षेत्र को आगे बढ़ाने के लिए जारी किए गए हैं।

मूल लेखक: Wei Wu, Fan Lu, Yunnan Wang, Shuai Yang, Shi Liu, Fangjing Wang, Qian Zhu, He Sun, Yong Wang, Shuailei Ma, Yiyu Ren, Kejia Zhang, Hui Yu, Jingmei Zhao, Shuai Zhou, Zhenqi Qiu, Houlong Xiong, Ziyu Wang
प्रकाशित 2026-06-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Wu, Fan Lu, Yunnan Wang, Shuai Yang, Shi Liu, Fangjing Wang, Qian Zhu, He Sun, Yong Wang, Shuailei Ma, Yiyu Ren, Kejia Zhang, Hui Yu, Jingmei Zhao, Shuai Zhou, Zhenqi Qiu, Houlong Xiong, Ziyu Wang, Zechen Wang, Ran Cheng, Yong-Lu Li, Yongtao Huang, Xing Zhu, Yujun Shen, Kecheng Zheng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को घर के काम करना सिखाना चाहते हैं, जैसे सैंडविच बनाना या बिखरी हुई डेस्क को व्यवस्थित करना। अतीत में, रोबोट को सिखाना एक बच्चे को एक एकल ट्रिक सिखाने जैसा था: आपको उसे बिल्कुल सटीक रूप से दिखाना पड़ता था कि एक विशिष्ट कप को कैसे उठाना है, और यदि आपने उस कप को दो इंच बाईं ओर खिसका दिया, तो रोबोट भ्रमित हो जाता था।

यह शोध पत्र LingBot-VLA पेश करता है, जो एक नया "मस्तिष्क" है जिसे एक सच्चे 'जनरलिस्ट' (generalist) के रूप में डिज़ाइन किया गया है। इसे एक ऐसे रोबोट के रूप में न सोचें जो केवल एक ट्रिक जानता है, बल्कि एक ऐसे रोबोट के रूप में सोचें जिसके पास जीवन के अनुभवों का एक विशाल पुस्तकालय है जो उसे नई परिस्थितियों में नए कार्यों को हल करने की अनुमति देता है।

यहाँ इसका विवरण दिया गया है कि उन्होंने क्या किया, सरल उपमाओं का उपयोग करते हुए:

1. विशाल पुस्तकालय (डेटा)

इस रोबोट को स्मार्ट बनाने के लिए, शोधकर्ताओं ने इसे केवल कुछ वीडियो नहीं दिखाए। उन्होंने वास्तविक दुनिया के रोबोट फुटेज का एक विशाल पुस्तकालय बनाया जिसमें 20,000 घंटे का डेटा शामिल है।

  • उपमा: कल्पना कीजिए कि आप खाना बनाना सीख रहे हैं। अधिकांश लोग कुछ यूट्यूब वीडियो देखते हैं। LingBot-VLA ने खाना पकाने के 20,000 घंटों को देखा, इसमें शेफ को सब्जियां काटते, पैनकेक पलटते और यहाँ तक कि टोस्ट जलाते हुए भी देखा, और यह सब अलग-अलग कोणों से और विभिन्न रसोई के उपकरणों का उपयोग करके देखा।
  • विविधता: उन्होंने केवल एक प्रकार के रोबोट का उपयोग नहीं किया। उन्होंने 9 अलग-अलग रोबोट "शरीरों" (कुछ के दो हाथ हैं, कुछ इंसानों जैसे दिखते हैं, कुछ पहियों पर हैं) से डेटा एकत्र किया। यह खाना बनाना सीखने जैसा है, न कि केवल एक मानक चूल्हे के साथ, बल्कि एक कैंपफायर, माइक्रोवेव और एक हाई-टेक ओवन के साथ भी। यह रोबोट को सिखाता है कि लक्ष्य (खाना बनाना) महत्वपूर्ण है, न कि उपयोग किया जाने वाला विशिष्ट उपकरण।

2. "मस्तिष्क" आर्किटेक्चर (यह कैसे काम करता है)

यह मॉडल विशेषज्ञों की एक टीम के रूप में काम करने जैसा है:

  • समझने वाला विशेषज्ञ (The Understanding Expert): यह हिस्सा निर्देशों को पढ़ता है (जैसे "सैंडविच बनाओ") और कैमरा फीड को देखता है। यह रोबोट की आँखों और कानों की तरह है।
  • क्रिया विशेषज्ञ (The Action Expert): यह हिस्सा तय करता है कि रोबोट के हाथों को ठीक से कैसे हिलाना है।
  • गोंद (The Glue): वे एक विशेष प्रणाली (जिसे "Mixture-of-Transformers" कहा जाता है) का उपयोग करते हैं जो इन दोनों विशेषज्ञों को लगातार एक-दूसरे से बात करने की अनुमति देती है। यह एक ऑर्केस्ट्रा के कंडक्टर की तरह है जो यह सुनिश्चित करता है कि आँखें और हाथ पूरी तरह से तालमेल में हों।
  • गहराई का बोध (Depth Perception): रोबोट को दूरी का अंदाजा लगाने में मदद करने के लिए (जैसे यह जानना कि कप तक पहुँचने के लिए कितनी दूर तक हाथ बढ़ाना है), उन्होंने एक विशेष "डेप्थ" लेयर जोड़ी है। यह रोबोट को 3D चश्मा देने जैसा है ताकि वह केवल एक सपाट तस्वीर न देखे, बल्कि यह भी समझ सके कि चीजें कितनी दूर हैं।

3. "सुपर-फास्ट" ट्रेनिंग किचन (दक्षता)

इन मॉडल्स को प्रशिक्षित करना आमतौर पर बहुत समय लेता है और कंप्यूटर पावर की भारी लागत आती है। शोधकर्ताओं ने एक नया, अत्यधिक अनुकूलित "किचन" (कोडबेस) बनाया है ताकि इस डेटा को पका सके।

  • उपमा: यदि अन्य प्रशिक्षण विधियाँ एक छोटे किचन में खाना बनाने वाले एकल शेफ की तरह थीं, तो LingBot टीम ने एक विशाल औद्योगिक किचन बनाया है जिसमें 8 विशाल ओवन पूरी तरह से तालमेल में काम कर रहे हैं।
  • परिणाम: वे मौजूदा तरीकों की तुलना में डेटा को 1.5 से 2.8 गुना तेज़ी से प्रोसेस कर सकते हैं। इसका मतलब है कि वे कम समय और कम पैसे में अधिक सीख सकते हैं।

4. बड़ा परीक्षण (परिणाम)

यह साबित करने के लिए कि यह काम करता है, उन्होंने केवल कंप्यूटर सिमुलेशन (जो नकली हो सकता है) में परीक्षण नहीं किया। उन्होंने रोबोट को वास्तविक दुनिया में उतारा।

  • चुनौती: उन्होंने रोबोट का 100 अलग-अलग कार्यों (जैसे कटोरे ढेर करना, नींबू छीलना, या ब्लॉक छाँटना) पर 4 अलग-अलग रोबोट शरीरों के माध्यम से परीक्षण किया।
  • स्कोरकार्ड: उन्होंने LingBot-VLA की तुलना तीन अन्य शीर्ष-स्तरीय रोबोट ब्रेन्स से की।
    • परिणाम: LingBot-VLA जीत गया। यह कार्यों को पूरा करने में अधिक सफल था और यदि यह पूरा कार्य पूरा नहीं भी कर पाता, तो भी इसने अधिक प्रगति की।
    • "स्केलिंग" खोज: उन्होंने एक स्वर्णिम नियम पाया: अधिक डेटा = बेहतर प्रदर्शन। यहाँ तक कि 20,000 घंटों के बाद भी, रोबोट स्मार्ट होता गया। इसने कोई ऐसा "सीलिंग" (सीमा) नहीं छुआ जहाँ इसकी सीखने की क्षमता रुक जाए। यह कहने जैसा है कि, "आप जितनी अधिक किताबें पढ़ेंगे, उतने ही बुद्धिमान बनेंगे," और यह सिद्ध करना कि 20,000 किताबें पढ़ने के बाद भी, आप अभी भी नया सीख रहे हैं।

5. दुनिया को उपहार

शोधकर्ता इस रहस्य को अपने तक सीमित नहीं रख रहे हैं। वे दे रहे हैं:

  • कोड (किचन का नुस्खा)।
  • मॉडल (प्रशिक्षित मस्तिष्क)।
  • डेटा (वीडियो का पुस्तकालय)।

संक्षेप में: यह शोध पत्र एक ऐसे रोबोट मस्तिष्क को प्रस्तुत करता है जिसे वास्तविक दुनिया के अनुभवों के एक विशाल भंडार पर प्रशिक्षित किया गया है, जो कई अलग-अलग प्रकार के रोबोट शरीरों पर काम करता है, जो किसी से भी अधिक तेज़ी से सीखता है, और जिसे आप जितना अधिक डेटा देते हैं वह उतना ही स्मार्ट होता जाता है। यह उन रोबोटों की ओर एक कदम है जो वास्तव में हमारे दैनिक जीवन में हमारी मदद कर सकते हैं, न कि केवल कारखाने में एक दोहराव वाला काम करने के लिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →