← नवीनतम पेपर
💻 computer science

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA एक प्रिमिटिव-केंद्रित ढांचे (primitive-centric framework) को पेश करके विजन-लैंग्वेज-एक्शन मॉडल्स की डेटा अक्षमता और खराब सामान्यीकरण (generalization) को संबोधित करता है, जो प्रदर्शनों (demonstrations) को एक साझा मल्टीमॉडल प्रतिनिधित्व के माध्यम से पुन: प्रयोज्य मोशन प्रिमिटिव्स में विघटित करता है और अनुमान (inference) के दौरान उन्हें पुन: संयोजित करता है, जिससे जटिल कार्यों में अधिक कुशल शिक्षण और मजबूत ज़ीरो-शॉट सामान्यीकरण सक्षम होता है।

मूल लेखक: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

प्रकाशित 2026-07-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक ऐसी दुनिया की कल्पना करें जहाँ रोबोट केवल अनाड़ी, पूर्व-निर्धारित मशीनें नहीं हैं जो केवल वही कर सकती हैं जो उन्हें कल बताया गया था, बल्कि चतुर सहायक हैं जो बिना किसी मैनुअल के एक नए प्रकार के जार को खोलना या अजीब आकार के ब्लॉक को स्टैक करना सीख सकते हैं। यह "एम्बोडीड एआई" (Embodied AI) का सपना है—रोबोट को एक ऐसा मस्तिष्क देना जो यह समझ सके कि वह क्या देख रहा है, क्या सुन रहा है और कैसे हिलना-डुलना है। अभी, वैज्ञानिक इन दिमागों को "विज़न-लैंग्वेज-एक्शन" (VLA) मॉडल नामक चीज़ का उपयोग करके बनाने की कोशिश कर रहे हैं। इन मॉडलों को एक रोबोट के "मस्तिष्क" के रूप में सोचें जो एक तस्वीर देखता है, "कप को मेज पर रखें" जैसा एक वाक्य पढ़ता है, और फिर यह तय करता है कि उसे करने के लिए अपनी मांसपेशियों को कैसे हिलाना है। बड़ी समस्या यह है कि ये रोबले वर्तमान में नई चीजें सीखने में बहुत खराब हैं। वे उन छात्रों की तरह हैं जो एक विशिष्ट परीक्षा के लिए सटीक उत्तर कुंजी को रट लेते हैं लेकिन यदि शिक्षक प्रश्नों में संख्याएं बदल दे तो पूरी तरह से विफल हो जाते हैं। वे पूरे, जटिल कार्य के संपूर्ण पथ को एक ही बार में याद करने की कोशिश करते हैं, जिससे वे सीखने में धीमे हो जाते हैं और दुनिया बदलने पर आसानी से भ्रमित हो जाते हैं।

यहीं पर "प्रिमिटिववीएलए" (PrimitiveVLA) नामक एक नया शोध पत्र मदद के लिए आता है। शोधकर्ता तर्क देते हैं कि रोबोट सामान्यीकरण (generalizing) करने में इतने खराब क्यों हैं क्योंकि वे एक पूरे, विशाल कार्य को एक बड़े, अटूट टुकड़े के रूप में सीखने की कोशिश कर रहे हैं। इसके बजाय, वे एक स्मार्ट तरीका प्रस्तावित करते है: रोबोट को "प्रिमिटिव्स" (primitives) सीखना सिखाना। कल्पना कीजिए कि आप खाना बनाना सीख रहे हैं। "स्पैगेटी कार्बोनारा" के लिए एक सटीक रेसिपी को एक विशाल, भ्रमित करने वाली सूची के रूप में याद करने के बजाय, आप बुनियादी चालें सीखते हैं: काटना, उबालना, हिलाना और तलना। एक बार जब आप इन पुन: प्रयोज्य (reusable) चालों में महारत हासिल कर लेते हैं, तो आप लगभग कोई भी व्यंजन बनाने के लिए उन्हें मिला और जोड़ सकते हैं, यहाँ तक कि वे भी जिन्हें आपने पहले कभी नहीं देखा है। लेखक सुझाव देते हैं कि रोबोट को भी ऐसा ही करना चाहिए। उन्होंने एक प्रणाली बनाई जो जटिल रोबोट कार्यों को प्रशिक्षण के दौरान इन छोटे, पुन: प्रयोज्य "मोशन प्रिमिटिव्स" (जैसे पकड़ना, धकेलना, या उठाना) में तोड़ देती है। फिर, जब रोबोट के सामने एक नया, कठिन काम आता है, तो वह पूरी चीज़ को याद करने की कोशिश नहीं करता; वह बस समस्या को हल करने के लिए इन बुनियादी चालों के सही क्रम को जोड़ता है।

यह पेपर दिखाता है कि यह "अलग करना और जोड़ना" (disassemble and assemble) वाला दृष्टिकोण अविश्वसनीय रूप से अच्छा काम करता है। अपने परीक्षणों में, इस पद्धति से प्रशिक्षित रोबोटों ने बहुत तेज़ी से सीखा, उन्हें पूर्ण डेटासेट वाले रोबोटों के समान प्रदर्शन करने के लिए अभ्यास डेटा की केवल आधी मात्रा की आवश्यकता पड़ी। लेकिन असली जादू तब हुआ जब उन्होंने उन चीजों पर परीक्षण किया जिन्हें उन्होंने पहले कभी नहीं देखा था। उदाहरण के लिए, लंबे, जटिल कार्यों के एक सेट पर, मानक शीर्ष-स्तरीय रोबोट मॉडल केवल 30% समय ही सफल रहा। हालाँकि, प्रिमिटिववीएलए का उपयोग करने वाला रोबोट 80% सफलता दर तक पहुँच गया। इससे भी अधिक प्रभावशाली बात यह है कि जब पूरी तरह से नए कार्यों का सामना किया गया जिनका रोबोट ने पहले कभी सामना नहीं किया था, तो नई पद्धति ने पुराने तरीके की तुलना में सफलता दर में छह गुना सुधार किया। शोधकर्ताओं ने इसे कंप्यूटर सिमुलेशन और एक वास्तविक भौतिक रोबोट आर्म दोनों में परखा, यह साबित करते हुए कि रोबोट को पूरी तस्वीर को याद करने के बजाय पहले बुनियादी बातों में महारत हासिल करना सिखाना, उन्हें वास्तव में स्मार्ट और अनुकूलनीय सहायक बनाने की कुंजी है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →