← नवीनतम पेपर
💻 computer science

Primitive Subspaces Mediate Few-Shot Transfer in VLAs

यह शोध पत्र यह प्रदर्शित करता है कि प्रिमिटिव-सेगमेंटेड एपिसोड के साथ विजन-लैंग्वेज-एक्शन (VLA) पॉलिसियों को प्रशिक्षित करना उप-कौशलों की एक हस्तांतरणीय लाइब्रेरी बनाता है जो फ्लैट ट्राजेक्टरी ट्रेनिंग की तुलना में काफी अधिक सैंपल-एफिशिएंट फ्यू-शॉट टास्क एडाप्टेशन सक्षम करता है, एक कारण संबंध जिसे सबस्पेस एब्लेशन अध्ययनों के माध्यम से पुष्ट किया गया है।

मूल लेखक: Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

प्रकाशित 2026-06-01
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Anya Singh, Cabrel Happi, Jai Relan, Varun Nair, Vidyut Baradwaj

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को फर्नीचर बनाना सिखा रहे हैं। वर्तमान में, फर्नीचर बनाने का मानक तरीका हर एक फर्नीचर के लिए एक विशेष ट्यूटर (शिक्षक) रखने जैसा है। यदि आप चाहते हैं कि रोबोट एक कुर्सी बनाए, तो आप उसे कुर्सी बनाने के 50 वीडियो दिखाते हैं और वह उस विशिष्ट कार्य को याद कर लेता है। यदि फिर आप चाहते हैं कि वह एक मेज बनाए, तो आपको एक नया ट्यूटर नियुक्त करना होगा, उसे 50 नए वीडियो दिखाने होंगे, और उसे शून्य से फिर से प्रशिक्षित करना होगा। यह धीमा, महंगा है और इसके लिए रोबोट को कुर्सी बनाना "भूलने" की आवश्यकता होती है ताकि वह मेज बनाना सीख सके।

यह शोध पत्र एक अलग प्रश्न पूछता है: क्या हम पहले रोबोट को "बुनियादी चालों की एक लाइब्रेरी" (library of basic moves) सिखा सकते हैं, ताकि बाद में, हम बस उसे किसी नए कार्य के कुछ वीडियो दिखा सकें, और वह अपने आप उन बुनियादी चालों को संयोजित करना सीख जाए?

यहाँ उनके प्रयोग और निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया।

मुख्य विचार: "फ्लैट" बनाम "प्रिमिटिव" प्रशिक्षण

शोधकर्ताओं ने दो अलग-अलग रोबोट "मस्तिष्क" (आर्किटेक्चर जिन्हें OpenVLA और π0.5\pi_{0.5} कहा जाता है) का उपयोग करके रोबोट को प्रशिक्षित करने के दो तरीकों का परीक्षण किया:

  1. "फ्लैट" दृष्टिकोण (याद करने वाला - The Memorizer):

    • उपमा: कल्पना कीजिए कि आप एक छात्र को एक जटिल मशीन को असेंबल करते हुए एक पूरा मूवी दिखाकर सिखा रहे हैं। आप कहते हैं, "इस पूरी फिल्म को देखो और सीखो कि मशीन कैसे बनाई जाती है।"
    • परिणाम: छात्र पूरी फिल्म को याद कर लेता है। यदि आप बाद में उन्हें एक नई मशीन दिखाते हैं, तो वे संघर्ष करते हैं क्योंकि वे केवल पहली फिल्म के विशिष्ट अनुक्रम (sequence) को जानते हैं, उसके व्यक्तिगत हिस्सों को नहीं।
  2. "प्रिमिटिव" दृष्टिकोण (लेगो बिल्डर - The Lego Builder):

    • उपमा: कल्पना कीजिए कि आप उसी छात्र को सिखा रहे हैं, लेकिन इस बार आप फिल्म को छोटे, लेबल वाले क्लिप्स में तोड़ देते हैं। आप वीडियो को रोकते हैं और कहते हैं, "यह क्लिप है 'पेंच उठाना' (pick up the screw)।" फिर, "यह क्लिप है 'इसे पेंच में कसना' (screw it in)।" आप उन्हें बुनियादी चालों (primitives) की एक शब्दावली देते हैं जैसे "उठाना" (pick), "रखना" (place), "डालना" (insert), और "घुमाना" (rotate)।
    • परिणाम: छात्र बुनियादी चालों की एक लाइब्रेरी सीख जाता है। जब आप उन्हें बाद में एक नई मशीन दिखाते हैं, तो उन्हें सब कुछ फिर से सीखने की आवश्यकता नहीं होती है। उन्हें बस नई मशीन के कुछ उदाहरण देखने की आवश्यकता है और वे कह सकते हैं, "आह, मैं जानता हूँ कि कैसे 'उठाना' और 'डallना' है; मैं इसे बनाने के लिए उन्हें कैसे संयोजित कर सकता हूँ।"

प्रयोग: "फ्यू-शॉट" टेस्ट (The "Few-Shot" Test)

शोधकर्ताओं ने 6 विशिष्ट कार्यों को रोक कर रखा था जिन्हें रोबोटों ने प्रशिक्षण के दौरान कभी नहीं देखा था। परीक्षण के समय, उन्होंने रोबोटों को इन नए कार्यों के प्रदर्शन वीडियो की एक छोटी संख्या (0 से लेकर 10 तक) दी और उनसे बिना किसी आगे के पुनर्र्प्रशिक्षण के कार्य करने को कहा।

  • लक्ष्य: यह देखना कि रोबोट को सफल होने के लिए कितने वीडियो (प्रदर्शन) की आवश्यकता है।
  • निष्कर्ष:
    • "प्रिमिटिव" रोबोट अविश्वसनीय रूप से कुशल थे। केवल 3 वीडियो के साथ, उन्होंने लगभग उतना ही प्रदर्शन किया जितना कि यदि उन्हें 50 वीडियो के साथ पूरी तरह से पुनर्र्प्रशिक्षित किया गया होता।
    • "फ्लैट" रोबोट बहुत धीमे थे। उन्हें उस स्तर तक पहुँचने के लिए, जो प्रिमिटिव रोबोटों ने 3 वीडियो के साथ प्राप्त किया था, 10 वीडियो की आवश्यकता पड़ी।
    • अंतर: प्रिमिटिव दृष्टिकोण 3 गुना अधिक सैंपल-एफिशिएंट (sample-efficient) था। यह ऐसा है जैसे प्रिमिटिव रोबोट ने 3 दिनों में एक नई भाषा सीखी, जबकि फ्लैट रोबोट को वही सीखने के लिए 10 दिनों की आवश्यकता थी।

"क्यों": यह साबित करना कि यह कोई संयोग नहीं है

शोधकर्ता केवल यह नहीं जानना चाहते थे कि यह काम क्यों करता है; वे यह भी जानना चाहते थे कि क्यों। उन्हें संदेह था कि रोबोट इन "बुनियादी चालों" को अपने मस्तिष्क के एक विशिष्ट भाग (इसके छिपे हुए स्टेट्स का एक "सबस्पेस") में संग्रहीत कर रहा है।

इसे सिद्ध करने के लिए, उन्होंने एक "ब्रेन सर्जरी" सिमुलेशन किया:

  • परीक्षण: उन्होंने अस्थायी रूप से रोबोट के मस्तिष्क के उस विशिष्ट भाग को "बंद" कर दिया जो इन बुनियादी चालों को समझता था।
  • परिणाम: कुछ ही वीडियो से सीखने की रोबोट की क्षमता क्रैश हो गई (प्रदर्शन में 32% की गिरावट आई)।
  • कंट्रोल: जब उन्होंने मस्तिष्क के किसी यादृच्छिक (random), असंबंधित हिस्से को बंद किया, तो रोबोट का प्रदर्शन समान रहा।
  • निष्कर्ष: इसने सिद्ध किया कि "बुनियादी चाल" की लाइब्रेरी केवल एक भाग्यशाली दुष्प्रभाव नहीं थी; यह वह आवश्यक इंजन था जो रोबोट को नए कार्यों को तेज़ी से सीखने में सक्षम बनाता है।

सावधानी: जब यह काम नहीं करता

शोधकर्ताओं ने एक सीमा भी पाई। "प्रिमिटिव" दृष्टिकोण केवल तभी काम करता है जब नया कार्य ज्ञात बुनियादी चालों से बना हो।

  • उपमा: यदि आपने रोबोट को "उठाना," "रखना," और "पेंच कसना" जैसी चालें सिखाई हैं, तो वह एक नई कुर्सी बना सकता है। लेकिन यदि आप उसे एक ऐसा कार्य दिखाते हैं जिसमें एक पूरी तरह से नई चाल की आवश्यकता होती है (जैसे "एक विशेष धागे को घुमाना"), तो रोबोट भ्रमित हो जाता है। वह उस नई चाल को अपनी पुरानी, ज्ञात श्रेणियों में फिट करने की कोशिश करता है, जिससे उसका प्रदर्शन उस "फ्लैट" रोबोट से भी खराब हो जाता है जो केवल पूरी नई कार्य प्रक्रिया को शुरू से याद करने की कोशिश करता है।

सफलता को मापने के तरीके पर सुधार

पेपर ने यह भी बताया कि हम वर्तमान में यह कैसे मापते हैं कि एक रोबोट सफल हुआ या नहीं, उसमें एक तकनीकी त्रुटि है।

  • समस्या: जब रोबट कार्यों को "चंक्स" (कदमों के समूह) में आउटपुट करते हैं (एक-एक कदम के बजाय), तो यह जांचने का पुराना तरीका कि वे सही हैं या नहीं, बहुत सख्त था। यह एक छात्र के 16-प्रश्न वाले निबंध को ग्रेड करने जैसा था जहाँ यह चेक किया जा रहा था कि क्या हर एक शब्द सटीक है, बजाय इसके कि क्या वाक्य का अर्थ सही है। इसके कारण रोबोट उन परीक्षणों में विफल हो गए जिन्हें उन्होंने वास्तव में पास किया था।
  • समाधान: उन्होंने एक नया, अधिक निष्पक्ष ग्रेडिंग सिस्टम बनाया जो इन "चंक्स" को ध्यान में रखता है, यह सुनिश्चित करता है कि हम रोबोटों को उनकी दक्षता के लिए अनुचित रूप से दंडित न करें।

सारांश

यह शोध पत्र दिखाता है कि यदि आप रोबोट को प्रशिक्षण के दौरान बुनियादी चालों की शब्दावली (primitives) सिखाते हैं, तो वे बहुत कम उदाहरणों के साथ नए, जटिल कार्यों को सीखने में बहुत बेहतर हो जाते हैं। वे इन बुनियादी चालों को लेगो ब्रिक्स की तरह आपस में मिला सकते हैं। हालाँकि, यह केवल तभी काम करता है जब नया कार्य उन ईंटों (bricks) से बना हो जिन्हें रोबोट पहले से जानता है। यह विधि कारखानों में समय और पैसा बचा सकती है, क्योंकि रोबोटों को हर नए उत्पाद परिवर्तन के लिए शून्य से फिर से प्रशिक्षित करने की आवश्यकता नहीं होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →