← नवीनतम पेपर
💻 computer science

AtomicVLA: Unlocking the Potential of Atomic Skill Learning in Robots

यह शोध पत्र AtomicVLA का प्रस्ताव करता है, जो एक एकीकृत नियोजन-और-निष्पादन ढांचा (planning-and-execution framework) है जो परमाणु कौशल अमूर्तता (atomic skill abstractions) को गतिशील रूप से संयोजित करने के लिए 'स्किल-गाइडेड मिक्स्चर-ऑफ-एक्सपर्ट्स' आर्किटेक्चर का उपयोग करता है, जिससे मौजूदा मोनोलिथिक VLA मॉडलों की तुलना में लंबी अवधि के रोबोटिक हेरफेर और निरंतर सीखने के कार्यों में स्केलेबिलिटी और प्रदर्शन में महत्वपूर्ण सुधार होता है।

मूल लेखक: Likui Zhang, Tao Tang, Zhihao Zhan, Xiuwei Chen, Zisheng Chen, Jianhua Han, Jiangtong Zhu, Pei Xu, Hang Xu, Hefeng Wu, Liang Lin, Xiaodan Liang

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Likui Zhang, Tao Tang, Zhihao Zhan, Xiuwei Chen, Zisheng Chen, Jianhua Han, Jiangtong Zhu, Pei Xu, Hang Xu, Hefeng Wu, Liang Lin, Xiaodan Liang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक जटिल भोजन बनाना सिखाने की कोशिश कर रहे हैं, जैसे कि मोका पॉट (moka pot) के साथ कॉफी बनाना।

पुराना तरीका (एक "मोनोलिथिक" रोबोट):
पहले, रोबोटों को एक ऐसे छात्र की तरह प्रशिक्षित किया जाता था जिसने "सब कुछ कैसे पकाएं" नामक एक विशाल 500 पन्नों की किताब रट ली हो। यदि आप रोबोट को "चूल्हा चालू करें" कहते, तो उसे उस विशाल किताब में खोजना पड़ता, सही पन्ना ढूंढना पड़ता और फिर यह समझना पड़ता कि अपने हाथ को कैसे हिलाना है।

  • समस्या: यदि आप उसे एक नया कौशल सिखाना चाहते, जैसे "माइक्रोवेव खोलना", तो आपको उसे पूरी 500 पन्नों की किताब फिर से सिखानी पड़ती। यह धीमा, महंगा है, और अक्सर ऐसा होता है कि माइक्रोवेव सीखना सिखाते समय रोबोट चूल्हा चालू करना भूल जाता है। यह एक किताब में नया अध्याय जोड़ने के लिए पूरी किताब को शुरू से फिर से लिखने जैसा है।

नया तरीका (AtomicVLA):
यह पेपर AtomicVLA पेश करता है, जो खेल को पूरी तरह बदल देता है। एक विशाल मस्तिष्क के बजाय, कल्पना कीजिए कि रोबोट के पास एक मास्टर शेफ (मुख्य रसोइया) और विशेषज्ञ सहायक शेफ (Sous-Chefs) की एक टीम है।

1. मास्टर शेफ (द प्लानर/योजनाकार)

जब आप रोबोट को "कॉफी बनाओ" जैसा कमांड देते हैं, तो मास्टर शेफ (VLM वाला हिस्सा) तुरंत हाथ हिलाने की कोशिश नहीं करता। इसके बजाय, वह बड़े कार्य को एक सरल टू-डू लिस्ट में तोड़ देता है:

  1. चूल्हा चालू करें।
  2. मोका पॉट उठाएं।
  3. पॉट को चूल्हे पर रखें।

यह "सोचने" का चरण है। रोबोट हिलने से पहले चरणों की योजना बनाता है।

2. सहायक शेफ की टीम (द एटोमिक स्किल्स/परमाणु कौशल)

यहाँ जादू होता है। रोबोट के पास एक विशाल मस्तिष्क नहीं है। इसके बजाय, उसके पास विशेषज्ञों का एक पुस्तकालय है:

  • विशेषज्ञ A केवल नॉब (knobs) को घुमाना जानता है।
  • विशेषज्ञ B केवल वस्तुओं को उठाना जानता है।
  • विशेषज्ञ C केवल वस्तुओं को रखना जानता है।
  • विशेषज्ञ D केवल दरवाजे खोलना जानता है।

जब मास्टर शेफ कहता है, "चरण 1: चूल्हा चालू करें," तो रोबलेट तुरंत विशेषज्ञ A को बुलाता है। विशेषज्ञ A केवल वही काम पूरी सटीकता से करता है। जब अगला चरण आता है ("पॉट उठाएं"), तो रोबोट विशेषज्ञ B पर स्विच कर देता है।

3. "हायरिंग मैनेजर" (द राउटर/मार्गदर्शक)

रोबोट को कैसे पता चलता है कि किस विशेषज्ञ को बुलाना है? वह एक स्मार्ट हायरिंग मैनेजर (स्किल राउटर) का उपयोग करता है।

  • यदि कार्य "घुमाना" (Turn) है, तो मैनेजर तुरंत "टर्न एक्सपर्ट" को बुलाता है।
  • यदि कार्य "खोलना" (Open) है, तो वह "ओपन एक्सपर्ट" को बुलाता है।

इसे Mixture-of-Experts (MoE) सिस्टम कहा जाता है, लेकिन एक ट्विस्ट के साथ: यहाँ विशेषज्ञ केवल रैंडम डेटा के आधार पर नहीं, बल्कि कौशल (skill) के आधार पर व्यवस्थित हैं।

यह एक बड़ी बात क्यों है?

1. "कैटास्ट्रोफिक फॉरगेटिंग" (विस्मृति) का कोई डर नहीं
पुराने तरीके में, एक नया कौशल सीखना (जैसे "दराज खोलना") रोबोट की "कप उठाना" सीखने की याददाश्त को बिगाड़ सकता था।
AtomicVLA के साथ, यदि आप रोबोट को नया कौशल सिखाना चाहते हैं, तो आप बस एक नया सहायक शेफ (एक नया विशेषज्ञ) नियुक्त करते हैं और केवल उसी को सिखाते हैं। अन्य विशेषज्ञ (घुमाना, उठाना, रखना) बिना भ्रमित हुए अपना काम पूरी सटीकता से करते रहते हैं। यह एक कंपनी में नए कर्मचारी को रखने जैसा है, बिना पूरे स्टाफ को निकालने या फिर से प्रशिक्षित किए।

2. चलते-फिरते गलतियों को सुधारना
कल्पना कीजिए कि रोबोट एक कप उठाने की कोशिश करता है लेकिन उसे गिरा देता है।

  • पुराना रोबोट: भ्रमित हो जाता है, रुक जाता है, या पूरे कार्य को शुरू से करने की कोशिश करता है।
  • AtomicVLA: मास्टर शेफ देखता है कि योजना विफल रही। वह कहता है, "ठीक है, 'पिक' (उठाने वाला) विशेषज्ञ विफल रहा। चलो फिर से कोशिश करते हैं।" वह योजना को फिर से बनाता है और कार्य को फिर से 'पिक' विशेषज्ञ को सौंप देता है, जिससे पूरे मिशन को खोए बिना तुरंत त्रुटि सुधारी जा सकती है।

3. लंबे, जटिल कार्यों को संभालना
क्योंकि रोबोट बड़े समस्याओं को छोटे, प्रबंधनीय "परमाणु" (atomic) टुकड़ों में तोड़ देता है, इसलिए वह लंबी घटनाओं की श्रृंखला (जैसे "रसोई साफ करें, फिर रात का खाना बनाएं, फिर बर्तन धोएं") को बिना भटके संभाल सकता है। वह एक लंबे दिन को एक विशाल मैराथन के बजाय छोटी, केंद्रित स्प्रिंट की एक श्रृंखला के रूप में देखता है।

वास्तविक दुनिया के परिणाम

शोधकर्ताओं ने वास्तविक रोबोटों (Franka arms) और सिमुलेशन में इसका परीक्षण किया।

  • सिमुलेशन में: नया रोबोट पिछले अत्याधुनिक मॉडलों की तुलना में लंबे, जटिल कार्यों में काफी बेहतर था।
  • वास्तविक जीवन में: जब इसे लंबे कार्य करने के लिए कहा गया (जैसे ब्लॉक को दराज में रखना और फिर उसे बंद करना), तो नया रोबोट पुराने मॉडलों की तुलना में 18-21% अधिक बार सफल हुआ।
  • नए कौशल सीखना: जब उन्होंने रोबोट को एक नया कौशल (दराज खोलना) सिखाया, बिना पूरे सिस्टम को फिर से प्रशिक्षित किए, तो रोबोट ने इसे जल्दी सीख लिया और उसने पुराने कार्यों को नहीं भुलाया।

सारांश उपमा

पुराने रोबोट को एक सामान्य चिकित्सक (Generalist Doctor) के रूप में सोचें जो सर्जरी करने, टूटा हुआ पैर ठीक करने और दवा देने का प्रयास एक साथ करता है, और अक्सर अभिभूत (overwhelmed) हो जाता है।

AtomicVLA एक आधुनिक अस्पताल है।

  • मुख्य डॉक्टर (प्लानर) मरीज को देखता है और एक शेड्यूल बनाता है।
  • विशेषज्ञों (Experts) को एक-एक करके बुलाया जाता है: हृदय के लिए कार्डियोलॉजिस्ट, पैर के लिए ऑर्थोपेडिस्ट।
  • यदि किसी नए विशेषज्ञ की आवश्यकता है (जैसे न्यूरोलॉजिस्ट), तो अस्पताल बस उन्हें काम पर रख लेता है। अन्य डॉक्टर अपना काम पूरी सटीकता से करते रहते हैं।

यह दृष्टिकोण रोबोटों को स्मार्ट, अधिक अनुकूलनीय और उनके जीवन भर नई चीजें सीखने में सक्षम बनाता है बिना यह भूले कि वे पहले से क्या जानते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →