InSight: Self-Guided Skill Acquisition via Steerable VLAs
InSight एक ऐसा फ्रेमवर्क है जो विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स को प्रदर्शनों (demonstrations) को स्टीयरेबल प्रिमिटिव एक्शन्स में विभाजित करके और नवीन, लॉन्ग-होराइजन कार्यों के लिए नए प्रिमिटिव्स को उत्पन्न करने, लेबल करने और एकीकृत करने हेतु VLM-गाइडेड डेटा फ्लाईव्हील का उपयोग करके, स्वायत्त रूप से नई मैनिपुलेशन स्किल्स प्राप्त करने में सक्षम बनाता है, जिसमें आगे किसी मानवीय हस्तक्षेप की आवश्यकता नहीं होती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को खाना बनाना सिखा रहे हैं। पारंपरिक रूप से, यदि आप चाहते हैं कि रोबोट कोई नया व्यंजन सीखे, जैसे कि "सैंडविच बनाना," तो आपको उसके पास खड़ा होना होगा, उसका हाथ पकड़ना होगा और उसे हर एक कदम के माध्यम से मार्गदर्शन देना होगा: ब्रेड उठाना, मक्खन लगाना, चीज़ डालना, इत्यादि। यह धीमा और महंगा है, और यदि आप बाद में उसे "सूप बनाना" सिखाना चाहते हैं, तो आपको वह पूरी प्रक्रिया फिर से दोहरानी होगी।
INSIGHT पेपर रोबोट को सिखाने का एक स्मार्ट तरीका प्रस्तावित करता है, जो इस तरह काम करता है जैसे इंसान नए कौशल सीखते हैं। पूरे व्यंजनों (recipes) को याद करने के बजाय, रोबोट व्यक्तिगत चालों (जैसे "उठाना," "लिफ्ट करना," "घुमाना," या "डालना") को सीखता है और फिर खुद से उन्हें संयोजित करना सीख जाता है।
यह सिस्टम कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:
1. "लेगो ब्रिक" (Lego Brick) दृष्टिकोण
रोबोट के कौशल को एक विशाल, अटूट ब्लॉक के रूप में नहीं, बल्कि लेगो ब्रिक्स के एक बॉक्स के रूप में सोचें।
- समस्या: आज के अधिकांश रोबोट पूरे कार्यों पर प्रशिक्षित होते हैं। यदि आप उन्हें "कप उठाना" सिखाते हैं, तो वे उस विशिष्ट अनुक्रम को सीख लेते हैं। यदि आप उनसे "पानी डालने" के लिए कहते हैं, तो वे विफल हो सकते हैं क्योंकि उन्होंने पहले कभी "डालने" वाला ब्रिक नहीं देखा है।
- INSIGHT का समाधान: यह सिस्टम मानव प्रदर्शन (जैसे किसी को कप उठाते हुए दिखाने का वीडियो) लेता है और उन्हें स्वचालित रूप से छोटे, लेबल वाले "ब्रिक्स" में तोड़ देता है जिन्हें प्रिमिटिव्स (primitives) कहा जाता है।
- उदाहरण: "कप उठाना" देखने के बजाय, रोबोट देखता है: "हाथ को कप तक ले जाना" + "उंगलियां बंद करना" + "ऊपर उठाना।"
- रोबोट इन व्यक्तिगत चालों को इतनी अच्छी तरह सीखता है कि उसे आदेश पर केवल उनमें से एक करने के लिए "स्टीयर" (निर्देशित) किया जा सकता है।
2. "स्मार्ट असिस्टेंट" (The VLM)
रोबोट के भीतर एक "स्मार्ट असिस्टेंट" (एक विजन-लैंग्वेज मॉडल, या VLM) होता है जो एक प्रोजेक्ट मैनेजर की तरह कार्य करता है।
- परिदृश्य: कल्पना करें कि रोबोट जानता है कि "बोतल उठाना" और "रखना" क्या है, लेकिन आप उससे "बोतल को कटोरे में डालने" के लिए कहते हैं।
- कमी: स्मार्ट असिस्टेंट योजना को देखता है और कहता, "हे, हमारे पास 'उठाने' का ब्रिक और 'रखने' का ब्रिक है, लेकिन हमारे पास 'झुकाना और डालना' वाला ब्रिक गायब है!"
- समाधान: इंसान को यह दिखाने के लिए कहने के बजाय कि कैसे डाला जाए, स्मार्ट असिस्टेंट उस चाल के भौतिक विज्ञान (physics) को समझ लेता है (जैसे, "बोतल को 45 डिग्री आगे की ओर झुकाएं") और रोबोट को इसे आज़माने के लिए कहता है।
3. "अभ्यास चक्र" (The Practice Loop)
यहीं पर जादू होता है। रोबोट अपने आप उस लापता चाल को करने का प्रयास करता है।
- परीक्षण और त्रुटि (Trial and Error): रोबोट "झुकाना" वाली चाल की कोशिश करता है। यदि वह सब कुछ बिखा देता है, तो वह थोड़े अलग कोण के साथ फिर से प्रयास करता है।
- "ओरेकल" (Oracle) चेक: रोबलेट के प्रयास के बाद, स्मार्ट असिस्टेंट परिणाम को देखता है (जैसे एक शिक्षक टेस्ट ग्रेड करता है)। "क्या पानी कटोरे में गया? हाँ? बहुत बढ़िया! नहीं? फिर से कोशिश करो।"
- सीखना: एक बार जब रोबोट सफलतापूर्वक पानी डाल देता है, तो सिस्टम उस विशिष्ट "डालने" वाली चाल को अपने लाइब्रेरी में एक नए लेगो ब्रिक के रूप में सहेज लेता है। फिर यह खुद को फिर से प्रशिक्षित करता है ताकि इस नए ब्रिक को हमेशा के लिए याद रख सके।
4. शून्य से नए कौशल बनाना
एक बार जब रोबोट "डालने" का ब्रिक सीख लेता है, तो उसे फिर से यह सिखाने के लिए किसी इंसान की ज़रूरत नहीं होती।
- परिणाम: यदि आप बाद में रोबोट को "ढक्कन घुमाकर खोलने और फिर डालने" के लिए कहते हैं, तो वह अब अपने पहले से सीखे हुए "घुमाने" के ब्रिक को नए "डालने" वाले ब्रिक के साथ जोड़ सकता है।
- उपमा: यह एक संगीतकार की तरह है जिसने C-मेजर और F-मेजर कॉर्ड बजाना सीख लिया है। यदि वे एक नया गाना बजाना चाहते हैं, तो उन्हें पूरे गाने को सीखने के लिए शिक्षक की आवश्यकता नहीं होती; वे बस उन कॉर्ड्स को मिला देते हैं जो वे पहले से जानते हैं।
उन्होंने वास्तव में क्या सिद्ध किया?
शोधकर्ताओं ने कंप्यूटर सिमुलेशन और वास्तविक रोबोट (एक रोबोटिक आर्म का उपयोग करके) दोनों में इसका परीक्षण किया। उन्होंने दिखाया कि:
- किसी नए मानवीय सहयोग की आवश्यकता नहीं: उन्होंने रोबोट को ब्लॉक पलटने, दराज बंद करने, बोतल का ढक्कन घुमाने और बीन्स डालने जैसे जटिल कार्य करने के लिए सिखाया, बिना कभी यह दिखाए कि कोई व्यक्ति ये विशिष्ट कार्य कैसे कर रहा है।
- यह तेज़ काम करता है: रोबोट ने पारंपरिक तरीकों (जैसे सुदृढीकरण सीखना या Reinforcement Learning, जो अंधे होकर हजारों बार प्रयास करने जैसा है) की तुलना में ये नए कौशल बहुत तेज़ी से सीखे।
- यह भूलता नहीं है: जब रोबोट ने नया "डालने" का कौशल सीखा, तो वह बोतल को "उठाना" नहीं भूला। उसने अपने पुराने सभी कौशल बनाए रखते हुए नए कौशल जोड़े।
- वास्तविक दुनिया में सफलता: एक वास्तविक रोबोट पर, इसने उच्च सफलता दर (डालने के लिए 96% तक) हासिल की और यह एक 14-चरणीय लंबे कार्य (ढक्कन घुमाना, फिर डालना) को भी कर सका जिसे इसने पहले कभी नहीं देखा था।
मुख्य निष्कर्ष (The Bottom Line)
INSIGHT एक ऐसा फ्रेमवर्क है जो रोबोट को जटिल कार्यों को छोटे, पुन: प्रयोज्य (reusable) मूव्स में तोड़ने की अनुमति देता है। जब वे किसी नए काम का सामना करते हैं, तो वे एक "स्मार्ट असिस्टेंट" का उपयोग करते हैं यह समझने के लिए कि उनके पास कौन से मूव्स कम हैं, वे उन मूव्स का स्वयं अभ्यास करते हैं, और उन्हें बाद के लिए सहेज लेते हैं। यह रोबोट को हर बार इंसान का हाथ पकड़े बिना नए कौशल निरंतर सीखने की अनुमति देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।