DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation
DREAM एक ऐसा फ्रेमवर्क है जो रियल-टू-सिम पुनर्निर्माण (real-to-sim reconstruction), LLM-संचालित कार्य नियोजन (LLM-driven task planning) और प्रक्षेपवक्र रेंडरिंग (trajectory rendering) के माध्यम से स्वचालित रूप से फाइन-ट्यूनिंग डेटा उत्पन्न करके, दृष्टि-भाषा-क्रिया मॉडलों (vision-language-action models) को नए वर्कस्पेस में स्केलेबल अनुकूलन सक्षम बनाता है, जिससे महंगी मानव टेलीऑपरेशन प्रदर्शनों की आवश्यकता समाप्त हो जाती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से दोहराव के उस्ताद रहे हैं, जो एक कारखाने में एक ही सटीक गति को हजारों बार करते हैं, लेकिन जब उन्हें एक नए कमरे या वस्तुओं की थोड़ी अलग व्यवस्था के अनुकूल होने के लिए कहा जाता है, तो वे संघर्ष करते हैं। एक रोबोट को नया कार्य सिखाने के लिए, इंजीनियर पारंपरिक रूप से टेलीऑपरेशन नामक एक विधि पर निर्भर करते हैं, जहाँ एक इंसान भौतिक रूप से मशीन को चरणों के माध्यम से निर्देशित करता है, और प्रशिक्षण डेटासेट बनाने के लिए हर गतिविधि को रिकॉर्ड करता है। हालांकि यह प्रभावी है, लेकिन यह प्रक्रिया धीमी, महंगी है और इसके लिए हर नए वातावरण के लिए एक व्यक्ति की उपस्थिति आवश्यक होती है। रोबोटिक्स का क्षेत्र अब एक अलग दृष्टिकोण की ओर बढ़ रहा है: ऐसे आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करना जो भाषा और दृष्टि को एक साथ समझ सकते हैं। ये मॉडल, विशाल मात्रा में डेटा पर प्रशिक्षित, "नीले ब्लॉक को कटोरे में रखें" जैसे एक सरल वाक्य के आधार पर एक रोबोटिक हाथ को कैसे चलाना है, इसका अनुमान लगाने में पहले से ही सक्षम हैं। हालांकि, भले ही ये उन्नत सिस्टम भी, जब उन्हें किसी ऐसे वास्तविक परिवेश में रखा जाता है जिसे उन्होंने पहले कभी नहीं देखा है, तो अक्सर विफल हो जाते हैं, क्योंकि कमरे का विशिष्ट लेआउट, प्रकाश व्यवस्था और वस्तुओं की सटीक स्थिति एक अनूठी चुनौती पैदा करती है जिसे सामान्य प्रशिक्षण हल नहीं कर सकता।
टोक्यो विश्वविद्यालय के शोधकर्ताओं ने इस समस्या को हल करने के लिए DREAM नामक एक प्रणाली विकसित की है, जिसमें रोबोट को निर्देशित करने के लिए किसी इंसान की आवश्यकता नहीं होती। कार्य का प्रदर्शन करने के लिए किसी व्यक्ति से दिखाने के लिए कहने के बजाय, यह प्रणाली खाली कार्यक्षेत्र का एक छोटा वीडियो और एक सरल टेक्स्ट निर्देश लेती है। इसके बाद यह उस कमरे की एक सटीक डिजिटल प्रति बनाता है, जिसमें वे सटीक कैमरा कोण शामिल होते हैं जो रोबोट देखने के लिए उपयोग करेगा। एक परिष्कृत प्लानिंग इंजन का उपयोग करके, कंप्यूटर लक्ष्य प्राप्त करने के लिए गतिविधियों का एक तार्किक क्रम निर्धारित करता है, जैसे कि किसी वस्तु को उठाना और उसे कहीं और रखना। फिर यह इस कार्य के हजारों संस्करण उत्पन्न करता है, वस्तुओं के लिए विभिन्न शुरुआती स्थितियों का अनुकरण करता है और इस आभासी दुनिया में रोबोट की सफल गतिविधियों को रिकॉर्ड करता है। इन सिम्युलेटेड गतिविधियों को फिर वास्तविक छवियों और एक्शन डेटा में बदल दिया जाता है, जिनका उपयोग वास्तविक दुनिया को छूने से पहले रोबोट के मस्तिष्क को फाइन-ट्यून करने के लिए किया जाता है।
इस पद्धति का मूल भौतिक स्थान की एक "डिजिटल ट्विन" (digital twin) बनाना है। शोधकर्ता एक मानक हैंडहेल्ड कैमरे के साथ टेबल या कार्यक्षेत्र का एक संक्षिप्त वीडियो रिकॉर्ड करके शुरुआत करते हैं। प्रणाली इस फुटेज का विश्लेषण करती है ताकि दृश्य को तीन आयामों में पुनर्गठित किया जा सके, जिससे प्रत्येक सतह और वस्तु की बनावट और स्थिति को कैप्चर किया जा सके। महत्वपूर्ण रूप से, यह इस डिजिटल पुनर्निर्माण को रोबोट के अपने समन्वय तंत्र (coordinate system) के साथ संरेखित करता है, यह सुनिश्चित करते हुए कि वर्चुअल कैमरा ठीक वैसा ही देखे जैसा वास्तविक रोबोट के कैमरे देखेंगे। यह प्रणाली को ऐसा प्रशिक्षण डेटा उत्पन्न करने की अनुमति देता है जो वास्तविक वातावरण जैसा दिखता और महसूस होता है, जिससे कंप्यूटर सिमुलेशन और भौतिक दुनिया के बीच के अंतर को पाटा जा सके। एक बार वातावरण बन जाने के बाद, प्रणाली मानव निर्देश को तार्किक लक्ष्यों के एक सेट में अनुवादित करने के लिए एक लार्ज लैंग्वेज मॉडल का उपयोग करती है। उदाहरण के लिए, यदि निर्देश फल पैक करने का है, तो प्रणाली समझती है कि उसे पहले केले के लिए पहुंचना होगा, फिर आड़ू के लिए, और अंत में उन्हें प्लेट पर रखना होगा।
लक्ष्य निर्धारित होने के बाद, प्रणाली सफलता प्राप्त करने के लिए आवश्यक भौतिक चरणों का पता लगाने के लिए एक टास्क-एंड-मोशन प्लानर का उपयोग करती है। यह प्लानर एक अत्यधिक तार्किक इंजीनियर की तरह कार्य करता है, कार्य को क्रियाओं के एक क्रम में तोड़ता है और सटीक जोड़ आंदोलनों (joint movements) की गणना करता है जिनकी रोबोट को टकराव से बचने और अपने लक्ष्यों तक पहुँचने के लिए आवश्यकता होती है। यह सफल पथों का एक छोटा सेट उत्पन्न करता है, जिन्हें 'सोर्स डेमोंस्ट्रेशन' (source demonstrations) के रूप में जाना जाता है। एक मजबूत रोबोट को प्रशिक्षित करने के लिए पर्याप्त डेटा बनाने के लिए, प्रणाली इन कुछ उदाहरणों को एक विशाल डेटासेट में विस्तारित करती है। यह सफल गतिविधियों को लेती है और उन्हें सैकड़ों नए, रैंडमाइज्ड परिदृश्यों पर लागू करती है जहाँ वस्तुएं अलग-अलग स्थानों पर होती हैं। यह प्रत्येक नए प्रयास की जांच करता है कि क्या वह शारीरिक रूप से संभव और सुरक्षित है, और विफल होने वाले प्रयासों को हटा देता है। अंत में, यह सफल प्रयासों को फोटोरियलिस्टिक वीडियो फ्रेम में रेंडर करता है, जिससे इमेज-एंड-एक्शन पेयर्स का एक पूर्ण डेटासेट तैयार होता है जिससे रोबोट सीख सकता है।
शोधकर्ताओं ने इस दृष्टिकोण का परीक्षण एक वास्तविक रोबोटिक आर्म पर दो अलग-अलग कार्यों के लिए किया: एक लाल कटोरे में नीला ब्लॉक रखना, और एक केले और एक आड़ू को एक विशिष्ट क्रम में प्लेट पर पैक करना। उन्होंने डेटा जो मानव ऑपरेटरों द्वारा मशीन को निर्देशित करके एकत्र किया गया था, बनाम DREAM द्वारा उत्पन्न डेटा पर प्रशिक्षित रोबोटों की तुलना की। परिणामों ने दिखाया कि डिजिटल ट्विन वास्तविक दुनिया के प्रदर्शन का एक विश्वसनीय भविष्यवक्ता था; यदि एक रोबोट सिमुलेशन में अच्छा प्रदर्शन करता था, तो वह वास्तविक दुनिया में भी अच्छा प्रदर्शन करता था। अधिक महत्वपूर्ण बात यह है कि यह प्रणाली अत्यधिक स्केलेबल साबित हुई। जबकि एक मानव ऑपरेटर उचित समय में लगभग एक सौ प्रदर्शन (demonstrations) प्रदान कर सकता है, DREAM प्रणाली एक हजार उच्च-गुणवत्ता वाले प्रशिक्षण उदाहरण उत्पन्न करती है। इस बड़े मात्रा में स्वचालित रूप से उत्पन्न डेटा पर प्रशिक्षित होने पर, रोबोटों ने मानव प्रदर्शनों के छोटे सेट की तुलना में उच्च सफलता दर प्राप्त की।
यह अध्ययन बताता है कि रोबोट कैसे सीखते हैं इसमें एक महत्वपूर्ण बदलाव आया है। जबकि मानव टेलीऑपरेशन डेटा एकत्र करने का एक वैध तरीका बना हुआ है, यह ऑपरेटर के समय और ध्यान द्वारा सीमित है। इसके विपरीत, DREAM प्रणाली केवल एक वीडियो कैप्चर और एक टेक्स्ट निर्देश के साथ प्रशिक्षण उदाहरणों का एक विशाल पुस्तकालय बनाने के लिए आवश्यक है। प्रारंभिक सेटअप में कुछ मिनट लगते हैं, लेकिन एक बार जब प्रणाली चल पड़ती है, तो यह केवल कुछ रिकॉर्ड करने में लगने वाले मानव समय में हजारों प्रशिक्षण परिदृश्य उत्पन्न कर सकती है। शोधकर्ताओं ने पाया कि सरल कार्यों के लिए, स्वचालित रूप से उत्पन्न डेटा ने रोबोट को मानव-संग्रहित डेटा की तुलना में अधिक बार सफल होने में मदद की, क्योंकि अभ्यास की मात्रा बहुत अधिक थी। अधिक जटिल, बहु-चरणीय कार्यों के लिए, प्रणाली अभी भी मानव डेटा संग्रह से बेहतर प्रदर्शन करती है, हालांकि कार्य की जटिलता के कारण प्रारंभिक गतिविधियों की योजना बनाने के लिए अधिक कम्प्यूटेशनल समय की आवश्यकता थी।
यह कार्य एक ऐसे भविष्य का सुझाव देता है जहाँ रोबैट को न्यूनतम मानवीय हस्तक्षेप के साथ नए वातावरण में तैनात किया जा सकता है। किसी विशेषज्ञ के एक विशिष्ट रसोई या कार्यशाला में नेविगेट करने के लिए रोबोट को घंटों सिखाने का इंतजार करने के बजाय, एक उपयोगकर्ता बस रोबोट को कमरा दिखा सकता है और उसे क्या करना है यह बता सकता है। इसके बाद प्रणाली प्रशिक्षण डेटा बनाने का भारी काम संभालेगी, यह सुनिश्चित करते हुए कि रोबोट उस स्थान की विशिष्ट चुनौतियों के लिए तैयार है। शोधकर्ता स्वीकार करते हैं कि उनकी वर्तमान प्रणाली स्थिर मेजों पर कठोर वस्तुओं के साथ सबसे अच्छा काम करती है, और भविष्य के कार्य में नरम या चलती वस्तुओं से जुड़े अधिक जटिल परिदृश्यों को संबोधित करने की आवश्यकता होगी। हालांकि, एक साधारण वीडियो और एक वाक्य को पूरी तरह से प्रशिक्षित रोबोट पॉलिसी में बदलने की क्षमता, रोबोटिक सहायकों को रोजमर्रा के उपयोग के लिए वास्तव में अनुकूल और सुलभ बनाने की दिशा में एक बड़ा कदम है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।