Zetta : An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence
यह शोध पत्र ज़ेटा (Zetta) को प्रस्तुत करता है, जो एक क्लोज्ड-लूप एम्बोडीड हार्नेस (embodied harness) है जो तीन टाइमस्केल-सेपरेटेड लूप्स के माध्यम से ऑनलाइन कोड-आधारित क्रिटिक्स और रिकवरी स्किल्स को गतिशील रूप से अपडेट करके स्व-विकसित भौतिक बुद्धिमत्ता (self-evolving physical intelligence) को सक्षम बनाता है, जो बेंचमार्क कार्यों पर अत्याधुनिक प्रदर्शन और महत्वपूर्ण इन्फरेंस स्पीडअप प्राप्त करने के साथ-साथ ज़ीरो-शॉट ट्रांसफर और उभरते हुए "अहा मोमेंट्स" (Aha Moments) का प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से कारखानों में सरल, दोहराव वाले कार्य करने में सक्षम रहे हैं, लेकिन उन्हें एक वास्तविक घर या कार्यशाला की अव्यवस्थित और अप्रत्याशित प्रकृति को संभालने के लिए लचीलापन देना आर्टिफिशियल इंटेलिजेंस की सबसे कठिन चुनौतियों में से एक बना हुआ है। वर्षों से, शोधकर्ताओं ने रोबोट को भारी मात्रा में वीडियो डेटा खिलाकर उन्हें सिखाने की कोशिश की है, इस उम्मीद में कि मशीन हर संभव स्थिति के लिए निर्देशों का एक एकल, सटीक सेट सीख लेगी। यह दृष्टिकोण, हालांकि शक्तिशाली है, अक्सर विफल हो जाता है जब वास्तविक दुनिया प्रशिक्षण वीडियो से थोड़ा भी विचलित होती है; ग्रिपर का थोड़ा सा फिसलना या प्रकाश में बदलाव रोबोट को फ्रीज या क्रैश कर सकता है। एक वैकल्पिक मार्ग उभरा है, जो रोबोट को स्थिर प्रोग्राम के रूप में नहीं, बल्कि एजेंटों के रूप में देखता है जो सोच सकते हैं, योजना बना सकते हैं और उपकरणों का उपयोग कर सकते हैं। हालांकि, यहां तक कि ये स्मार्ट एजेंट भी वास्तविक समय में अपनी गलतियों से सीखने में संघर्ष करते रहे हैं। अधिकांश सिस्टम एक लूप में काम करते हैं जहाँ वे एक कार्य करने का प्रयास करते हैं, विफल होते हैं, और फिर पूरे प्रयास के समाप्त होने के बाद ही इस बात पर विचार करते हैं कि क्या गलत हुआ। जब तक वे त्रुटि का विश्लेषण करते हैं, तब तक सुधार करने का क्षण निकल चुका होता है, और भौतिक संपर्क पहले ही टूट चुका होता है।
त्सिंहहुआ विश्वविद्यालय और ज़ेड-ट्रांस एआई (Z-Trans AI) के शोधकर्ताओं की एक टीम ने 'ज़ेटा' (Zetta) नामक एक नई प्रणाली पेश की है, जो सोचने और कार्य करने के बीच के अंतर को पाटकर रोबмों के सीखने के तरीके को बदल देती है। किसी कार्य के पूरा होने तक सीखने के लिए प्रतीक्षा करने के बजाय, ज़ेटा एक रोबोट को चलते समय निरंतर अपनी भौतिक स्थिति की निगरानी करने, त्रुटियों को तुरंत पहचानने और उन्हें तुरंत ठीक करने की अनुमति देता है। यह प्रणाली रोबोट के मुख्य मस्तिष्क को फिर से प्रशिक्षित करने का प्रयास नहीं करती है, जो स्थिर और सुदृढ़ बना रहता है। इसके बजाय, यह "रनटाइम क्रिटिक्स" (runtime critics) की एक परत बनाता है—छोटे, विशिष्ट मॉनिटर जो रोबोट के हाथों और उन वस्तुओं की निगरानी करते हैं जिन्हें वह छूता है। यदि कोई क्रिटिक देखता है कि पकड़ फिसल रही है या कोई वस्तु गिरने वाली है, तो यह स्थिति को बचाने के लिए एक पूर्व-निर्धारित रिकवरी स्किल (सुधार कौशल) को सक्रिय करता है। यह एक स्व-विकसित लूप बनाता है जहाँ रोबोट एक विशिष्ट कार्य में जितना अधिक प्रयास करता है, उतना ही बेहतर होता जाता है, न कि दुनिया की अपनी मौलिक समझ को बदलकर, बल्कि भौतिक विफलताओं को संभालने के प्रमाणित तरीकों का एक पुस्तकालय संचित करके।
शोधकर्ताओं ने रोबोटिक हेरफेर के दो प्रमुख बेंचमार्क पर इस दृष्टिकोण का परीक्षण किया: विभिन्न स्थानों के बीच वस्तुओं को स्थानांतरित करने वाले कार्यों का एक सेट और घरेलू कामों का एक अधिक जटिल सेट जैसे दराज खोलना या उपकरणों को चालू करना। इन सिमुलेशन में, सिस्टम एक बेस रोबोट पॉलिसी के साथ शुरू हुआ जिसकी कठिन कार्यों पर सफलता दर लगभग 35 प्रतिशत थी। जैसे-जैसे सिस्टम ने हजारों परीक्षण किए, इसने उन विशिष्ट क्षणों की पहचान करना शुरू कर दिया जहाँ चीजें गलत हुईं। इसने इन विफलताओं को समूहबद्ध किया, मूल कारण का पता लगाया, और उन्हें ठीक करने के लिए नया कोड लिखा। केवल कुछ ही राउंड के आत्म-सुधार के भीतर, कठिन कार्यों पर सफलता दर 90 प्रतिशत से ऊपर बढ़ गई। सिस्टम केवल भाग्यशाली नहीं था; इसने सुधार का एक स्पष्ट पैटर्न प्रदर्शित किया जहाँ यह कुछ समय तक संघर्ष करता था, फिर अचानक एक प्रमुख भौतिक सिद्धांत की खोज करता था—जैसे कि उठाने से पहले पकड़ को स्थिर करने की आवश्यकता—और इसका प्रदर्शन तेजी से आगे बढ़ जाता था। शोधकर्ता इन अचानक आए उछाल को "अहा मोमेंट्स" (aha moments) कहते हैं, जहाँ रोबोट अंततः उस भौतिक बाधा को समझ जाता है जिसे वह मिस कर रहा था।
इस खोज को जो बात विशेष रूप से महत्वपूर्ण बनाती है वह यह है कि रोबोट द्वारा सीखे गए कौशल किसी एक विशिष्ट वस्तु या एक विशिष्ट कमरे तक सीमित नहीं थे। जब शोधकर्ताओं ने एक कार्य में वाइन की बोतल को संभालने के लिए रोब been द्वारा सीखे गए कौशल को क्रीम चीज़ कंटेनर से जुड़े पूरी तरह से अलग कार्य पर लागू किया, तो रोबोट बिना किसी नए प्रशिक्षण के सफल रहा। सिस्टम ने पकड़ने, हिलाने और रखने के सामान्य सिद्धांतों को सीखा जो विभिन्न परिदृश्यों में काम करते थे। यह सुझाव देता है कि रोबोट केवल लक्ष्य तक पहुँचने का रास्ता याद नहीं कर रहा था, बल्कि भौतिक दुनिया के साथ बातचीत करने की गहरी समझ विकसित कर रहा था। यह प्रणाली अविश्वसनीय रूप से तेज़ भी साबित हुई, जिसने सीखने के लिए आवश्यक अनुभव उत्पन्न करने हेतु कंप्यूटर क्लस्टर पर सिमुलेशन चलाया। रोबोट के तर्क को सिमुलेशन चलाने वाले हार्डवेयर से अलग करके, शोधकर्ता सीखने की प्रक्रिया को पिछले तरीकों की तुलना में बीस गुना से अधिक तेज़ चलाने में सक्षम रहे, जिससे रोबोट अपने कौशल को दिनों के बजाय घंटों में विकसित करने में सक्षम हुआ।
शोधकर्ता तर्क देते हैं कि यह दृष्टिकोण रोबics की एक मौलिक समस्या को हल करता है: वर्तमान मॉडलों की भौतिक दुनिया के तीव्र परिवर्तनों के प्रति प्रतिक्रिया करने में अक्षमता। बड़े आर्टिफिशियल इंटेलिजेंस मॉडल गिरती हुई वस्तु को पकड़ने या फिसलती हुई पकड़ को समायोजित करने के लिए आवश्यक गति से निर्णय लेने के लिए बहुत धीमे हैं। मुख्य मस्तिष्क को स्थिर रखकर और क्रिटिक्स और रिकवरी स्किल्स की एक तेज़, प्रतिक्रियाशील परत जोड़कर, ज़ेटा उच्च-स्तरीय योजना और निम्न-स्तरीय भौतिक नियंत्रण के बीच के अंतर को पाटता है। सिस्टम ने दिखाया कि यह रसोई में जाने, कैबिनेट खोलने और उसके अंदर कोई वस्तु रखने जैसे जटिल, लंबे अनुक्रमों को प्रबंधित कर सकता है, जो कार्य को प्रबंधनीय चरणों में तोड़कर और प्रत्येक संभावित विफलता के लिए एक सुरक्षा जाल तैयार करके किया गया। एक केस स्टडी में, एक बोतल को कटोरे में ले जाने का प्रयास करने वाला रोबोट शुरू में परिवहन के दौरान बोतल गिराने के कारण बार-बार विफल हुआ। कुछ राउंड के आत्म-सुधार के बाद, सिस्टम ने यह सुनिश्चित करने के लिए एक विशिष्ट जांच जोड़ी कि हिलने से पहले पकड़ सुरक्षित है, और उस कार्य के लिए सफलता दर 15 प्रतिशत से बढ़कर 95 प्रतिशत हो गई।
यह कार्य इस प्रकार के सीखने को संभव बनाने के लिए बुनियादी ढांचे के महत्व को भी रेखांकित करता है। रोबोट के कौशल को विकसित करने के लिए, सिस्टम को हजारों परीक्षण चलाने की आवश्यकता होती है ताकि उन दुर्लभ क्षणों को खोजा जा सके जहाँ वह विफल होता है और फिर उन विफलताओं का विश्लेषण किया जा सके। शोधकर्ताओं ने इस कार्यभार को प्रबंधित करने के लिए एक विशेष प्रणाली बनाई, जिससे वे एक साथ कई सिमुलेशन चला सके बिना धीमा हुए। यह बुनियादी ढांचा परियोजना की गति के लिए महत्वपूर्ण था, जिससे टीम को क्रिटिक्स और रिकवरी स्किल्स को प्रशिक्षित करने के लिए आवश्यक डेटा एकत्र करने में मदद मिली। इस सीखने की प्रक्रिया को स्केल करने की क्षमता के बिना, स्व-विकास लूप व्यावहारिक होने के लिए बहुत धीमा होता। परिणाम भौतिक बुद्धिमत्ता (physical intelligence) के लिए एक नया मार्ग सुझाते हैं, जहाँ रोबोट को शुरुआत से ही पूर्ण होने की आवश्यकता नहीं है, बल्कि वे अनुभव के माध्यम से विश्वसनीय बनना सीख सकते हैं, और अप्रत्याशित स्थितियों को संभालने की अपनी क्षमता को लगातार परिष्कृत कर सकते हैं।
इस शोध के निहितार्थ केवल वस्तुओं को हिलाने में रोबोट को बेहतर बनाने से कहीं अधिक हैं। यह एक ब्लूप्रिंट प्रदान करता है कि कैसे आर्टिफिशियल इंटेलिजेंस भौतिक दुनिया के साथ एक मजबूत और अनुकूलनीय तरीके से बातचीत कर सकता है। वास्तविक समय में त्रुटियों का पता लगाने और उनसे उबरने की क्षमता पर ध्यान केंद्रित करके, यह प्रणाली उस भंगुरता (brittleness) से बचती है जिसने पिछले दृष्टिकोणों को प्रभावित किया है। शोधकर्ता नोट करते हैं कि हालांकि उनका वर्तमान कार्य सिमुलेशन में किया गया था, लेकिन उनके द्वारा विकसित सिद्धांत वास्तविक रोबोटों पर स्थानांतरित किए जाने के लिए डिज़ाइन किए गए हैं। टीम के लिए अगला कदम इस स्व-विकसित हार्नेस (harness) को लेना और इसे भौतिक मशीनों पर परीक्षण करना है, जो डिजिटल सिमुलेशन और वास्तविक दुनिया के बीच के अंतर को पाटता है। यदि सफल रहा, तो यह ऐसे रोबोटों की ओर ले जा सकता है जो केवल एक कार्य करने के लिए प्रोग्राम नहीं हैं, बल्कि हर बार प्रयास करने पर अपने प्रदर्शन को सीखने और सुधारने में सक्षम हैं, जिससे वे मानव वातावरण में अधिक उपयोगी और विश्वसनीय साथी बन सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।