GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
यह शोध पत्र GigaBrain-0.7 को प्रस्तुत करता है, जो एक एम्बॉडीड फाउंडेशन मॉडल है जो एक नवीन तीन-प्रणाली आर्किटेक्चर का लाभ उठाता है और जिसे विविध रोबोटिक स्वरूपों में पूर्ववर्ती अत्याधुनिक मॉडलों की तुलना में बेहतर ज़ीरो-शॉट सामान्यीकरण (zero-shot generalization), निर्देश पालन और कार्य सफलता दर प्राप्त करने के लिए 37,000 घंटों से अधिक के विषम डेटा पर प्रशिक्षित किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ एक रोबोट एक बिखरी हुई रसोई की मेज को देख सकता है, "लाल सेब को कटोरे में रख दो" जैसे बोले गए अनुरोध को समझ सकता है, और फिर यह पता लगा सकता है कि बिना किसी चीज़ को गिराए या टकराए अपने हाथ को ठीक से कैसे चलाया जाए। यह एम्बोडीड (embodied) आर्टिफिशियल इंटेलिजेंस का वादा है: ऐसी मशीनें जो केवल जानकारी को प्रोसेस नहीं करतीं बल्कि भौतिक दुनिया के साथ अंतःक्रिया करती हैं। वर्षों से, शोधकर्ता रोबots को मानव हाथों द्वारा वस्तुओं को हिलाने वाले हजारों वीडियो दिखाकर सिखाने की कोशिश कर रहे हैं, इस उम्मीद में कि मशीन भौतिकी के नियमों और कार्य-कारण (cause-and-effect) के सिद्धांतों को सीख लेगी। हालाँकि, एक बड़ी बाधा बनी रही। रोबोट अलग तरह से बनाए जाते हैं; किसी के दो हाथ हो सकते हैं, किसी के पास एक सिंगल ग्रिपर हो सकता है, और तीसरा पहियों पर चल सकता है। एक प्रकार के रोबोट से एकत्र किया गया डेटा अक्सर दूसरे को भ्रमित कर देता है। इसके अलावा, केवल वीडियो देखने से मशीन यह नहीं सीख पाती कि यदि वह कोई गलती करती है तो आगे क्या होगा, या कार्य गलत होने पर सुधार कैसे किया जाए। सवाल यह था कि क्या हम एक ही स्मार्ट मस्तिष्क बना सकते हैं जो भाषा को समझ सके, दुनिया को देख सके और किसी भी प्रकार के रोबोट शरीर को नियंत्रित कर सके, और वह भी विभिन्न प्रकार के अनुभवों के विशाल मिश्रण से सीखते हुए।
शोधकर्ताओं की एक टीम ने GigaBrain-0.7 नामक एक प्रणाली के साथ एक महत्वपूर्ण प्रगति प्रस्तुत की है। यह केवल एक एकल प्रोग्राम नहीं है बल्कि एक समन्वित प्रणाली है जिसे वास्तविक दुनिया की जटिलताओं को संभालने के लिए डिज़ाइन किया गया है। रोबोट को एक ही अराजक झोंके में सब कुछ सीखने के लिए मजबूर करने के बजाय, शोधकर्ताओं ने सीखने की प्रक्रिया को तीन अलग-अलग लेकिन जुड़े हुए हिस्सों में व्यवस्थित किया जो एक साथ काम करते हैं। पहला हिस्सा हाथों और रिफ्लेक्सिस (reflexes) के रूप में कार्य करता है, जो क्रियाओं को निष्पादित करने के लिए रोबोट के मोटर्स पर तत्काल नियंत्रण लेता है। दूसरा हिस्सा योजनाकार (planner) और पर्यवेक्षक (observer) के रूप में कार्य करता है, जो दृश्य को देखता है, भाषा के निर्देश को समझता है, और "मेज साफ करो" जैसे बड़े लक्ष्य को "कप उठाओ" और "इसे सिंक तक ले जाओ" जैसे छोटे, प्रबंधनीय चरणों में तोड़ता है। तीसरा हिस्सा सबसे नवीन जुड़ाव है: यह एक भविष्यवक्ता (predictor) और निर्णायक (judge) के रूप में कार्य करता है। यह कल्पना करता है कि यदि रोबोट अपने वर्तमान पथ पर चलता रहा तो कुछ सेकंड बाद दृश्य कैसा दिखेगा, और यह उस भविष्य को एक स्कोर देता है ताकि यह तय किया जा सके कि रोबोट प्रगति कर रहा है या विफलता की ओर बढ़ रहा है।
इस प्रणाली को प्रशिक्षित करने के लिए, शोधकर्ताओं ने किसी एकल डेटा स्रोत पर भरोसा नहीं किया। उन्होंने 37,000 घंटों से अधिक के अनुभव का एक विशाल पुस्तकालय एकत्र किया। इस संग्रह में कारखानों और घरों में काम करने वाले वास्तविक रोबोटों के वीडियो, वस्तुओं को संचालित करने वाले मानव हाथों के प्रथम-व्यक्ति (first-person) परिप्रेक्ष्य से रिकॉर्ड किए गए वीडियो और कंप्यूटर सिमुलेशन से उत्पन्न डेटा शामिल था। उन्होंने कृत्रिम बुद्धिमत्ता का उपयोग करके नए प्रशिक्षण परिदृश्य भी बनाए, जिससे प्रभावी रूप से उन स्थितियों की विविधता बढ़ गई जिनसे रोबोट सीख सकता था। इस विविध डेटा के मिश्रण को सिस्टम में फीड करके, शोधकर्ताओं ने मॉडल को किसी एक विशिष्ट रोबोट के लिए विशिष्ट चालें रटने के बजाय गति और अंतःक्रिया के सामान्य सिद्धांतों को सीखने की अनुमति दी। सिस्टम को 16 अलग-अलग प्रकार के रोबोट शरीरों को संभालने के लिए प्रशिक्षित किया गया था, जिनमें दो हाथों वाली मशीन से लेकर ह्यूमनॉइड आकृतियाँ तक शामिल थीं, जिससे इसे अपने नियंत्रण में मौजूद शरीर के आधार पर "बाएं" और "दाएं" या "पकड़ने" (grasp) और "छोड़ने" (release) की अपनी समझ को अनुकूलित करना सिखाया गया।
इस दृष्टिकोण के परिणामों का परीक्षण औद्योगिक और घरेलू दोनों सेटिंग्स में वास्तविक रोबोटों पर किया गया। उन कार्यों को करने के लिए जिन्हें उसने पहले कभी नहीं देखा था, सिस्टम ने एक उल्लेखनीय सामान्यीकरण (generalize) क्षमता दिखाई। एक परीक्षण में, एक रोबोट को कपड़ों के ढेर में से एक कपड़ा मोड़ने के लिए कहा गया, जिसमें कपड़े के आकार बदलने के साथ लगातार उसकी पकड़ को समायोजित करने की आवश्यकता होती है। उस विशिष्ट शर्ट के लिए पुन: प्रशिक्षित हुए बिना, सिस्टम ने सफलतापूर्वक विकृत वस्तु (deformable object) का संचालन किया। एक अन्य परिदृश्य में, रोबोट को मिश्रित बर्तनों के समूह में से एक विशिष्ट रंग का चम्मच उठाने के लिए कहा गया, जिससे यह प्रदर्शित हुआ कि वह सूक्ष्म भाषा निर्देशों को समझ सकता है और नए ऑब्जेक्ट्स पर लागू कर सकता है। सिस्टम लंबे कार्यों के अनुक्रमों को भी संभालने में सक्षम सिद्ध हुआ, जैसे डेस्क को व्यवस्थित करना या चावल की सफाई करना, जहाँ रोबोट को कई छोटी गतिविधियों को निष्पादित करते समय समग्र लक्ष्य का बोध बनाए रखना था।
एक प्रमुख निष्कर्ष यह था कि सिस्टम की भविष्य की भविष्यवाणी करने और अपनी प्रगति का मूल्यांकन करने की क्षमता ने सफलता दर में ठोस अंतर पैदा किया। जब शोधकर्ताओं ने सिस्टम के प्रेडिक्टिव (predictive) हिस्से को हटा दिया, तो रोबोट जटिल कार्यों के साथ संघर्ष करने लगा, अक्सर दोहराव वाली गति के लूप में फंस गया या छोटी गलतियों से उबरने में विफल रहा। प्रेडिक्टिव घटक सक्रिय होने के साथ, रोबोट अनुमान लगा सकता था कि एक निश्चित गति टक्कर या गिरावट का कारण बनेगी, और वह गलती होने से पहले ही अपना रास्ता बदल लेगा। इस क्षमता ने रोबोट को उपहार लपेटने या क्यूब्स को छांटने जैसे कठिन कार्यों को पिछली मॉडलों की तुलना में बहुत उच्च विश्वसनीयता के साथ पूरा करने में सक्षम बनाया। शोधकर्ताओं ने पाया कि जैसे-जैसे उन्होंने प्रशिक्षण डेटा की मात्रा बढ़ाई, रोबोट का प्रदर्शन लगातार सुधरा, जिससे पता चलता है कि सिस्टम वास्तव में अपने अनुभवों की विशाल मात्रा और विविधता से सीख रहा था।
अध्ययन ने यह भी रेखांकित किया कि विभिन्न प्रकार के डेटा को कैसे संयोजित किया जाता है। सिस्टम तब सबसे अच्छा प्रदर्शन करता है जब वह वास्तविक रोबोट परीक्षणों, मानव प्रदर्शनों और सिम्युलेटेड वातावरण के मिश्रण से सीखता है। प्रत्येक स्रोत ने अलग तरह का सबक प्रदान किया: वास्तविक रोबोटों ने सिस्टम को विशिष्ट मशीनों के भौतिक प्रतिबंधों के बारे में सिखाया, मानव वीडियो ने दिखाया कि लोग स्वाभाविक रूप से वस्तुओं के साथ कैसे अंतःक्रिया करते हैं, और सिमुलेशन ने इसे सुरक्षित रूप से दुर्लभ या खतरनाक परिदृश्यों का अभ्यास करने की अनुमति दी। इन स्रोतों को मिलाकर, सिस्टम ने दुनिया के काम करने के तरीके की एक मजबूत समझ विकसित की जिसे विभिन्न रोबोट शरीरों पर लागू किया जा सकता था। शोधकर्ताओं ने नोट किया कि हालांकि सिस्टम पूर्ण नहीं है और अभी भी कुछ सबसे जटिल भौतिक अंतःक्रियाओं के साथ संघर्ष करता है, फिर भी यह एकल कार्यों के लिए विशेष रोबोट बनाने के बजाय एक सामान्य-उद्देश्य वाली बुद्धि (general-purpose intelligence) बनाने की ओर एक बदलाव का प्रतिनिधित्व करता है।
अंततः, GigaBrain-0.7 यह प्रदर्शित करता है कि प्रशिक्षण डेटा की मात्रा और विविधता को बढ़ाने के साथ, योजना बनाने (planning), कार्य करने (acting) और भविष्यवाणी करने (predicting) को अलग करने वाली एक संरचित वास्तुकला (architecture) को जोड़ने से रोबोट अधिक सक्षम और अनुकूलन योग्य बन सकते हैं। सिस्टम केवल एक स्क्रिप्ट का पालन नहीं करता है; यह किसी कार्य के संदर्भ को समझता है, अपने कार्यों के परिणामों का पूर्वानुमान लगाता है, और समय के साथ सुधार करने के लिए अपने अनुभव से सीखता है। हालांकि ऐसे सिस्टम को घर या कारखाने में हर संभव स्थिति को संभालने के लिए अभी भी बहुत काम करना बाकी है, यह शोध एक स्पष्ट मार्ग प्रदान करता है। यह सुझाव देता है कि रोबोटिक्स का भविष्य केवल बेहतर हार्डवेयर बनाने में नहीं है, बल्कि अधिक स्मार्ट, अधिक लचीले सॉफ्टवेयर बनाने में है जो भौतिक दुनिया के विशाल और विविध अनुभवों से सीख सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।