Continual Field-Adaptive Models (CFAMs) for Post-Deployment Physical AI
यह शोधपत्र कॉन्टिनुअल फील्ड-एडेप्टिव मॉडल्स (CFAMs) को प्रस्तुत करता है, जो एक पूरक शिक्षण आर्किटेक्चर है जिसमें एक फ्रोजन स्लो-लर्निंग घटक और एक फास्ट-लर्निंग कैप्सूल फील्ड शामिल है, जो विविध भौतिक रोबोटों को पूर्व दक्षता बनाए रखते हुए स्वायत्त, ग्रेडिएंट-मुक्त अपडेट के माध्यम से नए कौशल कुशलतापूर्वक प्राप्त करने और क्षेत्र में नवीन, सत्यापित नियर-OOD परिदृश्यों के अनुकूल होने में सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक रोबोट को एक खतरनाक, अनछुए स्थान में भेजा जाता है: एक ढही हुई खान, एक विकिरण से संतृप्त रिएक्टर, या गहरे समुद्र का तल। इसका मिशन मलबे को साफ करना, किसी संरचना का निरीक्षण करना, या किसी वस्तु को प्राप्त करना है। वास्तविक दुनिया में, ये वातावरण अप्रत्याशित होते हैं। ज़मीन ठोस कंक्रीट के बजाय ढीली बजरी हो सकती है; एक भारी भार अप्रत्याशित रूप से खिसक सकता है; एक दरवाज़ा मानचित्रों में सुझाए गए आकार से अधिक संकरा हो सकता है। एक मशीन की सफलता के लिए, यह केवल प्रयोगशाला में लिखे गए स्क्रिप्ट का पालन नहीं कर सकती। इसे अपने आस-पास के परिवेश से सीखना होगा, और नई स्थितियों के सामने आते ही खुद को ढालना होगा, बिना किसी इंसान द्वारा नए निर्देश भेजे जाने या उसके मस्तिष्क को पुन: प्रशिक्षित करने के लिए किसी सुपरकंप्यूटर की आवश्यकता के। यह भौतिक कृत्रिम बुद्धिमत्ता (फिजिकल एआई) का परम लक्ष्य है: एक ऐसी मशीन जो खतरे में कदम रख सके, मौके पर चीज़ों को समझ सके, और जो उसने सीखा है उसे भूल बिना अपनी मौजूदा क्षमताओं को बनाए रख सके।
वर्षों से, इन मशीनों को बनाने का मानक दृष्टिकोण उन्हें एक नियंत्रित सेटिंग में डेटा की विशाल मात्रा खिलाना रहा है, जिससे उन्हें प्रयोगशाला छोड़ने से पहले किसी कार्य के हजारों विविधताओं को सिखाया जाता है। लेकिन रक्षा या आपदा प्रतिक्रिया जैसे मिशन-महत्वपूर्ण क्षेत्रों में, ऐसा डेटा मौजूद नहीं होता है। वातावरण इतना खतरनाक होता है कि उसे उपकरणों से सुसज्जित नहीं किया जा सकता, और स्थितियाँ इतनी अद्वितीय होती हैं कि उनका पूर्वानुमान नहीं लगाया जा सकता। यदि कोई रोबोट ऐसी स्थिति का सामना करता है जो उसने पहले नहीं देखी है, तो एक पारंपरिक मॉडल अक्सर विफल हो जाता है, या इससे भी बुरा, वह अपने पुराने ज्ञान को मिटाकर (overwrite करके) "सीखने" की कोशिश करता है, जिससे वह अपने बुनियादी कर्तव्यों को निभाने की क्षमता खो देता है। यह एक दुविधा पैदा करता है: आप एक ऐसी मशीन कैसे बनाएं जो अज्ञात को संभालने के लिए पर्याप्त स्मार्ट हो, फिर भी इतनी स्थिर हो कि नया अनुभव आने पर अपना मानसिक संतुलन न खो दे?
शोधकर्ताओं की एक टीम ने 'कंटीन्यूअल फील्ड-एडेप्टिव मॉडल्स' (CFAMs) नामक एक समाधान प्रस्तावित किया है। उनका कार्य, जिसका परीक्षण चलने वाले कुत्तों से लेकर उड़ने वाले ड्रोन, मानव जैसे हाथों और ऑफ-रोड वाहनों तक पांच अलग-अलग प्रकार के रोबोटों पर किया गया, यह सुझाव देता है कि मशीनों को तैनात होने के बाद और स्मार्ट बनाने का एक नया तरीका है। रोबोट के पूरे मस्तिष्क को हर बार कुछ नया देखने पर पुन: प्रशिक्षित करने के बजाय, यह प्रणाली रोबोट के "धीमे" (slow) ज्ञान को उसके "तेज़" (fast) सीखने से अलग करती है। धीमा हिस्सा, जो धारणा (perception) और निर्णय लेने के भारी कार्यों को संभालता है, प्रयोगशाला में प्रारंभिक प्रशिक्षण के बाद पूरी तरह से स्थिर (frozen) कर दिया जाता है। यह एक स्थिर आधार के रूप में कार्य करता है। तेज़ हिस्सा एक विशेष मेमोरी बैंक है जहाँ रोबط अपने अनुभवों के दौरान सीखे गए नए और विशिष्ट पाठों को संग्रहीत करता है।
मूल विचार यह है कि जब ज़मीन खिसकती है या कोई वस्तु हिलती है, तो रोबोट को हर बार चलना या किसी वस्तु को पकड़ना फिर से सीखने की आवश्यकता नहीं होती है। इसके बजाय, वह एक "कॉम्पिटेंस कैप्सूल" (क्षमता कैप्सूल) संग्रहीत करता है, जो एक विशिष्ट सफलता का संक्षिप्त रिकॉर्ड है। इसे ज्ञान के एक विशाल पुस्तकालय में जोड़े गए एक एकल, सटीक नोट की तरह समझें। जब रोबोट ऐसी स्थिति का सामना करता है जो उसके ज्ञात ज्ञान से थोड़ी भिन्न है—जैसे कि एक भारी भार या फिसलन भरी सतह—तो वह अपनी स्मृति की जाँच करता है। यदि उसे कोई संग्रहीत पाठ मिलता है जो पर्याप्त रूप से निकट है, तो वह अपनी क्रियाओं को समायोजित करने के लिए उस पाठ का उपयोग करता है। यदि वह सफल होता है, तो वह अपनी स्मृति बैंक में एक नया, थोड़ा अलग पाठ लिखता है, जिससे प्रभावी रूप से उन स्थितियों का दायरा बढ़ जाता है जिन्हें वह संभाल सकता है। यह प्रक्रिया पूरी तरह से रोबोट के अपने कंप्यूटर पर होती है, बिना किसी मानवीय पर्यवेक्षण के और बिना उसके मुख्य मस्तिष्क के किसी जटिल गणितीय पुन: प्रशिक्षण के।
शोधकर्ताओं ने इस प्रणाली का परीक्षण करने के लिए पहले रोबोटों को केवल कुछ प्रदर्शनों (demonstrations) का उपयोग करके प्रयोगशाला में कुछ कार्य सिखाए। फिर उन्होंने रोबोटों को सिम्युलेटेड और वास्तविक दुनिया के वातावरण में भेजा जहाँ स्थितियाँ प्रशिक्षण डेटा से थोड़ी भिन्न थीं। परिणाम आश्चर्यजनक थे। जबकि मानक रोबोट, जो अपने मुख्य मस्तिष्क को पुन: प्रशिक्षित करके अनुकूलित होने की कोशिश करते थे, अक्सर विफल हो जाते थे या अपने मूल कौशल को भूल जाते थे, CFAM रोबोट बेहतर होते गए। एक परीक्षण सेट में, रोबोटों ने काम करते समय इन छोटी, सत्यापित सफलताओं को कैप्चर और स्टोर करके अपनी सफलता दर में लगभग चौदह प्रतिशत अंकों का सुधार किया। उन्होंने भारी भार को संभालने, घने वनस्पतियों के बीच से रास्ता बनाने और फिसलने से उबरने का कौशल सीखा, और यह सब करते हुए अपने मूल कार्यों को पूरी तरह से करने की अपनी क्षमता को बरकरार रखा।
महत्वपूर्ण रूप से, यह प्रणाली सुरक्षित और सीमित (bounded) डिज़ाइन की गई है। यह केवल उन स्थितियों से सीखती है जो उसके मौजूदा ज्ञान के बहुत करीब हैं, यह सुनिश्चित करने के लिए कि वह पूरी तरह से नए व्यवहारों को आविष्कार करने की कोशिश न करे जो खतरनाक हो सकते हैं। इसमें अपनी स्मृति को साफ़ करने का एक अंतर्निहित तंत्र भी है, जो समान पाठों को आपस में मिला देता है ताकि मेमोरी बैंक बहुत अधिक भरा न हो जाए। शोधकर्ताओं ने पाया कि इस दृष्टिकोण ने रोबोटों को कुशलतापूर्वक सीखने में सक्षम बनाया, जिसमें एक मानक रोबोट को प्रशिक्षित करने के लिए आवश्यक डेटा का केवल चालीस प्रतिशत ही उपयोग हुआ, और फिर वे क्षेत्र में स्वायत्त रूप से स्मार्ट होते रहे।
यह अध्ययन पुष्टि करता है कि ऐसी भौतिक एआई बनाना संभव है जो प्रशिक्षण समाप्त होने के साथ सीखना बंद नहीं करती है। रोबोट के स्थिर, सामान्य ज्ञान को उसके नए अनुभवों के लिए एक तेज़, लचीली स्मृति से अलग करके, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो भौतिक दुनिया की अव्यवस्थित और अप्रत्याशित वास्तविकता के अनुकूल हो सकती है। यह ऐसी मशीन नहीं है जो हर दिन सब कुछ शून्य से सीखती है; यह एक ऐसी मशीन है जो जो वह जानती है उस पर निर्माण करती है, और चलते समय अपने संग्रह में छोटे, सत्यापित सुधार जोड़ती जाती है। उन मिशनों के लिए जहाँ मनुष्य नहीं जा सकते, इस तरह का सीमित और स्वायत्त विकास एक मार्ग प्रदान करता है: एक ऐसी मशीन जो अज्ञात में कदम रख सके, अपनी गलतियों और सफलताओं से सीख सके, और अपनी पहचान खोए बिना आगे बढ़ती रहे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।