EMERGE-Policy: A Robot Mind Emerges Beyond a Single Policy
EMERGE-Policy एक ग्राफ-संरचित एजेंटिक फ्रेमवर्क पेश करता है जहाँ एक केंद्रीय मुख्य एजेंट (Main Agent) धारणा (perception), तर्क (reasoning) और सत्यापन (verification) के लिए पृथक संदर्भों के भीतर विशिष्ट उप-एजेंटों (Sub Agents) को समन्वित करता है, जो उभरते हुए सिस्टम-स्तरीय सहयोग और क्लोज्ड-लूप सुधार के माध्यम से फाइन-ट्यूनिंग-मुक्त रोबोट प्रदर्शन को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से एक ही, सटीक गति को दोहराने में विशेषज्ञ रहे हैं, जैसे कि असेंबली लाइन पर एक वेल्डर या समान बक्सों को एक के ऊपर एक रखने वाली एक भुजा। लेकिन एक रोबोट को एक अव्यवस्थित, अप्रत्याशित वास्तविक दुनिया को संभालने में सक्षम दिमाग देना बहुत कठिन साबित हुआ है। दशकों तक, शोधकर्ताओं ने एक एकल, विशाल कंप्यूटर प्रोग्राम—एक "मस्तिष्क"—बनाने की कोशिश की, जो एक साथ किसी वस्तु को देख सके, एक कमांड समझ सके और हाथ को हिला सके। हालांकि ये प्रणालियाँ प्रभावशाली हो गई हैं, लेकिन जब चीजें गलत होती हैं तो वे अक्सर लड़खड़ा जाती हैं। यदि कोई कप फिसल जाता है या रोशनी बदल जाती है, तो एकल मस्तिष्क भ्रमित हो सकता है क्योंकि वह सब कुछ एक ही बड़ी छलांग में करने की कोशिश करता है। रोबोटिक्स में नया विचार यह सुझाव देता है कि बुद्धिमत्ता को एक स्थान पर रहने की आवश्यकता नहीं हो सकती है। इसके बजाय, एक रोबोट का मन विशेष विशेषज्ञों की एक टीम से उभर सकता है जो मिलकर काम करते हैं, जहाँ एक हिस्सा देखता है, दूसरा योजना बनाता है, तीसरा काम की जाँच करता है, और चौथा याद रखता है कि क्या हुआ था। यह दृष्टिकोण रोबोट को एक एकल इकाई के रूप में नहीं, बल्कि एक समन्वित समूह के रूप में मानता है, जिससे यह एक एकल प्रोग्राम की तुलना में गलतियों से उबरने और परिवर्तनों के अनुकूल होने में सक्षम होता है।
यह EMERGE-Policy नामक एक नए ढांचे के पीछे का मूल विचार है, जिसे त्सिंगहुआ और पेकिंग यूनिवर्सिटी सहित कई विश्वविद्यालयों के शोधकर्ताओं द्वारा विकसित किया गया है। एक विशाल मॉडल पर सब कुछ करने के लिए निर्भर रहने के बजाय, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जहाँ एक केंद्रीय "मुख्य एजेंट" (Main Agent) एक प्रोजेक्ट मैनेजर के रूप में कार्य करता है। यह मैनेजर स्वयं कच्चे वीडियो फीड को नहीं देखता है या हर मोटर मूवमेंट की गणना नहीं करता है। इसके बजाय, यह एक जटिल कार्य, जैसे कि "इन कपों को एक पिरामिड में स्टैक करें," को छोटे चरणों में तोड़ देता है। फिर यह विशिष्ट कार्यों को विशेष "उप-एजेंटों" (Sub Agents) को सौंप देता है। सहायकों की एक टीम पूरी तरह से दृश्य को देखने और कपों को खोजने पर ध्यान केंद्रित करती है। दूसरी टीम रोबोट के हाथ की निगरानी करती है ताकि यह सुनिश्चित हो सके कि वह सही ढंग से चल रहा है। तीसरी टीम यह जाँचती है कि कप रखने के बाद वास्तव में स्थिर है या नहीं। यदि कुछ गलत हो जाता है, तो चौथी टीम रोबोट को उस विफलता को याद रखने और एक अलग दृष्टिकोण आज़माने में मदद करती है। मुख्य एजेंट इन समूहों का समन्वय करता है, केवल आवश्यक, सारांशित जानकारी प्राप्त करता है जिसकी उसे अगला निर्णय लेने के लिए आवश्यकता होती है, जबकि कच्चे डेटा को प्रोसेस करने का भारी काम बैकग्राउंड में होता है।
शोधकर्ताओं ने इस प्रणाली का परीक्षण चुनौतियों से भरे कई बेंचमार्क पर किया, जिसमें ऐसे कार्य शामिल थे जहाँ रोबोट को कठिन परिस्थितियों में मेज पर वस्तुओं को नियंत्रित करना था। उन्होंने अपने टीम-आधारित दृष्टिकोण की तुलना वर्तमान में उपलब्ध सर्वश्रेष्ठ एकल-प्रोग्राम मॉडलों के साथ की। परिणामों ने दिखाया कि समन्वित टीम ने एकल मॉडलों की तुलना में काफी बेहतर प्रदर्शन किया, विशेष रूप से तब जब वातावरण बदल गया या निर्देश अस्पष्ट थे। मानक परीक्षणों पर, प्रणाली ने 99 प्रतिशत के करीब सफलता दर हासिल की, जो सर्वश्रेष्ठ एकल मॉडलों की तुलना में एक छोटा लेकिन सार्थक सुधार है। अधिक महत्वपूर्ण बात यह है कि जब शोधकर्ताओं ने व्यवधान पेश किए—जैसे कि रोशनी बदलना, कप का आकार बदलना, या रोबोट का दृश्य बाधित करना—तो टीम-आधारित प्रणाली मजबूत बनी रही। जबकि एकल मॉडल इन नई स्थितियों में अक्सर पूरी तरह विफल हो जाते थे, EMERGE-Policy प्रणाली समस्या का पता लगाने, निदान करने और सफल होने के लिए अपनी योजना को समायोजित करने में सक्षम थी। कागज के कपों को तीन-स्तरीय पिरामिड में स्टैक करने वाले एक वास्तविक रोबोट वाले एक विशिष्ट परीक्षण में, सिस्टम ने 94 प्रतिशत परीक्षणों में सफलता प्राप्त की, भले ही कप अलग आकार के थे या कैमरा एंगल बदल गया था।
इस सफलता का एक प्रमुख हिस्सा यह है कि प्रणाली मेमोरी और गलतियों को कैसे संभालती है। वीडियो के हर एक फ्रेम को याद करने की कोशिश करने के बजाय, जो कंप्यूटर को अभिभूत कर सकता है, प्रणाली एक डिजिटल लॉग में क्या हुआ इसका एक संक्षिप्त सारांश लिख देती है। यदि रोबोट एक कप गिरा देता है, तो प्रणाली केवल दोबारा प्रयास नहीं करती है। यह विश्लेषण करती है कि गिरावट क्यों हुई, विफलता के बारे में एक नोट लिखती है, और आगे बढ़ने से पहले समस्या के उस हिस्से को ठीक करने के लिए एक विशिष्ट योजना बनाती है। यह रोबोट को पूरे कार्य को फिर से शुरू किए बिना स्थानीय स्तर पर त्रुटियों से उबरने की अनुमति देता है। शोधकर्ताओं ने यह भी पाया कि प्रणाली को यह "पूर्वावलोकन" (preview) देने से कि आगे क्या हो सकता है, उसे गलतियाँ होने से पहले बचने में मदद मिली। कुछ संभावित चालों को अपने मन में सिम्युलेट करके और यह जाँचकर कि कौन सी सबसे अच्छी दिखती है, रोबोट सबसे सुरक्षित रास्ता चुन सका। इस "कल्पना" चरण ने, एक सख्त सत्यापन प्रक्रिया के साथ मिलकर, यह सुनिश्चित किया कि रोबोट अपरिवर्तनीय गलतियाँ कम करे।
प्रयोग केवल कंप्यूटर सिमुलेशन तक सीमित नहीं थे। टीम ने एक भौतिक रोबोटिक आर्म पर कार्यों के एक लंबे क्रम को करने के लिए प्रणाली को तैनात किया: मेज से कागज के कप हटाना, उन्हें उल्टा रखना और परतों में स्टैक करना। इस वास्तविक दुनिया के परीक्षण ने साबित कर दिया कि ढांचा भौतिक वस्तुओं, जैसे कि हिलने या फिसलने वाले कप की अनिश्चितता को संभाल सकता है। सिस्टम ने 94 प्रतिशत समय कार्य को सफलतापूर्वक पूरा किया, और यहाँ तक कि जब शोधकर्ताओं ने प्रक्रिया में बाधा डाली या रोशनी बदली, तो रोबोट पुन: योजना बनाने और काम पूरा करने में सक्षम था। अध्ययन बताता है कि रोबोट की बुद्धिमत्ता का भविष्य एक बड़े, स्मार्ट एकल मस्तिष्क को बनाने में नहीं, बल्कि कई छोटे, विशेष उपकरणों को एक साथ काम करने का एक बेहतर तरीका बनाने में निहित है। इन उपकरणों को एक स्पष्ट पदानुक्रम में व्यवस्थित करके जहाँ प्रत्येक के पास एक विशिष्ट कार्य है और रिपोर्ट करने का एक स्पष्ट तरीका है, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो न केवल अधिक सटीक है बल्कि वास्तविक दुनिया की अराजकता के प्रति अधिक लचीली भी है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।