PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration
PhysCaP एक नवीन एजेंट है जो कोड-एज़-पॉलिसी फ्रेमवर्क में एक प्रशिक्षण-मुक्त, भौतिकी-सूचित अन्वेषण परत को एकीकृत करके रोबोटिक हेरफेर को बढ़ाता है, जो एक दोहरे-एजेंट नियोजन और प्राथमिकता प्रणाली के माध्यम से द्रव्यमान और कठोरता जैसे गुप्त वस्तु गुणों को अनुमानित करने के लिए कुशल, लक्षित सूचना-खोज को सक्षम बनाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से दृश्य दुनिया के उस्ताद रहे हैं। यदि किसी कार्य में एक कप को मेज से सिंक तक ले जाना शामिल है, तो एक आधुनिक रोबोट अक्सर कप को देख सकता है, एक पथ की योजना बना सकता है, और प्रभावशाली सहजता के साथ उस कार्य को निष्पादित कर सकता है। यह सफलता विजन-लैंग्वेज-एक्शन पॉलिसियों पर निर्भर करती है, जो ऐसे सिस्टम हैं जो मनुष्यों को कार्य करते हुए देखकर सीखते हैं और फिर उन गतिविधियों की नकल करते हैं। हालाँकि, ये सिस्टम एक मौलिक सीमा पर काम करते हैं: वे केवल सतह पर जो है उसे देखते हैं। वे यह जानने के लिए कि क्या कैन खाली है, उसका वजन महसूस नहीं कर सकते, न ही वे यह जानने के लिए फल की दृढ़ता को महसूस कर सकते हैं कि वह पका हुआ है या नहीं। वास्तविक दुनिया में, कई कार्य इन छिपी हुई भौतिक विशेषताओं पर निर्भर करते हैं। रसोई साफ करने वाला एक इंसान सोडा कैन को हिलाकर यह सुनने के लिए कि क्या वह खाली है, या एवोकैडो को दबाकर उसकी पकने की स्थिति जांचने के लिए उपयोग कर सकता है, जिससे वह स्पर्श और ध्वनि का उपयोग करके उन अंतरालों को भर सके जो दृष्टि (vision) पीछे छोड़ देती है। इस क्षमता के बिना कि वे छिपी हुई जानकारी को सक्रिय रूप से खोज सकें, एक रोबोट उस विवरण के प्रति अंधा रहता है जो यह निर्धारित करता है कि कोई कार्य सफल होगा या विफल।
नेशनल टेइवान यूनिवर्सिटी और NVIDIA के शोधकर्ताओं ने इस अंतर को पाटने के लिए एक नया दृष्टिकोण विकसित किया है, एक ऐसा सिस्टम बनाया है जिसे वे PhysCaP कहते हैं। यह सिस्टम एक रोबोट को एक जिज्ञासु मानव की तरह कार्य करना सिखाता है, जो अपनी स्वयं की निर्देशिका लिखने की क्षमता और भौतिक अन्वेषण की एक नई क्षमता को जोड़ता है। केवल देखने और नकल करने के बजाय, रोबोट को भौतिक दुनिया से प्रश्न पूछने के लिए डिज़ाइन किया गया है। जब वस्तुओं की एक मेज के सामने होता है जहाँ उत्तर छिपा हुआ है, तो रोबोट अनुमान नहीं लगाता है। वह संवाद करने का निर्णय लेता है, जैसे कि आवश्यक विशिष्ट डेटा एकत्र करने के लिए वस्तुओं को उठाना या दबाना। यह सिस्टम एक "कोड-एज़-पॉलिसी" फ्रेमवर्क पर बना है, जिसका अर्थ है कि रोबोट अपनी गतिविधियों को नियंत्रित करने के लिए निष्पादन योग्य कंप्यूटर कोड उत्पन्न करता है, जिससे यह मनुष्यों की तरह कार्यों के अनुक्रम की योजना बनाने के माध्यम से जटिल चरणों के माध्यम से तर्क करने में सक्षम होता है। जो PhysCaP को अद्वितीय बनाता है वह इसमें एक 'फिजिक्स-इन्फॉर्म्ड एक्सप्लोरेशन लेयर' (भौतिकी-आधारित अन्वेषण परत) का जुड़ना है। यह परत रोबोट को अपने स्वयं के मोटर्स और जोड़ों से प्राप्त फीडबैक का उपयोग करके द्रव्यमान (mass) और कठोरता (stiffness) जैसी विशेषताओं का अनुमान लगाने की अनुमति देती है, जिसके लिए स्पर्श-संवेदनशील त्वचा या तराजू जैसे विशेष सेंसरों की आवश्यकता नहीं होती है।
इस नए सिस्टम का मूल एक 'डुअल-एजेंट' डिज़ाइन है जो बहुत जल्दी कार्य करने या समय बर्बाद करने के बीच के नाजुक संतुलन को प्रबंधित करता है। एक एजेंट, 'प्लानर' (Planner), दृश्य को देखता है और निर्णय लेता है कि क्या रोबोट के पास काम पूरा करने के लिए पर्याप्त जानकारी है। यदि जानकारी गायब है, तो प्लानर इसे खोजने के लिए संभावित कार्यों की एक सूची बनाता है। दूसरा एजेंट, 'प्रायोरिटाइज़र' (Prioritizer), इस सूची की समीक्षा करता है और दृश्य संकेतों के आधार पर कार्यों को रैंक करता है। उदाहरण के लिए, यदि कार्य चार कैनों में से एक खाली सोडा कैन खोजना है, तो प्रायोरिटाइज़र देखता है कि दो कैन सीलबंद हैं और दो में स्ट्रॉ (straw) लगी हुई है। यह तार्किक रूप से निष्कर्ष निकालता है कि सीलबंद कैन संभवतः भरे हुए होंगे और खुले कैनों की जांच करने को प्राथमिकता देता है। यह रोबंबोट को उन वस्तुओं पर ऊर्जा बर्बाद करने से रोकता है जिनमें उत्तर होने की संभावना कम होती है। एक बार जब रोबोट पर्याप्त साक्ष्य एकत्र कर लेता है, तो सिस्टम अन्वेषण करना बंद कर देता है और अंतिम कार्य को निष्पादित करता है।
इस विचार का परीक्षण करने के लिए, शोधकर्ताओं ने एक वास्तविक दुनिया की मेज पर तीन अलग-अलग चुनौतियाँ स्थापित कीं। एक कार्य में, तीन कपों के नीचे एक नीला क्यूब छिपा हुआ था, लेकिन एक कप क्यूब को रखने के लिए बहुत छोटा था। केवल दृष्टि पर भरोसा करने वाला रोबोट हर कप को उठा सकता था, लेकिन PhysCaP ने अपने तर्क का उपयोग करके आकार के अंतर को देखा और असंभव कप को छोड़कर केवल व्यवहार्य उम्मीदवारों को उठाया। दूसरे कार्य में, रोबोट को चार कैनों में से एक अकेला खाली सोडा कैन खोजना था। मोटर फीडबैक के माध्यम से वजन मापने की अपनी क्षमता का उपयोग करते हुए, इसने सफलतापूर्वक खाली कैन की पहचान की। तीसरे कार्य में, इसे हरे और गहरे रंग के एवोकैडो के समूह में से एक पका हुआ एवोकैडो चुनना था। गहरे रंग के एवोकैडो को दबाकर उनकी दृढ़ता को मापने के लिए, इसने पके हुए एवोकैडो को चुना और सख्त, कच्चे फल को अनदेखा कर दिया। इन सभी परिदृश्यों में, सिस्टम वहां सफल रहा जहां अन्य तरीके विफल रहे। केवल दृष्टि पर निर्भर रहने वाले रोबोट इन कार्यों को हल नहीं कर सके क्योंकि वे छिपे हुए गुणों को नहीं देख सकते थे। वे रोबोट जो गुणों को माप सकते थे लेकिन उन्हें प्राथमिकता देने के तर्क की कमी थी, वे हर एक वस्तु की जांच करने में लग गए, जिससे अधिक समय और ऊर्जा खर्च हुई।
परिणामों ने दिखाया कि PhysCaP अपने प्रतिस्पर्धियों की तुलना में बहुत कम वस्तुओं के साथ इन कार्यों को उच्च सफलता दर के साथ पूरा कर सकता है। वास्तविक दुनिया के परीक्षणों में, सिस्टम ने बिना किसी भेदभाव के सब कुछ जांचने वाले सिस्टमों की तुलना में काफी कम शारीरिक स्पर्शों और कम समय में छिपे हुए क्यूब, खाली कैन और पके हुए एवोकैडो को खोज लिया। शोधकर्ताओं ने यह देखने के लिए सिमुलेशन भी चलाए कि डिजिटल वातावरण में यह सिस्टम कैसा प्रदर्शन करेगा, और परिणाम सत्य सिद्ध हुए: वह सिस्टम जो यह तर्क करने में सक्षम था कि क्या मापना है और कब रुकना है, उसने उन मॉडलों से बेहतर प्रदर्शन किया जो केवल अनुमान लगाने या सब कुछ जांचने की कोशिश करते थे। यह अध्ययन पुष्टि करता है कि रोबोटों के लिए वास्तव में अव्यवस्थित, अप्रत्याशित वास्तविक दुनिया में काम करने के लिए, उन्हें उन भौतिक सत्यों को सक्रिय रूप से खोजने में सक्षम होना चाहिए जिन्हें केवल दृष्टि प्रकट नहीं कर सकती। रोबोटों को सही प्रश्न पूछने और भौतिक दुनिया द्वारा दिए गए उत्तरों को सुनने की क्षमता देकर, यह शोध हमें ऐसी मशीनों के करीब ले जाता है जो मानव जीवन की सूक्ष्म, स्पर्श संबंधी जटिलताओं को संभाल सकती हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।