Ludi: An Agentic System for Socially Intelligent Robots
यह शोध पत्र Ludi को प्रस्तुत करता है, जो एक एजेंटिक सिस्टम है जो एक फाइन-ट्यून्ड विजन-लैंग्वेज मॉडल को विशिष्ट नेविगेशन और मैनिपुलेशन टूल्स के साथ जोड़ता है ताकि सामाजिक रूप से बुद्धिमान रोबोट्स को संदर्भ-जागरूक तर्क और अनुकूलन योग्य व्यवहार के माध्यम से अस्पष्ट, बहु-चरण मानवीय अंतःक्रियाओं को संभालने में सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
द दशकों से, एक सहायक रोबोट का सपना एक सरल वास्तविकता द्वारा सीमित रहा है: मशीनें सख्त निर्देशों का पालन करने में उत्कृष्ट हैं लेकिन मानवीय बातचीत की जटिल और परिवर्तनशील प्रकृति को समझने में बहुत खराब हैं। यदि आप एक पारंपरिक रोबोट को "मुझे लाल कैन ला दो" कहते हैं, तो वह लाल कैन को खोज लेगा और ले आएगा, भले ही प्रक्रिया के बीच में ही आप अपना मन बदल लें। इसमें वह सामाजिक बुद्धिमत्ता की कमी है जिससे यह महसूस हो सके कि आपकी मंशा विकसित हो गई है, अपनी क्रिया को रोका जा सके, और नई जानकारी के आधार पर अपने व्यवहार को अनुकूलित किया जा सके। प्रोग्रामिंग की कठोरता और तरल मानवीय अंतःक्रिया के बीच का यह अंतर केंद्रीय चुनौती है जिसे शोधकर्ता अब हल करने की कोशिश कर रहे हैं। क्षेत्र अब केवल रोबोट को देखने और चलने के लिए सिखाने से आगे बढ़ रहा है; नया लक्ष्य उन्हें सुनना, याद रखना, तर्क करना और वास्तविक समय में अपना विचार बदलना सिखाना है, ठीक वैसे ही जैसे लोग मिलकर काम करते समय करते हैं।
Ludo Robotics की एक टीम ने Ludi0.1 नामक एक नए सिस्टम के साथ इस लक्ष्य की ओर एक महत्वपूर्ण कदम उठाया है। यह एक एकल सॉफ्टवेयर का टुकड़ा नहीं है जो एक साथ सब कुछ करने की कोशिश करता है, बल्कि एक केंद्रीय "मस्तिष्क" के मार्गदर्शन में काम करने वाले विशिष्ट उपकरणों की एक समन्वित टीम है। यह मस्तिष्क एक प्रकार का आर्टिफिशियल इंटेलिजेंस है जिसे छवियों और भाषा दोनों को समझने के लिए प्रशिक्षित किया गया है, लेकिन इसे विशेष रूप से वास्तविक बातचीत के उतार-चढ़ाव को संभालने के लिए सिखाया गया है। शोधकर्ताओं ने एक ऐसा सिस्टम बनाया है जहाँ यह मस्तिष्क देख सकता है कि वह क्या देख रहा है, सुन सकता है कि एक व्यक्ति क्या कह रहा है, याद रख सकता है कि एक क्षण पहले क्या हुआ था, और फिर यह तय कर सकता है कि बोलना है, हिलना है, कुछ उठाना है, या प्रतीक्षा करनी है। मुख्य नवाचार यह है कि सिस्टम को व्यवधानों और सुधारों को संभालने के लिए डिज़ाइन किया गया है। यदि कोई व्यक्ति कोक (Coke) माँगना शुरू करता है, और रोबोट उसे उठाने के लिए हाथ बढ़ाता है, लेकिन अचानक व्यक्ति कहता है, "दरअसल, उसे पेप्सी (Pepsi) पसंद है," तो Ludi0.1 समझ जाता है कि पुराना प्लान अब मान्य नहीं है। यह कोक की ओर हाथ बढ़ाना बंद कर देता है, अपना ध्यान पेप्सी की ओर मोड़ देता है, और नए निर्देश के साथ कार्य को जारी रखता है, और यह सब अंतःक्रिया के प्रवाह को तोड़े बिना करता है।
इसे बनाने के लिए, शोधकर्ताओं ने किसी एक विशाल मॉडल पर भरोसा नहीं किया जो सब कुछ शून्य से सीखने की कोशिश करता है। इसके बजाय, उन्होंने एक ऐसी संरचना बनाई जहाँ एक केंद्रीय तर्क मॉडल (reasoning model) एक प्रबंधक के रूप में कार्य करता है। यह प्रबंधक सूचनाओं की एक धारा प्राप्त करता है: रोबोट की आँखों से लाइव वीडियो फीड, जो इंसान ने अभी कहा उसका टेक्स्ट, और वह सब कुछ जो रोबोट ने अब तक किया या सोचा है उसका रिकॉर्ड। इस पूर्ण चित्र के आधार पर, प्रबंधक तय करता है कि अगला कौन सा टूल उपयोग करना है। ये उपकरण विशिष्ट कार्यों के लिए विशेष प्रोग्राम हैं, जैसे कि यह जांचना कि कोई वस्तु हाथ की पहुँच के भीतर है या नहीं, बेडरूम जैसे नामित कमरे तक जाना, या वास्तव में किसी वस्तु को पकड़ना। प्रबंधक स्पष्टीकरण के लिए प्रश्न पूछने का निर्णय ले सकता है, या वह डेस्क तक जाने का निर्णय ले सकता है। महत्वपूर्ण रूपamente, सिस्टम को रोबोट से जुड़े ऑनसाइट GPU वर्कस्टेशन पर स्थानीय रूप से चलाने के लिए बनाया गया है, जिसका अर्थ है कि इसे सोचने या कार्य करने के लिए इंटरनेट कनेक्शन का इंतजार करने की आवश्यकता नहीं है। यह रोबोट को तुरंत प्रतिक्रिया करने की अनुमति देता है, यहाँ तक कि बोलते या चलते समय भी।
टीम ने इस सिस्टम का परीक्षण Unitree G1 पर किया, जो एक मानवोïde रोबोट है जो एक व्यक्ति की तरह खड़ा होता है और चलता है। उन्होंने रोबोट को प्रशिक्षित करने के लिए घर के वातावरण का एक सिमुलेशन बनाया, जिसमें जटिल अंतःक्रियाओं के हजारों उदाहरण उत्पन्न किए गए। इन प्रशिक्षण परिदृश्यों में, रोबोट ने अस्पष्ट अनुरोधों को संभालने, कार्य के बीच में सुधारों को संभालने और बहु-चरणीय कार्यों को प्रबंधित करने का अभ्यास किया। उदाहरण के लिए, रोबोट ने सीखा कि यदि कोई उपयोगकर्ता कहता है "बीच वाला लैपटॉप लाओ," तो उसे उठाने से पहले उसे यह पहचानना होगा कि कौन सा लैपटॉप बीच में है। प्रशिक्षण डेटा में ऐसी स्थितियाँ शामिल थीं जहाँ उपयोगकर्ता ने अपना मन बदला, रोबोट को बीच में रोका, या रोबोट के कार्य करने के दौरान नई जानकारी प्रदान की। शोधकर्ताओं ने पाया कि इन विशिष्ट अंतःक्रिया पैटर्न पर अपने केंद्रीय तर्क मॉडल को फाइन-ट्यून करके, रोबोट कार्य को सफलतापूर्वक पूरा करने में बहुत बेहतर हो गया। अपने परीक्षणों में, सिस्टम ने 28 जटिल परिदृश्यों में से 20 को एंड-टू-एंड पूरा किया, जो उसी मॉडल के अनप्रशिक्षित संस्करण की तुलना में एक महत्वपूर्ण सुधार है।
Ludi0.1 की सफलता इसकी बातचीत और भौतिक क्रिया को एक ही वास्तविकता में बनाए रखने की क्षमता में निहित है। रोबोट केवल शब्द नहीं बोलता; वह ऐसे शब्द बोलता है जो सीधे तौर पर उससे जुड़े होते हैं जो वह देख रहा है और जो वह कर रहा है। यदि रोबोट किसी कमरे की ओर जा रहा है, तो वह बता सकता है कि वह कहाँ जा रहा है। यदि वह किसी वस्तु तक नहीं पहुँच सकता, तो वह ईमानदारी से ऐसा कह सकता है। सिस्टम अंतःक्रिया का एक साझा इतिहास बनाए रखता है, जिससे इसे यह याद रखने में मदद मिलती है कि उपयोगकर्ता मूल रूप से कोक चाहता था लेकिन फिर उसने पेप्सी में बदलाव किया। यह स्मृति केवल तथ्यों की सूची नहीं है; यह एक जीवंत संदर्भ है जो रोबोट द्वारा लिए जाने वाले प्रत्येक नए निर्णय को आकार देता है। शोधकर्ताओं ने इसे एक वास्तविक दुनिया के परीक्षण में प्रदर्शित किया जहाँ एक उपयोगकर्ता ने रोबोट से बेडरूम में एक व्यक्ति को ड्रिंक लाने के लिए कहा। जब उपयोगकर्ता ने रोबोट द्वारा पहले कैन की ओर हाथ बढ़ाते समय ही कोक से पेप्सी में ऑर्डर को सुधारा, तो रोबोट तुरंत रुक गया, सही ड्रिंक की ओर मुड़ा, बेडरूम तक गया, और डेस्क पर ड्रिंक रख दी, और यह सब उपयोगकर्ता को अपनी क्रियाओं के बारे में समझाते हुए किया।
हालाँकि सिस्टम प्रभावशाली है, शोधकर्ता इसकी वर्तमान सीमाओं के बारे में स्पष्ट हैं। रोबोट की बुद्धिमत्ता एक केंद्रीय मस्तिष्क और अलग-अलग, विशिष्ट उपकरणों का मिश्रण है। मस्तिष्क तय करता है कि क्या करना है, और उपकरण काम करते हैं, लेकिन वे अभी तक एक एकल, एकीकृत मन नहीं हैं। यह अलगाव कभी-कभी देरी का कारण बन सकता है या रोबोट के व्यवहार को थोड़ा खंडित महसूस करा सकता है, जैसे कि सिस्टम के विभिन्न हिस्से एक होने के बजाय एक-दूसरे से बात कर रहे हों। टीम स्वीकार करती है कि अगला कदम इस मॉड्यूलर दृष्टिकोण से आगे बढ़ना है। वे एक भविष्य के संस्करण, Ludi 1.0 की दिशा में काम कर रहे हैं, जो एक एकल फाउंडेशन मॉडल होगा जो धारणा (perception), भाषा, स्मृति और भौतिक नियंत्रण को एक सुसंगत प्रणाली में गहराई से एकीकृत करेगा। फिलहाल, Ludi0.1 एक वर्किंग प्रोटोटाइप और मूल्यवान डेटा का स्रोत है। रोबोट कैसे लोगों के साथ अंतःक्रिया करता है, इसका अवलोकन करके, शोधकर्ता उस प्रकार के वास्तविक दुनिया के निशान एकत्र कर रहे हैं जो अगली पीढ़ी के वास्तव में एकीकृत सामाजिक रोबोटों को प्रशिक्षित करने के लिए आवश्यक हैं।
इस पेपर में प्रस्तुत कार्य यह प्रदर्शित करता है कि सहज मानव-रोबोट सहयोग आज संभव है, बशर्ते सिस्टम को मानवीय इरादे की अनिश्चितता को संभालने के लिए डिज़ाइन किया गया हो। शोधकर्ताओं ने दिखाया है कि एक तर्क केंद्र (reasoning core) को विशिष्ट भौतिक कौशल और अंतःक्रिया की एक मजबूत स्मृति के साथ जोड़कर, एक रोबकट कार्य के बीच में होने वाले परिवर्तनों के अनुकूल हो सकता है। यह कोई सुलझी हुई समस्या नहीं है, और वर्तमान सिस्टम अभी भी एक पूरी तरह से सीखे हुए, एकीकृत बुद्धिमत्ता के बजाय एक संरचित वास्तुकला पर निर्भर करता है। हालाँकि, परिणाम एक स्पष्ट मार्ग सुझाते हैं। रुकने, सुनने, संशोधन करने और जारी रखने की क्षमता अब केवल एक सैद्धांतिक अवधारणा नहीं है; यह एक ऐसी क्षमता है जिसे अभी बनाया और परखा जा सकता है। जैसे-जैसे टीम इन प्रणालियों को परिष्कृत करना जारी रखती है, अतीत की कठोर मशीनों और भविष्य के सहयोगी भागीदारों के बीच का अंतर कम होता जा रहा है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।