Decoupling Planning and Control for Instructable Agents
यह शोध पत्र Instruct-to-Act को प्रस्तुत करता है, जो एक विखंडित (decoupled) ढांचा है जो विविध एकल और बहु-एजेंट वातावरणों में सुदृढ़, कम-विलंबता वाले एम्बॉडीड नियंत्रण (embodied control) को प्राप्त करने के लिए विजन-लैंग्वेज मॉडल से उच्च-स्तरीय योजना को तेज़, भाषा-सशर्त वर्ल्ड-मॉडल कंट्रोलर्स के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, सोचने और करने के बीच एक निरंतर विभाजन बना रहता है। एक तरफ, हमारे पास लार्ज लैंग्वेज मॉडल्स (LLMs) हैं, जो जटिल निर्देशों को पढ़ने, एक लक्ष्य को समझने और उसे तार्किक चरणों के क्रम में तोड़ने में सक्षम प्रणालियाँ हैं। ये मॉडल उच्च-स्तरीय तर्क करने में उत्कृष्ट हैं, बिल्कुल वैसे ही जैसे कोई इंसान निर्देश देता है, लेकिन वे वास्तविक या आभासी दुनिया में नेविगेट करने के लिए आवश्यक क्षणिक शारीरिक गतिविधियों को करने में अक्सर बहुत धीमे और अनाड़ी होते हैं। दूसरी ओर, हमारे पास विशिष्ट नियंत्रण प्रणालियाँ (specialized control systems) हैं जो अपने परिवेश के प्रति तुरंत प्रतिक्रिया दे सकती हैं, गति और सटीकता के साथ कार्य कर सकती हैं, लेकिन उनमें अमूर्त लक्ष्यों को समझने या बातचीत का पालन करने की क्षमता का अभाव होता है। वे एक अत्यधिक कुशल एथलीट की तरह हैं जो तेज़ी से दौड़ तो सकता है, लेकिन बिना किसी कोच द्वारा विशिष्ट आदेश चिल्लाए यह नहीं जानता कि कहाँ जाना है। किसी रोबोट या डिजिटल एजेंट के लिए जटिल, परिवर्तनशील वातावरण में वास्तव में उपयोगी होने के लिए, उसमें योजना बनाने की क्षमता और कार्य करने की क्षमता दोनों का होना आवश्यक है, फिर भी इन दो अलग-अलग क्षमताओं को संयोजित करना ऐतिहासिक रूप से एक कठिन इंजीनियरिंग चुनौती रही है।
शोधकर्ताओं की एक टीम ने 'इंस्ट्रक्ट-टू-एक्ट' (Instruct-to-Act) नामक एक नई प्रणाली के साथ इस विभाजन को संबोधित किया है, जो योजना बनाने के कार्य को नियंत्रण करने के कार्य से सफलतापूर्वक अलग करती है। एक ही विशाल मॉडल को सब कुछ एक साथ करने के लिए मजबूर करने के बजाय, उन्होंने दो विशिष्ट घटकों के बीच एक साझेदारी बनाई है। पहला एक 'प्लानर' (planner) है, जो एक पूर्व-प्रशिक्षित विजन-लैंग्वेज मॉडल का उपयोग करके वातावरण और उपयोगकर्ता के लक्ष्य को देखता है, और फिर एक सरल, उच्च-स्तरीय निर्देश लिखता है। दूसरा एक 'कंट्रोलर' (controller) है, जो एक हल्का सिस्टम है जिसे विशेष रूप से उन निर्देशों को लेने और उन्हें भौतिक क्रियाओं के एक तीव्र प्रवाह में बदलने के लिए प्रशिक्षित किया गया है। मुख्य नवाचार यह है कि ये दोनों भाग स्वतंत्र रूप से लेकिन तालमेल में काम करते हैं। प्लानर सोचने, तर्क करने और यहाँ तक कि अन्य एजेंटों के साथ संवाद करने के लिए समय ले सकता है, जबकि कंट्रोलर उच्च गति के साथ आवश्यक गतिविधियों को निष्पादित करता है, बिना प्लानर के हर एक विचार को पूरा करने की प्रतीक्षा किए। यह डिज़ाइन सिस्टम को वीडियो गेम और सिम्युलेटेड दुनिया में जटिल, दीर्घकालिक कार्यों को उस स्तर की गति और विश्वसनीयता के साथ संभालने की अनुमति देता है जो पिछले प्रयासों में संभव नहीं था।
शोधकर्ताओं ने क्लासिक आर्केड गेम्स से लेकर जटिल सहयोगात्मक परिदृश्यों तक, सात अलग-अलग वातावरणों में इस दृष्टिकोण का परीक्षण किया, जहाँ कई एजेंटों को मिलकर काम करना होता है। इन परीक्षणों में, प्लानर एक मस्तिष्क के रूप में कार्य करता है, जो दुनिया का अवलोकन करता है और तय करता है कि आगे क्या करने की आवश्यकता है, जबकि कंट्रोलर हाथ और पैर के रूप में कार्य करता है, जो वास्तविक समय में योजना को क्रियान्वित करता है। कंट्रोलर को इन निर्देशों का पालन करना सिखाने के लिए, शोधकर्ताओं ने हर चाल का प्रदर्शन करने के लिए मानव विशेषज्ञों पर भरोसा नहीं किया। इसके बजाय, उन्होंने प्लानर का ही उपयोग किया ताकि वह कंट्रोलर की सफल क्रियाओं को देख सके और सारांश लिख सके कि क्या हो रहा था। इस प्रक्रिया ने कंट्रोलर को यह सीखने में मदद की कि कैसे अस्पष्ट, प्राकृतिक भाषा के आदेशों को सटीक, निम्न-स्तरीय गतिविधियों में अनुवादित किया जाए। परिणाम एक ऐसा सिस्टम है जिसे बिना पुन: प्रशिक्षित किए विभिन्न प्लानर्स के साथ जोड़ा जा सकता है, जिससे यह अत्यधिक लचीला बन जाता है।
निष्कर्ष बताते हैं कि कर्तव्यों का यह पृथक्करण उल्लेखनीय रूप से प्रभावी है। जब शोधकर्ताओं ने अपने सिस्टम की तुलना उन अन्य प्रणालियों से की जो सीधे लार्ज लैंग्वेज मॉडल से क्रियाएं उत्पन्न करने का प्रयास करती हैं, तो उनका दृष्टिकोण काफी तेज़ और अधिक सटीक था। प्रत्यक्ष पीढ़ी (direct generation) विधियाँ अक्सर लड़खड़ा जाती थीं, ऐसी क्रियाएं उत्पन्न करती थीं जो तत्काल स्थिति के लिए बहुत धीमी या अप्रासंगिक होती थीं। इसके विपरीत, 'इंस्ट्रक्ट-टू-एक्ट' सिस्टम ने जटिल निर्देशों का पालन करते हुए भी निष्पादन की उच्च गति बनाए रखी। मल्टी-एजेंट परीक्षणों में, जहाँ दो या अधिक डिजिटल पात्रों को पहेलियाँ सुलझाने के लिए समन्वय करना था, सिस्टम ने उन्हें भाषा के माध्यम से संवाद करने, भूमिकाओं पर बातचीत करने और एक-दूसरे के रास्ते में आए बिना साझा लक्ष्यों को प्राप्त करने की अनुमति दी। सिस्टम ने सात में से छह वातावरणों में सबसे मजबूत मौजूदा तरीकों के मुकाबले प्रतिस्पर्धी प्रदर्शन किया, जिससे यह सिद्ध हुआ कि एक डीकप्ल्ड (decoupled) दृष्टिकोण उच्च-स्तरीय तर्क और लो-लेटेंसी नियंत्रण दोनों की मांगों को संभाल सकता है।
इस कार्य का सबसे आकर्षक पहलू इसकी दक्षता है। क्योंकि कंट्रोलर एक छोटा, विशिष्ट मॉडल है, यह दृश्य जानकारी को संसाधित कर सकता है और प्रति सेकंड हजारों बार क्रियाएं जारी कर सकता है, जबकि प्लानर बैकग्राउंड में चलता रहता है, और केवल आवश्यकता होने पर ही अपनी रणनीति को अपडेट करता है। इसका अर्थ है कि सिस्टम लार्ज लैंग्वेज मॉडल के धीमे प्रसंस्करण समय के कारण बाधित नहीं होता है। शोधकर्ताओं ने पाया कि इस एसिंक्रोनस सेटअप ने एजेंटों को प्रभावी ढंग से स्केल करने की अनुमति दी; जैसे-जैसे उन्होंने सहयोगात्मक कार्य में अधिक एजेंट जोड़े, सिस्टम ने अपने प्रदर्शन को बनाए रखा, जो उन संचार बाधाओं से मुक्त था जो अक्सर अन्य मल्टी-एजेंट सिस्टम में देखी जाती हैं। कंट्रोलर विश्वसनीय रहा, जिसने विभिन्न कार्यों और प्लानर्स के बीच 86% से 97% की सटीकता दर के साथ निर्देशों का पालन किया, जो दर्शाता है कि सिस्टम ने केवल विशिष्ट वाक्यांशों को याद करने के बजाय शब्दों के पीछे के इरादे को समझना सीख लिया है।
अध्ययन ने यह भी पता लगाया कि निर्देशों की गुणवत्ता परिणाम को कैसे प्रभावित करती है। उन्होंने पाया कि भले ही निर्देश अलग-अलग प्लानर्स द्वारा उत्पन्न किए गए हों या उनकी जटिलता भिन्न हो, कंट्रोलर अनुकूलित हो सकता है और अच्छा प्रदर्शन कर सकता है। यह सुझाव देता है कि सिस्टम ने भाषा की व्याख्या करने का एक मजबूत तरीका सीख लिया है, न कि केवल कमांड के एक विशिष्ट सेट को याद किया है। शोधकर्ताओं ने नोट किया कि सिस्टम तब सबसे अच्छा काम करता है जब निर्देश स्पष्ट और तत्काल स्थिति पर आधारित होते हैं, लेकिन यह पिछले तरीकों की तुलना में अस्पष्टता को बेहतर ढंग से संभाल सकता है। प्लानिंग और कंट्रोल लेयर्स को अलग रखकर, शोधकर्ताओं ने एक ऐसा ढांचा बनाया है जो न केवल शक्तिशाली है बल्कि मॉड्यूलर भी है, जिससे उन्हें कार्य की विशिष्ट आवश्यकताओं के आधार पर विभिन्न प्लानर्स या कंट्रोलर्स को बदलने की अनुमति मिलती है।
अंततः, यह कार्य वास्तविक दुनिया में संचालित होने वाले बुद्धिमान एजेंट बनाने के लिए एक व्यावहारिक मार्ग प्रदर्शित करता है। यह स्वीकार करते हुए कि सोचने और कार्य करने के लिए अलग-अलग गति और अलग-अलग प्रकार की बुद्धिमत्ता की आवश्यकता होती है, शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो दोनों की ताकत का लाभ उठाती है। प्लानर दृष्टि और रणनीति प्रदान करता है, जबकि कंट्रोलर गति और सटीकता प्रदान करता है। यह दृष्टिकोण एक ही मॉडल से सब कुछ कराने की कोशिश करने के दोषों से बचता है, जिसके परिणामस्वरूप एक ऐसा सिस्टम मिलता है जो स्मार्ट भी है और तेज़ भी। जैसे-जैसे शोधकर्ता आगे बढ़ रहे हैं, वे इसे अधिक जटिल परिदृश्यों, जिसमें मानव-रोबोट सहयोग और गतिशील वातावरण में दीर्घकालिक योजना बनाने वाले कार्य शामिल हैं, में लागू करने की संभावना देखते हैं। 'इंस्ट्रक्ट-टू-एक्ट' की सफलता यह सुझाव देती है कि एम्बॉडीड एआई (embodied AI) का भविष्य बड़े, मोनोलिथिक मॉडल बनाने में नहीं, बल्कि विभिन्न प्रकार की बुद्धिमत्ता के बीच स्मार्ट, अधिक कुशल साझेदारी को डिजाइन करने में निहित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।