ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction
RelI एक क्रॉस-लिंगुअल फ्रेमवर्क है जो बड़े पैमाने के फाउंडेशन मॉडल्स को अनुकूलित करता है ताकि स्वायत्त एजेंटों को 140 से अधिक विविध भाषाओं, जिनमें कम-संसाधन वाली और क्रीओल किस्में भी शामिल हैं, में प्राकृतिक भाषा के निर्देशों को समझने, अर्थपूर्ण रूप से तर्क करने और कार्यों को प्रभावी ढंग से निष्पादित करने में सक्षम बनाया जा सके, जिससे मौजूदा उच्च-संसाधन भाषा-केंद्रित प्रणालियों की सीमाओं को दूर किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक ऐसी दुनिया की कल्पना करें जहाँ एक रोबोट किसी भी भाषा में दिए गए आदेश को समझ सकता है, सबसे व्यापक रूप से बोली जाने वाली भाषाओं से लेकर छोटे समुदायों द्वारा बोली जाने वाली दुर्लभ बोलियों तक। दशकों से, स्वाभाविक मानव-रोबोट सहयोग का सपना एक सरल बाधा के कारण रुका हुआ था: भाषा। जबकि आधुनिक रोबोट अपने परिवेश को देखने और उसमें चलने में तेजी से सक्षम हो रहे हैं, उन्हें मुख्य रूप से केवल कुछ प्रमुख भाषाओं, जैसे अंग्रेजी या मैंडरिन को समझने के लिए प्रशिक्षित किया गया है। यह सीमा उन अरबों संभावित उपयोगकर्ताओं को बाहर कर देती है जो अन्य भाषाएं, बोलियां या क्रीओल (creoles) बोलते हैं, जिससे वे प्रभावी रूप से स्वचालन (automation) के भविष्य से वंचित रह जाते हैं। मानव-रोबोट संपर्क का क्षेत्र बोले गए या लिखे गए अनुरोध को एक भौतिक क्रिया में अनुवाद करने की क्षमता पर निर्भर करता है, जिसे 'ग्राउंडिंग' (grounding) कहा जाता है। अब तक, यह अनुवाद एकतरफा रहा है, जो केवल उच्च-संसाधन वाली भाषाओं तक पहुंच रखने वालों के लिए ही अच्छी तरह से काम करता था, जिससे बाकी दुनिया पीछे छूट गई थी।
शोधकर्ताओं की एक टीम ने ReLI नामक एक नई प्रणाली विकसित की है, जिसे इन भाषाई दीवारों को तोड़ने के लिए डिज़ाइन किया गया है। ReLI स्वायत्त एजेंटों (autonomous agents) को स्वाभाविक रूप से बातचीत करने, अपने परिवेश के बारे में तर्क करने और इस बात की परवाह किए बिना कार्य निष्पादित करने की अनुमति देता है कि निर्देश किस भाषा में दिया गया है। यह प्रणाली उपयोगकर्ता के भाषण को पहले अंग्रेजी में अनुवाद करने पर निर्भर नहीं करती है, और न ही इसके लिए प्रत्येक नई भाषा के लिए रोबोट को पुन: प्रशिक्षित करने की आवश्यकता होती है। इसके बजाय, यह सैकड़ों अलग-अलग भाषाओं में शब्दों के पीछे के अर्थ को समझने की बड़े पैमाने पर पूर्व-प्रशिक्षित कंप्यूटर मॉडलों की अंतर्निहित क्षमता का लाभ उठाती है। इन भाषा मॉडलों को विजुअल सेंसरों के साथ जोड़कर, जो रोबोट को वस्तुओं और स्थानों को "देखने" की अनुमति देते हैं, ReLI एक दुर्लभ बोली में बोले गए "लाल कुर्सी ढूंढो" जैसे आदेश को एक सटीक भौतिक गति में बदल सकता है, और वह भी बिना उपयोगकर्ता को किसी तकनीकी कोड को जानने या किसी प्रमुख वैश्विक भाषा को बोलने की आवश्यकता के।
शोधकर्ताओं ने सिम्युलेटेड वातावरण और वास्तविक दुनिया में पहिए वाले रोबots और कैमरों तथा डेप्थ सेंसरों से लैस चार पैरों वाले मशीनों का उपयोग करके इस प्रणाली का परीक्षण किया। उन्होंने रोबोटों को 140 से अधिक विभिन्न भाषाओं में 70,000 से अधिक बहु-चरणीय (multi-turn) बातचीतों के साथ चुनौती दी। इन भाषाओं को दुनिया की भाषाई विविधता के एक विस्तृत स्पेक्ट्रम का प्रतिनिधित्व करने के लिए सावधानीपूर्वक चुना गया था, जिसमें उच्च-संसाधन वाली भाषाएं (जिनके पास विशाल डिजिटल डेटा है), कम-संसाधन वाली भाषाएं (सीमित डेटा वाली), और संवेदनशील या क्रीओल भाषाएं शामिल थीं जिन्हें अक्सर तकनीक द्वारा अनदेखा किया जाता है। कार्य सरल, एकल-चरण के आदेशों, जैसे कि एक विशिष्ट दूरी तक आगे बढ़ना, से लेकर जटिल, बहु-चरणीय मिशनों तक विस्तृत थे जिनमें रोबोट को एक कमरे के माध्यम से नेविगेट करने, एक विवरण के आधार पर वस्तु की पहचान करने और यह रिपोर्ट करने की आवश्यकता थी कि उसने क्या पाया।
परिणामों ने इस विशाल भाषाई परिदृश्य में उल्लेखनीय निरंतरता के साथ प्रणाली के प्रदर्शन को दिखाया। परीक्षण की गई लगभग सभी भाषाओं में, रोबोट ने उपयोगकर्ता के इरादे को सही ढंग से समझा और कार्य को सफलतापूर्वक निष्पादित किया, जिसकी सफलता दर 83 प्रतिशत से अधिक रही। कई सबसे सामान्य भाषाओं के लिए, सफलता दर 97 प्रतिशत से ऊपर पहुंच गई। सबसे संवेदनशील और कम-संसाधन वाली भाषाओं के लिए भी, प्रणाली ने उच्च स्तर की सटीकता बनाए रखी, निर्देशों को सफलतापूर्वक पार्स (parse) किया और रोबोट को उसके लक्ष्य तक निर्देशित किया। कमांड को प्रोसेस करने और रोबोट के हिलना शुरू करने में लगने वाला समय स्थिर रहा, जो कि चाहे निर्देश किसी प्रमुख विश्व भाषा में दिया गया हो या किसी दुर्लभ बोली में, औसत 2.1 और 2.6 सेकंड के बीच रहा। यह गति और विश्वसनीयता बताती है कि यह प्रणाली केवल एक सैद्धांतिक अवधारणा नहीं है बल्कि वास्तविक समय में कार्य करने में सक्षम एक व्यावहारिक उपकरण है।
यह सुनिश्चित करने के लिए कि तकनीक वास्तव में समावेशी हो, शोधकर्ताओं ने मानव प्रतिभागियों के साथ एक अध्ययन भी किया जिन्होंने अपनी मातृभाषाओं में रोबोट के साथ बातचीत की। 13 अलग-अलग भाषाओं में पारंगत 34 रेटर्स (raters) ने एक वास्तविक प्रयोगशाला सेटिंग में प्रणाली का परीक्षण किया। उन्होंने बताया कि बातचीत स्वाभाविक और उत्तरदायी महसूस हुई, और विशाल बहुमत ने यह नोट किया कि उन्हें उपयोग की गई भाषा के आधार पर प्रदर्शन में कोई अंतर महसूस नहीं हुआ। यह निष्कर्ष महत्वपूर्ण है, क्योंकि यह दर्शाता है कि प्रणाली किसी एक भाषा का पक्ष नहीं लेती है, और न ही यह एक ऐसा छिपा हुआ अंतर पैदा करती है जहाँ कुछ भाषाओं के उपयोगकर्ताओं को खराब अनुभव प्राप्त होता है। प्रणाली ने 'कोड-स्विचिंग' को सफलतापूर्वक संभाला, जहाँ एक उपयोगकर्ता एक ही वाक्य में दो अलग-अलग भाषाओं के शब्दों को मिला सकता है, और इसने जटिल स्थानिक तर्क (spatial reasoning) को प्रबंधित किया, जैसे कि केवल एक कार्य के आधार पर वर्णित स्थान तक नेविगेट करना, जैसे कि "वह स्थान जहाँ भोजन पकाया जाता है।"
इस उपलब्धि का मूल यह है कि प्रणाली भाषा को क्रिया से कैसे जोड़ती है। जब कोई उपयोगकर्ता कमांड बोलता या टाइप करता है, तो प्रणाली पहले इनपुट को सामान्य (normalize) करती है, यदि आवश्यक हो तो भाषण को टेक्स्ट में परिवर्तित करती है, और फिर इसे एक बड़े भाषा मॉडल को भेजती है जो रोबोट के मस्तिष्क के रूप में कार्य करता है। यह मॉडल कमांड के इरादे की व्याख्या करता है, इसे तार्किक चरणों के क्रम में तोड़ता है। फिर यह कमांड में उल्लेखित वस्तुओं और स्थानों की पहचान करने के लिए रोबोट के विजुअल सेंसरों से परामर्श करता है। यदि कोई उपयोगकर्ता किसी विशिष्ट कुर्सी पर जाने के लिए कहता है, तो प्रणाली उस कुर्सी को कमरे में खोजने, कमरे में उसके सटीक त्रिविमीय (three-dimensional) स्थान को निर्धारित करने और उस पथ की गणना करने के लिए कंप्यूटर विज़न का उपयोग करती है जिसे रोबोट को वहां तक पहुँचने के लिए लेना है। अंत में, प्रणाली एक योजना तैयार करती है और सुरक्षा के लिए, अक्सर जटिल या लंबी दूरी की गतिविधियों को निष्पादित करने से पहले उपयोगकर्ता की पुष्टि मांगती है। यह पूरी प्रक्रिया निर्बाध रूप से होती है, जो बिना किसी स्पष्ट अनुवाद या प्रत्येक नई भाषा के लिए विशेष प्रशिक्षण के, मानवीय विचार और मशीन क्रिया के बीच के अंतर को पाट देती है।
अध्ययन ने इस तकनीक की सीमाओं का भी पता लगाया, जिससे पता चला कि हालांकि प्रणाली मजबूत है, लेकिन यह अचूक नहीं है। सबसे बड़ी चुनौतियाँ तब आईं जब रोबोट को उन वस्तुओं की पहचान करनी थी जो एक-दूसरे के बहुत समान दिखती थीं या जब दृश्य वातावरण अव्यवस्थित था, जिससे लक्ष्य को पहचानना कठिन हो गया था। इसके अतिरिक्त, कार्यों में जिन्हें जटिल, बहु-चरणीय अनुक्रमों के माध्यम से नेविगेट करना था, उनमें सरल, प्रत्यक्ष आदेशों की तुलना में त्रुटि होने की संभावना थोड़ी अधिक थी, क्योंकि तर्क की श्रृंखला में गलती होने के अधिक अवसर थे। हालाँकि, इन कठिन परिदृश्यों में भी, प्रणाली का प्रदर्शन मजबूत बना रहा, और शोधकर्ताओं ने नोट किया कि त्रुटियाँ अक्सर रोबोट के सेंसर की भौतिक सीमाओं या वातावरण की जटिलता से संबंधित थीं, न कि भाषा को समझने में विफलता से।
यह प्रदर्शित करते हुए कि एक एकल फ्रेमवर्क 140 से अधिक भाषाओं को उच्च सटीकता के साथ संभाल सकता है, यह कार्य मानव-रोबोट संपर्क के लिए एक नया मार्ग सुझाता है। यह इस विचार से दूर जाता है कि रोबोट को उपयोगी होने के लिए एक विशिष्ट भाषा सिखानी होगी, और एक ऐसे मॉडल की ओर बढ़ता है जहाँ रोबोट उपयोगकर्ता की मातृभाषा के अनुकूल होता है। शोधकर्ताओं ने अपना डेटा और कोड सार्वजनिक किया है, जिससे अन्य लोगों को इस आधार पर निर्माण करने के लिए आमंत्रित किया गया है। अंतिम लक्ष्य केवल ऐसे रोबोट बनाना नहीं है जो कई भाषाएं बोल सकें, बल्कि एक ऐसा भविष्य बनाना है जहाँ मशीन को कमांड देने की क्षमता एक सार्वभौमिक अधिकार हो, जो कहीं भी, किसी के भी लिए सुलभ हो, उनकी अपनी भाषा में। यह बदलाव स्वचालन तक पहुंच के लोकतंत्रीकरण का वादा करता है, यह सुनिश्चित करता है कि रोबोटिक्स के लाभ पूरी मानवता द्वारा साझा किए जाएं, न कि केवल उन लोगों द्वारा जो डिजिटल अभिजात वर्ग की भाषाएं बोलते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।