← नवीनतम पेपर
💻 computer science

Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy

यह शोध पत्र केवल मशीन-पुनर्गठित निर्देशों का उपयोग करके एक रोबोट विजन-लैंग्वेज-एक्शन पॉलिसी में ग्रीक भाषा को जोड़ने की जांच करता है, जो यह प्रकट करता है कि गलत निष्कर्षों से बचने के लिए मजबूत मूल्यांकन हेतु शून्य बेंचमार्क और सीड रेप्लिकेशन (seed replication) की आवश्यकता होती है, जबकि यह भी प्रदर्शित करता है कि द्विभाषी प्रशिक्षण विशिष्ट वाक्यांशों पर ओवरफिटिंग के बावजूद कंट्रोल्स की तुलना में निरंतर सुधार प्रदान करता है।

मूल लेखक: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

प्रकाशित 2026-09-09
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ayoub Kirouane, Georgios Giaples, Christos Petrocheilos

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

देखने, समझने और चलने में सक्षम रोबोट अब एक वास्तविकता बनते जा रहे हैं, लेकिन वर्तमान में वे केवल एक ही भाषा बोलते हैं: अंग्रेजी। ये मशीनें मनुष्यों को कार्य करते हुए वीडियो देखकर सीखती हैं, जहाँ निर्देश अंग्रेजी में लिखे होते हैं। वह सॉफ़्टवेयर जो उन्हें इन शब्दों को समझने में मदद करता है, उसे अंग्रेजी के विशाल टेक्स्ट पर प्रशिक्षित किया गया है, जिससे वह उस विशिष्ट भाषा में अविश्वसनीय रूप से कुशल हो जाता है। किसी भी ऐसे व्यक्ति के लिए जो ग्रीक (यूनानी) या कोई अन्य भाषा बोलता है, यह एक कठिन बाधा खड़ी करता है। रोबोटों को ग्रीक निर्देशों के साथ वस्तुएं हिलाते हुए दिखाने वाले वीडियो पुस्तकालय मौजूद नहीं हैं, और इसे शून्य से बनाना हर एक क्रिया के लिए रोबोटिक आर्म को महीनों तक मैन्युअल रूप से निर्देशित करने की आवश्यकता होगी। शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या वे मौजूदा अंग्रेजी डेटा का उपयोग कर सकते हैं, कंप्यूटर के माध्यम से निर्देशों को ग्रीक में अनुवादित कर सकते हैं, और पूरे सिस्टम को फिर से बनाए बिना रोबोट को नई भाषा समझने के लिए सिखा सकते हैं?

उत्तर एक साधारण अनुवाद की तुलना में अधिक जटिल निकला। एथेंस में सोफिया एआई (Sophea AI) और कीफर एसए (KIEFER SA) के शोधकर्ताओं की एक टीम ने एक ओपन-सोर्स रोबोट सिस्टम लिया और उसमें मशीन द्वारा उत्पन्न हजारों ग्रीक निर्देश डाले। उन्होंने रोबोट के मस्तिष्क या उसकी भौतिक संरचना को नहीं बदला; उन्होंने बस अंग्रेजी टेक्स्ट को ग्रीक टेक्स्ट से बदल दिया। अनुवाद की प्रक्रिया तेज़ और आसान थी, जिसमें केवल कुछ घंटे लगे। हालाँकि, असली काम तब शुरू हुआ जब उन्होंने यह मापने की कोशिश की कि क्या रोबोट वास्तव में समझ रहा था कि उसे क्या बताया जा रहा है। रोबोटिक्स की दुनिया में, एक सिस्टम को सफल दिखने के लिए धोखा देना आश्चर्यजनक रूप से आसान है, जबकि वह वास्तव में केवल अनुमान लगा रहा होता है। शोधकर्ताओं ने पाया कि मानक परीक्षण, जो आमतौर पर स्पष्ट पास या फेल परिणाम देते हैं, पूरी तरह से मूर्ख बन गए थे। उन्होंने पाया कि एक रोबोट ग्रीक कमांड का उच्च सफलता दर के साथ पालन कर सकता है, भले ही वह कमांड निरर्थक हो, या भले ही रोबोट को कभी ग्रीक सिखाया ही न गया हो। ऐसा इसलिए हुआ क्योंकि रोबोट शब्दों को पढ़ने के बजाय दृश्य और वस्तुओं को पहचानना सीख रहा था।

इसे हल करने के लिए, टीम को रोबोट का परीक्षण करने के नए तरीके खोजने पड़े। उन्होंने एक कंट्रोल ग्रुप बनाया जहाँ उन्होंने जानबूझकर रोबोट को ग्रीक में गलत निर्देश दिए ताकि यह देखा जा सके कि क्या वह अभी भी कार्य करने का प्रयास करता है। उन्होंने पाया कि दस कार्यों के एक छोटे सेट पर, मशीन-अनुवादित ग्रीक निर्देशों के साथ प्रशिक्षित एक रोबोट लगभग चौरासी प्रतिशत बार सफल होता दिखाई दिया। लेकिन जब उन्होंने गलत निर्देशों के साथ परीक्षण किया, तो वह अभी भी लगभग बयासी प्रतिशत बार सफल हुआ। इससे सिद्ध हुआ कि रोबोट ग्रीक पढ़ नहीं रहा था; वह केवल दृश्य सेटअप पर प्रतिक्रिया दे रहा था। रोबोट भाषा को पूरी तरह से अनदेखा कर रहा था।

शोधकर्ताओं ने फिर एक अलग दृष्टिकोण अपनाया। उन्होंने नब्बे कार्यों के एक बड़े सेट का उपयोग किया जहाँ रोबोट को एक ही दृश्य में कई संभावित लक्ष्यों के बीच चयन करना था। यहाँ, भाषा ही एकमात्र संकेत थी जो रोबोट को बताने के लिए थी कि क्या करना है। उन्होंने पाया कि अंग्रेजी और ग्रीक दोनों निर्देशों पर प्रशिक्षित एक रोबोट ग्रीक कमांड का लगभग सत्ताईस प्रतिशत समय पालन कर सका, जो कि रैंडम चांस (संयोग) से काफी बेहतर था। हालाँकि, एक रोबोट जो बिना किसी अंग्रेजी डेटा के केवल ग्रीक निर्देशों पर प्रशिक्षित था, वह रैंडम चांस से मुश्किल से ही बेहतर प्रदर्शन कर पाया। हालांकि द्विभाषी प्रशिक्षण का औसत प्रदर्शन ग्रीक-ओनली प्रशिक्षण की तुलना में बेहतर था, लेकिन उनके प्रदर्शन की सांख्यिकीय सीमाएं काफी हद तक ओवरलैप होती थीं, जिसका अर्थ है कि डेटा निश्चित रूप से यह पुष्टि नहीं कर सकता था कि अंग्रेजी प्रशिक्षण ग्रीक सीखने के लिए एक आवश्यक आधार (स्कैफोल्ड) के रूप में कार्य करता है। सबसे मजबूत निष्कर्ष यह था कि लक्षित-भाषा के प्रदर्शन (demonstrations) आवश्यक हैं, लेकिन अकेले वे अक्सर अपर्याप्त होते हैं; केवल ग्रीक पर प्रशिक्षित एक पॉलिसी (नीति) भाषा का बहुत कम पालन करती है, और कई परीक्षणों में अपने स्वयं के विफलता स्तर (failure floor) के तीन अंक के भीतर रहती है।

अध्ययन ने यह भी उजागर किया कि रोबोट ग्रीक भाषा को उस तरह से नहीं सीख रहा था जैसे एक मनुष्य सीखता है। इसके बजाय, वह मशीन ट्रांसलेटर द्वारा उपयोग किए गए विशिष्ट वाक्यांशों को याद कर रहा था। जब शोधकर्ताओं ने एक अलग कंप्यूटर प्रोग्राम द्वारा लिखे गए ग्रीक वाक्यों के साथ रोबोट का परीक्षण किया, तो रोबोट का प्रदर्शन तेजी से गिर गया। उसने पहले ट्रांसलेटर की शैली को सीखा था, न कि स्वयं भाषा को। इसे ठीक करने के लिए, उन्होंने रोबोट को सात अलग-अलग ग्रीक वाक्यांशों का उपयोग करके वही कार्य सिखाया। इस सरल परिवर्तन ने रोबोट को बहुत अधिक सुदृढ़ बना दिया, जिससे नए वाक्यांशों के परीक्षण के दौरान प्रदर्शन में गिरावट आधी हो गई। इसने दिखाया कि रोबोट को किसी एक मशीन की लेखन शैली से आगे बढ़ने के लिए विविधता अनिवार्य है।

शायद सबसे आश्चर्यजनक निष्कर्ष यह था कि कुछ सामान्य- sense सुधारों ने वास्तव में रोबोट को बदतर बना दिया। टीम ने रोबोट के प्रशिक्षण को एक ऐसे मॉडल के साथ शुरू करने का प्रयास किया जिसे पहले से ही ग्रीक के अनुकूल बनाया गया था, यह सोचकर कि इससे उसे बढ़त मिलेगी। इसके बजाय, रोबोट ने अंग्रेजी और ग्रीक दोनों में खराब प्रदर्शन किया। उन्होंने यह भी आज़माया कि रोबोट के मस्तिष्क के उस हिस्से को स्वतंत्र रूप से सीखने दिया जाए जो भाषा को प्रोसेस करता है, बजाय इसके कि उसे फ्रीज रखा जाए। इससे भी प्रदर्शन में गिरावट आई। परिणाम बताते हैं कि इन विशिष्ट प्रणालियों के लिए, सबसे अच्छी रणनीति यह है कि भाषा समझने वाले मस्तिष्क के हिस्से को बिल्कुल वैसा ही रखा जाए जैसा उसे प्रशिक्षित किया गया था, और केवल रोबोट को नए भाषा निर्देशों का उपयोग करके हिलना-डुलना सिखाया जाए।

शोधकर्ताओं ने इन विधियों का परीक्षण वास्तविक दुनिया के रोबोट डेटा के एक विशाल संग्रह पर भी करने का प्रयास किया, जो उनके सिम्युलेटेड परीक्षणों से बहुत बड़ा है। उन्होंने पचास हजार से अधिक वास्तविक रोबोट एपिसोड को ग्रीक में अनुवादित किया। हालाँकि, वे इस डेटा की सफलता को माप नहीं सके क्योंकि उनके पास परीक्षण चलाने के लिए आवश्यक भौतिक रोबोट हार्डवेयर की कमी थी। इसने इस क्षेत्र में एक बड़ी बाधा को रेखांकित किया: डेटा को अनुवादित करना सस्ता और तेज़ है, लेकिन यह सत्यापित करना कि रोबोट ने वास्तव में सीखा है या नहीं, धीमा, महंगा और भौतिक उपकरणों की आवश्यकता वाला काम है।

अंततः, पेपर यह निष्कर्ष निकालता है कि रोबोट में एक नई भाषा जोड़ना संभव है, लेकिन यह केवल अनुवाद जितना सरल नहीं है। इसके लिए एक विशिष्ट प्रकार के बेस मॉडल की आवश्यकता होती है जो पहले से ही भाषा को समझता हो, नए भाषा और अंग्रेजी दोनों में प्रशिक्षण डेटा का मिश्रण, और एक बहुत ही सावधानीपूर्ण परीक्षण प्रक्रिया की आवश्यकता होती है जिसमें जानबूझकर की गई विफलताओं को शामिल किया जाता है ताकि यह सुनिश्चित हो सके कि रोबोट वास्तव में सुन रहा है। रोबोट भाषा को गहरे, मानवीय तरीके से नहीं सीखता है; वह शब्दों के विशिष्ट पैटर्न को कार्यों के साथ जोड़ने के रूप में सीखता है, और उसे ऐसा करने के लिए अंग्रेजी प्रशिक्षण की स्थिरता की आवश्यकता होती है, हालांकि अंग्रेजी कैसे समर्थन करती है, इसका सटीक तंत्र एक पुष्ट नियम के बजाय एक खुला प्रश्न बना हुआ है। यह कार्य क्षेत्र के अन्य लोगों के लिए एक चेतावनी के रूप में कार्य करता है: रोबोट की सफलता दर पर आँख मूंदकर भरोसा न करें, और हमेशा एक कंट्रोल ग्रुप के साथ परीक्षण करें जो यह साबित करे कि रोबोट केवल अनुमान नहीं लगा रहा है। बहुभाषी रोबोट का मार्ग केवल डेटा से नहीं, बल्कि इस बात को सिद्ध करने के कठोर अनुशासन से निर्मित होता है कि डेटा को वास्तव में समझा गया था।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →