← नवीनतम पेपर
💻 computer science

Latent Cluster Analysis for Vision-Language-Action Models

यह शोध पत्र LAVLA प्रस्तुत करता है, जो एक क्रॉस-अटेंशन-आधारित एम्बेडिंग-वेटिंग पद्धति का उपयोग करके GR00T N1.5 विजन-लैंग्वेज-एक्शन मॉडल पर लेटेंट क्लस्टर विश्लेषण करने के लिए है, जो यह प्रकट करता है कि इसके आंतरिक प्रतिनिधित्व भाषा-संचालित रोबोटिक प्रणालियों की व्याख्यात्मकता को बढ़ाने के लिए स्थानिक-कालिक और काइनेमैटिक विशेषताओं को प्रगतिशील रूप से कैसे अलग करते हैं।

मूल लेखक: Theodor Wulff, Sergio Lanza, Tamara Bila, Angelo Cangelosi, Stefan Wermter, Igor Farkas

प्रकाशित 2026-09-03
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Theodor Wulff, Sergio Lanza, Tamara Bila, Angelo Cangelosi, Stefan Wermter, Igor Farkas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट अब केवल देखकर ही नहीं, बल्कि निर्देशों को सुनकर और फिर कार्य करने के लिए अपने शरीर को हिलाकर दुनिया को समझना सीख रहे हैं। आर्टिफिशियल इंटेलिजेंस की इस नई पीढ़ी को, जिसे विजन-लैंग्वेज-एक्शन (Vision-Language-Action) मॉडल के रूप में जाना जाता है, कैमरा जो देखता है उसे मानव द्वारा कही गई बात के साथ जोड़कर यह निर्णय लेने के लिए उपयोग किया जाता है कि एक रोबोटिक हाथ को कैसे पहुंचना, पकड़ना या उठाना चाहिए। इन प्रणालियों के हमारे घरों और कार्यस्थलों में सुरक्षित और उपयोगी होने के लिए, हमें इस बात पर भरोसा करने की आवश्यकता है कि वे सही विकल्प चुन रहे हैं। हालाँकि, इन जटिल प्रणालियों का आंतरिक तर्क अक्सर एक रहस्य बना रहता है, एक 'ब्लैक बॉक्स' जहाँ डेटा प्रवेश करता है और कमांड बाहर निकलते हैं, लेकिन उनके बीच की सोचने की प्रक्रिया का स्पष्ट दृश्य नहीं मिल पाता। यदि कोई रोबട്ട് अजीब व्यवहार करता है, तो वर्तमान में हमारे पास यह समझने के उपकरण नहीं हैं कि ऐसा क्यों हुआ, जो उन्हें वास्तविक दुनिया की स्थितियों में तैनात करने के लिए एक महत्वपूर्ण बाधा है जहाँ गलतियों के गंभीर परिणाम हो सकते हैं।

इस ब्लैक बॉक्स के भीतर प्रकाश डालने के लिए, यूके, जर्मनी और स्लोवाकिया के विश्वविद्यालयों के शोधकर्ताओं की एक टीम ने LAVLA नामक एक नई विधि विकसित की है। उन्होंने अपना ध्यान GR00T N1.5 नामक एक अत्याधुनिक रोबोटिक मस्तिष्क पर केंद्रित किया, जिसे दृश्य और भाषाई जानकारी को शारीरिक गति में बदलने के लिए डिज़ाइन किया गया है। शोधकर्ता यह देखना चाहते थे कि मॉडल किसी कार्य की योजना बनाने के दौरान अपने विचारों को कैसे व्यवस्थित करता है। अंतिम परिणाम को देखने के बजाय, उन्होंने कंप्यूटर प्रोग्राम की उन छिपी हुई परतों की जांच की जहाँ रोबोट के "विचार" डेटा के पैटर्न के रूप में मौजूद होते हैं। उन्होंने इन पैटर्नों को लोगों की भीड़ की तरह माना और समानता के आधार पर उन्हें समूहों में विभाजित करने का प्रयास किया, जिसे क्लस्टरिंग (clustering) कहा जाता है। ऐसा करके, वे देख सके कि क्या रोबोट समान स्थितियों को, जैसे कि "कप उठाना" बनाम "दरवाजा धकेलना", एक साथ समूहित कर रहा है या वह भ्रमित हो रहा है।

शोधकर्ताओं ने पाया कि मॉडल का आंतरिक संगठन कार्य को पूरा करते समय बदल जाता है। जब रोबोट पहले गति की योजना बनाना शुरू करता है, तो उसका आंतरिक डेटा अव्यवस्थित और शोर से भरा होता है, बिल्कुल एक वाक्य के कच्चे मसौदे की तरह। जैसे-जैसे योजना बनाने की प्रक्रिया जारी रहती है, डेटा अधिक स्पष्ट और संरचित होता जाता है। टीम ने पाया कि मॉडल निर्णय लेने के करीब पहुँचते ही विभिन्न प्रकार की जानकारी को स्वाभाविक रूप से अलग कर देता है। यह स्थान (space) में चीजों के होने, कार्यों में लगने वाले समय और रोबोट के अपने जोड़ों को कैसे हिलना चाहिए, के बीच अंतर करना शुरू कर देता है। यह अलगाव चरणों में होता है, जिसमें मॉडल एक विशिष्ट योजना पर स्थिर होने तक परत-दर-परत अपनी समझ को परिष्कृत करता है।

उनकी खोज का एक प्रमुख हिस्सा रोबोट के निर्देशों के सबसे महत्वपूर्ण हिस्सों को उजागर करने की एक तकनीक से जुड़ा था। मॉडल को वीडियो फ्रेम और टेक्स्ट कमांड दोनों प्राप्त होते हैं, लेकिन हर गति के लिए सभी शब्द या चित्र समान रूप से महत्वपूर्ण नहीं होते हैं। शोधकर्ताओं ने सबसे प्रासंगिक शब्दों और दृश्य विवरणों से संकेतों को बढ़ाने और कम उपयोगी वाले संकेतों को शांत करने की एक विधि बनाई। जब उन्होंने इस वेटिंग (weighting) पद्धति को लागू किया, तो समान विचारों के समूह बहुत अधिक स्पष्ट और विशिष्ट हो गए। इस सहायता के बिना, रोबोट का आंतरिक डेटा विश्लेषण के लिए बहुत बिखरा हुआ रहता। इस सहायता के साथ, शोधकर्ता देख सके कि मॉडल कार्य को हल करने के लिए सही विशेषताओं पर सफलतापूर्वक ध्यान केंद्रित कर रहा था।

अध्ययन ने यह भी खुलासा किया कि रोबोट की समय और स्थान की समझ गहराई से जुड़ी हुई है। शोधकर्ताओं द्वारा पहचाने गए डेटा समूहों ने दिखाया कि मॉडल एक अनुक्रम (sequence) के विशिष्ट क्षणों पर नज़र रखता है, यह समझते हुए कि कुछ कार्य विशिष्ट समय पर होते हैं। इसके अलावा, मॉडल ने शरीर के विभिन्न अंगों की गतिविधियों को अलग करना सीखा। यह बाएं हाथ, दाएं हाथ और कमर की गति के बीच अंतर कर सका, उन्हें एक एकल कार्य के अलग लेकिन समन्वित तत्वों के रूप में माना। यह सुझाव देता है कि मॉडल केवल एक एकल पथ को याद नहीं कर रहा है, बल्कि यह कि उसका शरीर वातावरण के माध्यम से कैसे चलता है, इसकी एक लचीली समझ बना रहा है।

इन निष्कर्षों को मनुष्यों के लिए उपयोगी बनाने के लिए, टीम ने इन अदृश्य डेटा समूहों को सरल भाषा में अनुवादित करने का एक तरीका विकसित किया। उन्होंने प्रत्येक समूह से सबसे विशिष्ट उदाहरणों को लिया और एक अलग, शक्तिशाली लैंग्वेज मॉडल से यह पूछा कि उनमें क्या समानता है। इसने उन्हें रोबोट के आंतरिक क्लस्टर्स को "फल उठाना" या "वस्तु पकड़ना" जैसे मानव-पठनीय लेबल असाइन करने की अनुमति दी। हालांकि विवरण कभी-कभी व्यापक थे, लेकिन इस प्रक्रिया ने सिद्ध किया कि यह संभव है कि रोबोट के छिपे हुए गणित को उन अवधारणाओं से जोड़ा जाए जिन्हें लोग समझ सकते हैं। मशीन की आंतरिक स्थिति और मानवीय भाषा के बीच का यह सेतु रोबोटिक प्रणालियों को पारदर्शी और विश्वसनीय बनाने की दिशा में एक महत्वपूर्ण कदम है।

शोधकर्ता सावधानीपूर्वक यह उल्लेख करते हैं कि उनके निष्कर्ष एक विशिष्ट मॉडल और सीमित प्रशिक्षण डेटा पर आधारित हैं, इसलिए परिणाम अन्य प्रणालियों या लंबे कार्यों के साथ भिन्न दिख सकते हैं। वे यह भी स्वीकार करते हैं कि उनकी विधि ऐसे डेटा को समूहित करने पर निर्भर करती है जो पूरी तरह से गोलाकार आकार का नहीं है, जो एक गणितीय सीमा है जो उनके समूहों की सटीकता को प्रभावित कर सकती है। इन बाधाओं के बावजूद, यह कार्य एक ठोस मानचित्र प्रदान करता है कि एक रोबोट सूचना को शुरू से अंत तक कैसे संसाधित करता है। यह दिखाते हुए कि ये मॉडल वास्तव में अपने विचारों को एक तार्किक और प्रगतिशील तरीके से व्यवस्थित करते हैं, यह अध्ययन यह सत्यापित करने का एक नया तरीका प्रदान करता है कि रोबोट वास्तविक वस्तु को हिलाने के लिए कहे जाने से पहले सही ढंग से सोच रहे हैं या नहीं। यह स्पष्टता उन अगली पीढ़ी के रोबोट बनाने के लिए आवश्यक है जो हमारे साथ सुरक्षित रूप से काम कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →