← नवीनतम पेपर
🤖 AI

CASD: Chunk-Aligned Semantic Distillation for Multi-StageRobot Manipulation

यह शोध पत्र चंक-अलाइन्ड सिमेंटिक डिस्टिलेशन (CASD) प्रस्तुत करता है, जो एक ऐसी विधि है जो पूरे एक्शन चंक्स के लिए सिमेंटिक लक्ष्य उत्पन्न करने के लिए ऑफलाइन विजन-लैंग्वेज मॉडल्स का लाभ उठाती है, जिससे एक फ्रोजन जनरेटर को रोबोट पॉलिसियों को निर्देशित करने में सक्षम बनाया जाता है और मौजूदा दृष्टिकोणों की तुलना में कई मैनिपुलेशन बेंचमार्क में सफलता दर में उल्लेखनीय सुधार होता है।

मूल लेखक: Tinghe Ding, Jiahao Li, He Wang

प्रकाशित 2026-09-09
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tinghe Ding, Jiahao Li, He Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वास्तविक दुनिया में वस्तुओं को नियंत्रित करने वाले रोबोटों को समय (timing) की एक मौलिक समस्या का सामना करना पड़ता है। जब कोई इंसान किसी रोबोट से कहता है कि "कटोरे को दराज में रख दो और उसे बंद कर दो," तो यह निर्देश एक एकल कमांड जैसा लगता है, लेकिन भौतिक वास्तविकता विशिष्ट क्षणों का एक क्रम है: कटोरे तक पहुँचना, उसे पकड़ना, उसे ले जाना, उसे छोड़ना, और अंत में दराज को धक्का देकर बंद करना। आधुनिक रोबोट अक्सर इसे भविष्य के कार्यों के एक छोटे ब्लॉक (block of movements) की भविष्यवाणी करके हल करने की कोशिश करते हैं, यह एक ऐसी तकनीक है जो उन्हें हर छोटी गति के बाद सोचने के लिए रुकने के बजाय सुचारू रूप से चलने में मदद करती है। हालाँकि, यह दृष्टिकोण एक 'ब्लाइंड स्पॉट' (अंधा बिंदु) पैदा करता है। यदि एक रोबोट बीस कार्यों के एक ब्लॉक की भविष्यवाणी करता है, और उस ब्लॉक के बीच का हिस्सा ठीक वही क्षण होता है जब वह कटोरे को पकड़ने से छोड़ने की प्रक्रिया में बदलता है, तो रोबोट का आंतरिक मार्गदर्शक अभी भी "पकड़े रहने" का निर्देश दे सकता है क्योंकि वह निर्देश ब्लॉक के पहले आधे हिस्से के लिए था। यह महसूस करने में विफल रहता है कि लक्ष्य पहले ही "छोड़ने" में बदल चुका है, जिससे अनाड़ी या असफल प्रयास होते हैं।

इसे हल करने के लिए, एंट ग्रुप (Ant Group) के शोधकर्ताओं ने 'चंक-अलाइन्ड सिमेंटिक डिस्टिलेशन' (Chunk-Aligned Semantic Distillation) नामक एक विधि विकसित की है। इसका मूल विचार रोबोट को न केवल यह सिखाना है कि वह अभी क्या कर रहा है, बल्कि यह भी कि उसके आगामी कार्यों के ब्लॉक का कितना हिस्सा कार्य के प्रत्येक भाग से संबंधित है। रोबोट को पूरे ब्लॉक के लिए एक एकल लेबल जैसे "चलना" या "बंद करना" चुनने के लिए मजबूर करने के बजाय, सिस्टम एक भारित मिश्रण (weighted mix) की गणना करता है। यदि कार्यों का एक ब्लॉक तीन-चौथाई "चलना" है और एक-चौथाई "छोड़ना" है, तो रोबोट दोनों के मिश्रण के लिए तैयार होना सीखता है। यह रोबोट को चरणों के बीच सुचारू रूप से संक्रमण करने की अनुमति देता है, जिससे वह बदलाव होने के बाद प्रतिक्रिया देने के बजाय, उसे होने से पहले ही भांप लेता है।

शोधकर्ताओं ने इस प्रणाली को एक दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करके बनाया जो "सोचने" को "करने" से अलग करती है। सबसे पहले, उन्होंने एक शक्तिशाली ऑफलाइन लैंग्वेज मॉडल का उपयोग किया जिसने मनुष्यों द्वारा कार्य करने के वीडियो देखे। इस मॉडल ने एक शिक्षक के रूप में कार्य किया, प्रत्येक वीडियो को "पकड़ना", "परिवहन करना" और "छोड़ना" जैसे विशिष्ट चरणों के टाइमलाइन में विभाजित किया। वीडियो के प्रत्येक क्षण के लिए, शिक्षक ने गणना की कि रोबोट अगले कार्यों के ब्लॉक के दौरान प्रत्येक चरण में कितना समय बिताएगा। फिर उसने एक 'सिमेंटिक टारगेट' (semantic target) बनाया—जो चरणों के भविष्य के मिश्रण का एक विवरण था—जो उस क्षण के लिए सही उत्तर के रूप में कार्य करता था।

इसके बाद, उन्होंने एक अलग कंप्यूटर प्रोग्राम को प्रशिक्षित किया, जिसे 'जेनरेटर' (generator) कहा जाता है, ताकि वह रोबोट के कैमरे के वर्तमान दृश्य, उसकी अपनी भौतिक स्थिति और टेक्स्ट निर्देश का उपयोग करके इस भविष्य के मिश्रण की भविष्यवाणी कर सके। जेनरेटर ने वर्तमान को देखना और तत्काल भविष्य की संरचना का अनुमान लगाना सीखा। एक बार जब यह जेनरेटर प्रशिक्षित हो गया, तो शोधकर्ताओं ने इसकी सेटिंग्स को फ्रीज कर दिया ताकि यह आगे न बदले। फिर उन्होंने इस फ्रीज किए गए जेनरेटर को मुख्य रोबोट पॉलिसी से जोड़ दिया। अब, जब भी रोबोट को यह तय करने की आवश्यकता होती है कि क्या करना है, तो जेनरेटर तुरंत एक 'सिमेंटिक कॉन्टेक्स्ट टोकन' (semantic context token) प्रदान करता है जो चरणों के आगामी मिश्रण का वर्णन करता है। रोबोट इस टोकन का उपयोग अपने आंदोलनों को निर्देशित करने के लिए करता है, जिससे वह संक्रमण को होने से पहले ही देख पाता है। महत्वपूर्ण रूप से, यह पूरी प्रक्रिया बिना रोबोट को काम करते समय किसी बड़े लैंग्वेज मॉडल को बुलाए या टेक्स्ट उत्पन्न किए होती है; कार्य की संरचना को समझने की भारी मेहनत पहले ही फ्रीज किए गए जेनरेटर में की जा चुकी थी।

टीम ने कई अलग-अलग रोबोट लर्निंग सिस्टम और विभिन्न बेंचमार्क पर इस दृष्टिकोण का परीक्षण किया, जिसमें सिंगल आर्म, दो हाथों के साथ मिलकर काम करने वाले रोबोट और जटिल नेविगेशन परिदृश्य शामिल थे। मानक परीक्षणों में, इस पद्धति ने स्पष्ट सुधार दिखाया। जब इसे 'जॉइंट मॉडल' (Joint model) नामक एक विशिष्ट प्रकार के रोबट ब्रेन के साथ जोड़ा गया, तो हेरफेर (manipulation) के कार्यों पर सफलता दर 98.0 प्रतिशत से बढ़कर 98.9 प्रतिशत हो गई। दो हाथों वाले कार्यों के एक अन्य सेट पर, सुधार और भी अधिक स्पष्ट था, जो 90.6 प्रतिशत से बढ़कर 93.0 प्रतिशत हो गया। यह प्रणाली तब भी मजबूत साबित हुई जब वातावरण बदल गया, जैसे कि रोशनी बदल गई या रोबोट किसी अलग स्थिति से शुरू हुआ, जहाँ इसने उच्च सफलता दर बनाए रखी जहाँ अन्य विधियाँ संघर्ष करती रहीं।

हालाँकि, परिणाम हर प्रकार के रोबोट ब्रेन के लिए सार्वभौमिक जीत नहीं थे। जब शोधकर्ताओं ने इस पद्धति को सिस्टम के एक अलग संस्करण पर लागू किया, तो प्रदर्शन वास्तव में थोड़ा गिर गया। यह सुझाव देता है कि इस सिमेंटिक मार्गदर्शन का लाभ इस बात पर बहुत अधिक निर्भर करता है कि रोबole का अंतर्निहित सिस्टम कैसे बना है; कुछ आर्किटेक्चर के लिए, अतिरिक्त संदर्भ क्रिया को परिष्कृत करने में मदद करता है, जबकि अन्य के लिए, यह मामूली बेमेल (mismatch) पैदा कर सकता है।

परीक्षणों में से एक विशिष्ट उदाहरण इस पद्धति के अंतर को दर्शाता है। एक कार्य में जहाँ रोबोट को काले कटोरे को दराज में रखना था और उसे बंद करना था, एक मानक रोबोट मॉडल समय पर कटोरा छोड़ने में विफल रहा, कटोरे को तब तक पकड़े रहा जब तक कि उसे छोड़ देना चाहिए था, और अंततः समय समाप्त हो गया। नए तरीके से लैस रोबोट ने, बिल्कुल उसी स्थिति से शुरू करते हुए और समान रैंडम सीड्स का उपयोग करते हुए, कार्य के बदलाव को पहले पहचान लिया। इसने सटीक क्षण पर कटोरे को छोड़ना शुरू किया, जिससे कार्य सफलतापूर्वक पूरा हुआ। सिस्टम को दराज के हैंडल के बारे में "सोचने" की आवश्यकता नहीं थी जब वह अभी भी कटोरा पकड़े हुए था; उसे प्राप्त सिमेंटिक टोकन ने उसे बता दिया कि "छोड़ने" का चरण पहले से ही उसके तत्काल भविष्य के एक महत्वपूर्ण हिस्से पर कब्जा कर रहा है।

शोधकर्ता इस बात पर जोर देते हैं कि इस दृष्टिकोण के लिए रोबोट को चलते समय चरण-दर-चरण योजना या उप-लक्ष्यों (sub-goals) की सूची बनाने की आवश्यकता नहीं होती है। इसके बजाय, यह कार्य की संरचना के एक संकुचित, गणितीय प्रतिनिधित्व पर निर्भर करता है जो प्रत्येक निर्णय चक्र में एक बार उत्पन्न होता है। यह सिस्टम को तेज़ और कुशल रखता है, जिससे जटिल तर्क प्रक्रियाओं के कारण होने वाली देरी से बचा जा जा सकता है। यह विधि कार्य के उच्च-स्तरीय विवरण और भौतिक क्रियाओं के निम्न-स्तरीय समय के बीच के अंतर को सफलतापूर्वक पाटती है, जिससे रोबोट को बहु-चरणीय निर्देशों को मानवीय पूर्वानुमान जैसी तरलता के साथ संभालने की अनुमति मिलती है। हालांकि यह तकनीक हर संभव रोबोट कॉन्फ़िगरेशन के लिए जादुई समाधान नहीं है, लेकिन यह इस बात का एक ठोस तरीका प्रदान करती है कि मशीनें अपने स्वयं के आंदोलनों के समय के प्रवाह को कैसे समझ सकती हैं, जिससे एक कठोर कमांड अनुक्रम एक गतिशील, संदर्भ-जागरूक प्रदर्शन में बदल जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →