Technical Report: One-Step Drifting Action Heads for GR00T N1.7
यह तकनीकी रिपोर्ट एक GR00T N1.7 वेरिएंट का मूल्यांकन करती है जिसमें एक वन-स्टेप ड्रिफ्टिंग एक्शन हेड है जो इन्फरेंस लेटेंसी को 70.0 ms से घटाकर 30.6 ms तक काफी कम कर देता है, लेकिन यह LIBERO बेंचमार्क में कम टास्क सक्सेस रेट के व्यवस्थित ट्रेड-ऑफ के रूप में परिणाम देता है, जो क्लोज्ड-लूप कंट्रोल में डिटरमिनिस्टिक वन-स्टेप जनरेशन की सीमाओं को उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट जो देख सकते हैं, समझ सकते हैं और अपने हाथों से हिल-डुल सकते हैं, वे अब केवल विज्ञान कथा (साइंस फिक्शन) का सपना नहीं रह गए हैं; उन्हें आज ऐसे सिस्टम का उपयोग करके बनाया जा रहा है जो एक कैमरे की आँख को भाषा-प्रशिक्षित मस्तिष्क के साथ जोड़ते हैं। ये सिस्टम, जिन्हें विजन-लैंग्वेज-एक्शन मॉडल कहा जाता है, एक मशीन को एक दृश्य को देखने, "लाल कप उठाओ" जैसा निर्देश पढ़ने और फिर इसे करने के लिए सटीक गतिविधियों के क्रम को समझने की अनुमति देते हैं। हालाँकि, इन रोबोटों के उपयोगी होने के लिए, उन्हें बदलते परिवेश में बिना लड़खड़ाए प्रतिक्रिया देने के लिए पर्याप्त तेज़ी से सोचना होगा। यदि कंप्यूटर अगले कदम पर निर्णय लेने में बहुत अधिक समय लेता है, तो रोबate अपना लक्ष्य चूक सकता है या किसी चीज़ को गिरा सकता है। इंजीनियरों के लिए केंद्रीय चुनौती इन निर्णयों को सटीकता से समझौता किए बिना तेज़ी से लेने का तरीका खोजना है।
झेजियांग यूनिवर्सिटी और लिमएक्स डायनेमिक्स (LimX Dynamics) के शोधकर्ताओं का एक नया तकनीकी विवरण इन रोबोटिक निर्णयों को तेज़ करने के लिए एक विशिष्ट शॉर्टकट की जांच करता है। यह अध्ययन GR00T N1.7 नामक एक शक्तिशाली रोबोटिक मस्तिष्क पर केंद्रित है। अपने मानक रूप में, यह प्रणाली एक सावधान योजनाकार की तरह काम करती है: भविष्य की चालीस गतिविधियों के क्रम को तय करने के लिए, यह अपने आंतरिक गणना इंजन को कई बार चलाता है, और प्रत्येक पास के साथ अपनी योजना को परिष्कृत करता है जब तक कि वह आश्वस्त न हो जाए। यह पुनरावृत्ति प्रक्रिया सटीक है लेकिन धीमी है, जिसमें क्रियाओं की सूची उत्पन्न करने में लगभग 45 मिलीसेकंड का समय लगता है। शोधकर्ताओं ने एक सरल प्रश्न पूछा: क्या वे इस सावधानीपूर्वक, बहु-चरणीय योजना को एक एकल, त्वरित अनुमान से बदल सकते हैं? उन्होंने एक ऐसा संस्करण बनाया जो परिष्करण चरणों को छोड़ देता है और एक ही बार में चालीस गतिविधियों के पूरे क्रम की भविष्यवाणी करने का प्रयास करता है।
इस प्रयोग के परिणाम गति और सफलता के बीच एक तीव्र समझौते (ट्रेड-ऑफ) को प्रकट करते हैं। एक-चरणीय विधि (one-step method) पर स्विच करके, शोधकर्ताओं ने सोचने के समय में नाटकीय कमी हासिल की। क्रिया सूची उत्पन्न करने के लिए आवश्यक समय लगभग 45 मिलीसेकंड से घटकर केवल 5 मिलीसेकंड रह गया, जो गति में नौ गुना वृद्धि है। जब उन्होंने दृश्य और भाषाई जानकारी को संसाधित करने और एक योजना बनाने में कंप्यूटर द्वारा खर्च किए गए कुल समय को मापा, तो समय लगभग 70 मिलीसेकंड से गिरकर केवल 30 मिलीसेकंड से थोड़ा अधिक हो गया। यह एक महत्वपूर्ण इंजीनियरिंग जीत है, जो यह सुझाव देती है कि यदि यह विधि पूर्ण होती, तो रोबोट संभावित रूप से बहुत तेज़ी से प्रतिक्रिया कर सकते थे।
हालाँकि, रिपोर्ट स्पष्ट करती है कि यह गति एक भारी कीमत के साथ आती है। जबकि रोबोट काम करने में बहुत तेज़ हो गया, वह काम करने में काफी खराब हो गया। शोधकर्ताओं ने वस्तुओं को विभिन्न स्थानों पर ले जाने, लक्ष्यों तक पहुँचने और लंबी गतिविधियों के क्रम को पूरा करने वाले कार्यों के एक मानक सेट पर इस नए सिस्टम का परीक्षण किया। स्थानिक तर्क (spatial reasoning) वाले कार्यों पर, नया सिस्टम केवल 64 प्रतिशत समय सफल रहा, जबकि मूल, धीमी प्रणाली के लिए सफलता दर बहुत अधिक थी। विशिष्ट लक्ष्य तक पहुँचने वाले कार्यों पर, सफलता गिरकर 52 प्रतिशत हो गई। लंबी, जटिल कार्यों के लिए यह अंतर और भी बढ़ गया, जहाँ नया सिस्टम केवल 26 प्रतिशत समय सफल रहा।
शोधकर्ता यह सुनिश्चित करने के लिए सावधान थे कि ये विफलताएं केवल खराब किस्मत नहीं थीं। उन्होंने अलग-अलग यादृच्छिक शुरुआती बिंदुओं के साथ प्रयोग को तीन बार चलाया, और परिणाम सभी में लगातार खराब रहे। यह निरंतरता उन्हें बताती है कि समस्या कोई इत्तेफाक नहीं है, बल्कि उनके वर्तमान सेटअप के तहत एक-चरणीय दृष्टिकोण की एक मौलिक सीमा है। सिस्टम संघर्ष करता हुआ प्रतीत होता है क्योंकि उसे कई पास के माध्यम से अपने विचार को परिष्कृत करने के बजाय तुरंत एक एकल भविष्यवाणी के लिए प्रतिबद्ध होने के लिए मजबूर किया जाता है। जब कार्य जटिल या लंबा होता है, तो परिष्करण की यह कमी त्रुटियों को संचित करती है, जिससे रोबोट विफल हो जाता है।
रिपोर्ट इस विचार के एक उन्नत संस्करण की भी जांच करती है जिसे "ड्रिफोव" (DrifOv) कहा जाता है, जो एसिंक्रोनस एक्शन (asynchronous action) की वास्तविक दुनिया की समस्या को संभालने का प्रयास करता है। एक वास्तविक रोबोट में, पुराने कार्यों को निष्पादित करते समय अक्सर नए प्लान आते हैं। शोधकर्ता एक ऐसा सिस्टम बना सकते हैं जो एक आंशिक रूप से पूर्ण योजना ले सकता है और बिना उस हिस्से को दोबारा लिखे जो पहले ही प्रतिबद्ध किया जा चुका है, भविष्य के लापता चरणों को भर सकता है। जबकि इस सुविधा को सफलतापूर्वक लागू किया गया और प्रशिक्षण में परीक्षण किया गया था, मानक प्रयोगों में इसका उपयोग नहीं किया गया था, जिसका अर्थ है कि रिपोर्ट की गई गति और विफलता दर केवल सरल, सिंक्रोनस संस्करण पर लागू होती है। शोधकर्ता नोट करते हैं कि वर्तमान सेटअप अभी यह सिद्ध नहीं करता है कि यह उन्नत विधि सफलता की समस्या को हल करेगी, हालांकि यह भविष्य के काम के लिए एक आशाजनक दिशा बनी हुई है।
अंततः, यह अध्ययन इस विचार पर एक यथार्थवादी जाँच के रूप में कार्य करता है कि क्या जटिलता को हटाकर रोबोटों को बस तेज़ बनाया जा सकता है। शोधकर्ताओं ने पाया कि हालांकि वे गतिविधियों की सूची बनाने में रोबोट के "मस्तिष्क" को नौ गुना तेज़ बना सकते थे, रोबोट उस गति का विश्वसनीय रूप से उपयोग करने में सक्षम नहीं था। गति में वृद्धि वास्तव में एक बेहतर समग्र प्रणाली में नहीं बदली क्योंकि सटीकता इतनी गिर गई कि वह उपयोगी नहीं रही। रिपोर्ट निष्कर्ष निकालती है कि आगे का रास्ता केवल धीमी, सावधानीपूर्वक योजना को त्यागना नहीं है, बल्कि गति प्राप्त करते हुए सटीकता बनाए रखने का तरीका खोजना है। शोधकर्ता सुझाव देते हैं कि भविष्य के कार्य इस बात का परीक्षण करने पर केंद्रित होने चाहिए कि क्या रोबोट की योजना को लंबे टुकड़ों के बजाय अधिक बार चलाना, नए सिस्टम की गति और पुराने सिस्टम की विश्वसनीयता के बीच के अंतर को पाटने में मदद कर सकता है। फिलहाल, सबक स्पष्ट है: रोबोटिक हेरफेर (manipulation) की दुनिया में, तेज़ी से सोचना स्वचालित रूप से बेहतर करना नहीं होता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।