← नवीनतम पेपर
💻 computer science

WeaveRL: Weaving Reconstruction into Scene-Aware Fabrics for Perceptive Reinforcement Learning

WeaveRL एक GPU-त्वरित विधि पेश करता है जो ज्यामितीय फैब्रिक्स (geometric fabrics) में सक्रिय, ऑनलाइन 3D सर्फेल पुनर्निर्माण को एकीकृत करता है, जिससे सुदृढीकरण शिक्षण (reinforcement learning) नीतियों को सेंसर-व्युत्पन्न ज्यामिति के साथ जटिल, टकराव-सघन हेरफेर कार्यों को संभालने में सक्षम बनाया जा सके और स्थिर, प्रिमिटिव-आधारित बेसलाइनों की तुलना में नवीन बाधाओं के प्रति उल्लेखनीय रूप से बेहतर मजबूती प्रदान की जा सके।

मूल लेखक: Remo Steiner, Vikram Ramasamy, David Tingdahl, Sam Mady, Karl Van Wyk, Nathan Ratliff, David Recasens Lafuente, Soha Pouya, Tuur Stuyck, Alex Millane

प्रकाशित 2026-09-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Remo Steiner, Vikram Ramasamy, David Tingdahl, Sam Mady, Karl Van Wyk, Nathan Ratliff, David Recasens Lafuente, Soha Pouya, Tuur Stuyck, Alex Millane

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

रोबोट कारखानों की सुरक्षा छोड़कर घरों और अस्पतालों की अव्यवस्थित, अप्रत्याशित दुनिया में प्रवेश करने लगे हैं। इन स्थानों में नेविगेट करने के लिए, एक मशीन को केवल पूर्व-निर्धारित निर्देशों के सेट की आवश्यकता नहीं होती; उसे अपने आस-पास के कमरे के आकार को समझने की आवश्यकता होती है। वर्षों से, शोधकर्ताओं ने रोबोट को 'रीइन्फोर्समेंट लर्निंग' (reinforcement learning) नामक एक विधि का उपयोग करके सिखाने का प्रयास किया है, जहाँ मशीन परीक्षण और त्रुटि (trial and error) के माध्यम से सीखती है, ठीक वैसे ही जैसे एक बच्चा चलना सीखता है। हालाँकि, जब जटिल कार्यों की बात आती है, जैसे कि किताबों के ढेर को गिराए बिना एक मग को उठाकर कैबिनेट में रखना, तो यह सीखने की प्रक्रिया अक्सर रुक जाती है। रोबोट दुनिया की ज्यामिति (geometry) के बारे में तर्क करने में संघर्ष करता है, और अक्सर उन वस्तुओं से टकरा जाता है जिन्हें वह देख नहीं पाता या याद नहीं रख पाता। एक सामान्य समाधान रोबोट को उसके परिवेश का एक सरल, हाथ से बना हुआ मानचित्र देना रहा है, लेकिन ये स्थिर मानचित्र तब विफल हो जाते हैं जब वास्तविक दुनिया बदल जाती है या जब वस्तुएं इतनी जटिल होती हैं कि उन्हें सरल आकृतियों द्वारा वर्णित नहीं किया जा सकता।

NVIDIA के शोधकर्ताओं की एक टीम ने इस अंतर को पाटने का एक नया तरीका विकसित किया है, जिससे रोबट अपने वातावरण की एक लाइव, त्रि-आयामी (3D) समझ विकसित करते हुए जटिल कौशल सीख सकते हैं। उनका दृष्टिकोण, जिसे वे WeaveRL कहते हैं, रीइन्फोर्समेंट लर्निंग की परीक्षण-और-त्रुटि वाली पद्धति को एक उच्च-गति वाली प्रणाली के साथ जोड़ता है जो वास्तविक समय में दृश्य का पुनर्निर्माण करती है। पहले से बने मानचित्र या आकृतियों की एक सरल सूची पर निर्भर रहने के बजाय, रोबोट चलते समय दुनिया का एक विस्तृत, गतिशील मॉडल बनाने के लिए अपने कैमरों का उपयोग करता है। इस मॉडल को सीधे रोबोट के नियंत्रण तंत्र (control system) में फीड किया जाता है, जो एक सुरक्षा जाल (safety net) के रूप में कार्य करता है, और रोबोट को उसके मुख्य कार्य पर ध्यान केंद्रित करने के दौरान लगातार टकराव से दूर ले जाता है। परिणाम स्वरूप, एक ऐसा रोबोट प्राप्त होता है जो भीड़भाड़ वाले स्थानों में वस्तुओं को संचालित करना सीख सकता है और महत्वपूर्ण रूप से, उन नई बाधाओं को भी संभाल सकता है जिन्हें उसने पहले कभी नहीं देखा है।

इस उपलब्धि का मूल एक विशाल कम्प्यूटेशनल समस्या को हल करने में निहित है। प्रभावी ढंग से सीखने के लिए, आधुनिक रीइन्फोर्समेंट लर्निंग सिस्टम अक्सर एक ही समय में हजारों सिमुलेशन चलाते हैं, जिससे रोबोटों की एक आभासी सेना बनती है जो समानांतर रूप से विभिन्न क्रियाओं का परीक्षण करती है। ऐतिहासिक रूप से, इन हजारों रोबोटों के लिए एक साथ एक विस्तृत 3D मानचित्र बनाना बहुत धीमा था और इसके लिए बहुत अधिक कंप्यूटर मेमोरी की आवश्यकता थी। शोधकर्ताओं ने एक अत्यधिक कुशल, समानांतर प्रणाली बनाकर इस बाधा को पार किया जो सतह के तत्वों (surface elements) के रूप में जाने जाने वाले छोटे, सपाट ज्यामितीय पैच का उपयोग करके दृश्य का पुनर्निर्माण करती है। इन पैच को छोटे, उन्मुख टाइल्स (oriented tiles) के रूप में कल्पना करें जो आपस में जुड़कर कमरे की दीवारों, मेजों और वस्तुओं का निर्माण करते हैं। इन टाइल्स को एक विशाल, संरचित ग्रिड में व्यवस्थित करके जो ग्राफिक्स प्रोसेसर पर पूरी तरह फिट बैठता है, सिस्टम एक ही क्षण में हजारों वातावरणों के लिए 3D मानचित्र को अपडेट कर सकता है। यह सीखने की प्रक्रिया को आधुनिक प्रशिक्षण के लिए आवश्यक गति से होने देता है, बिना टकराव से बचने के लिए आवश्यक विवरण से समझौता किए।

अपने प्रयोगों में, शोधकर्ताओं ने इस प्रणाली का परीक्षण विभिन्न कठिन हेरफेर कार्यों पर किया, जैसे कि अन्य वस्तुओं से भरी मेज से एक घन (cube) उठाना, या उसे बॉक्स या शेल्फ में रखना। उन्होंने पुराने दृष्टिकोणों के विरुद्ध तुलना की जो बाधाओं को दर्शाने के लिए सरल, हस्तनिर्मित आकृतियों पर निर्भर थे। परिणाम स्पष्ट थे। सबसे जटिल परिदृश्यों में, जहाँ रोबोट को भीड़भाड़ वाले तंग स्थानों से गुजरना था, पुराने तरीके पूरी तरह विफल रहे। सरल मानचित्रों का उपयोग करने वाले रोबोट बाधाओं से बचने में सक्षम नहीं थे क्योंकि मानचित्रों ने वातावरण के वास्तविक आकार को नहीं पकड़ा था। इसके विपरीत, नए, 'सीन-अवेयर' (scene-aware) सिस्टम का उपयोग करने वाले रोबोटों ने इन कार्यों को सफलतापूर्वक पूरा किया। इस प्रणाली ने रोबोट को दुनिया को उसके वास्तविक रूप में देखने, उसकी सभी अनियमितताओं और जटिलताओं के साथ, और उस जानकारी का उपयोग अपनी गतिविधियों को सुरक्षित रूप से निर्देशित करने के लिए करने की अनुमति दी।

शायद सबसे महत्वपूर्ण खोज यह थी कि इन रोबोटों ने अप्रत्याशित स्थितियों को कितनी अच्छी तरह संभाला। शोधकर्ताओं ने रोबोट को विशिष्ट कार्यों पर प्रशिक्षित किया और फिर उन्हें उन नई बाधाओं के साथ परखा जो प्रशिक्षण के दौरान मौजूद नहीं थीं। जब रोबोट के पथ में एक नया ऑब्जेक्ट, जैसे कि एक सिलेंडर, रखा गया, तो नए सिस्टम से प्रशिक्षित रोबोटों की सफलता की दर काफी अधिक थी। उन्होंने नए अवरोध से 61 प्रतिशत की सफलता दर के साथ बचाव किया, जबकि पुराने, सरल मानचित्रों का उपयोग करने वाले रोबोटों की दर केवल 35 प्रतिशत थी। यह मजबूती बताती है कि रोबोट केवल किसी विशिष्ट वस्तु से बचने के लिए एक विशिष्ट पथ को याद नहीं कर रहा है, बल्कि वास्तव में स्थान की ज्यामिति को समझ रहा है और वास्तविक समय में उस पर प्रतिक्रिया दे रहा है। यह प्रणाली लगातार रोबोट के हाथ और 3D मानचित्र में निकटतम सतह के बीच की दूरी की गणना करके काम करती है, जिससे एक सौम्य प्रतिकर्षण बल (repulsive force) उत्पन्न होता है जो टकराव होने से पहले हाथ को खतरे से दूर धकेलता है।

शोधकर्ताओं ने यह भी प्रदर्शित किया कि यह दृष्टिकोण न केवल सिमुलेशन में, बल्कि वास्तविक दुनिया में भी काम करता है। उन्होंने एक भौतिक हाथ (physical arm) पर प्रशिक्षित रोबोट को तैनात किया जो एक ग्रिपर से लैस था, जिसे वास्तविक रसोई जैसे वातावरण में वस्तुओं को हिलाने का कार्य दिया गया था। रोबोट ने एक शेल्फ में घन रखने जैसे कार्यों को सफलतापूर्वक पूरा किया, और किनारों से टकराए बिना सीमित स्थान के चारों ओर नेविगेट किया। यहाँ तक कि जब बिना किसी पूर्व चेतावनी के एक भौतिक बाधा, जैसे कि कार्डबोर्ड बॉक्स, रोबोट के पथ में रखा गया, तो सिस्टम ने टक्कर से बचने के लिए दृश्य के लाइव पुनर्निर्माण पर भरोसा करते हुए हाथ को उसके चारों ओर निर्देशित किया। वर्चुअल ट्रेनिंग ग्राउंड से फिजिकल एनवायरनमेंट में बिना पुन: प्रशिक्षण के स्थानांतरित होने की यह क्षमता रोबोट को रोजमर्रा की जिंदगी में उपयोगी बनाने की दिशा में एक महत्वपूर्ण कदम है।

यह अध्ययन रोबोट के दुनिया को देखने के तरीके में आए बदलाव को रेखांकित करता है। एक स्थिर, पूर्व-निर्धारित मॉडल या पिक्सेल की कच्ची धारा (raw stream) पर निर्भर रहने के बजाय, जिसे रोबट को शुरुआत से व्याख्या करनी पड़ती है, यह विधि वातावरण का एक निरंतर, उच्च-सटीक (high-fidelity) प्रतिनिधित्व प्रदान करती है जो हर क्षण अपडेट होता है। रोबोट कार्य करने के लिए सीखता है, जबकि अंतर्निहित प्रणाली टकराव से बचने की जटिल गणितीय गणनाओं को संभालती है। यह अलगाव सीखने की प्रक्रिया को लक्ष्य पर ध्यान केंद्रित करने की अनुमति देता है, जबकि सुरक्षा तंत्र यह सुनिश्चित करता है कि रोबोट कुछ भी तोड़े नहीं या खुद को चोट न पहुँचाए। शोधकर्ता बताते हैं कि हालांकि वर्तमान में यह प्रणाली स्थिर कैमरों के साथ सबसे अच्छा काम करती है, भविष्य के कार्य इसे चलते हुए कैमरों, जैसे कि रोबोट के सिर या कलाई पर लगे कैमरों के लिए अनुकूलित करने पर केंद्रित होंगे। दृश्य के पुनर्निर्माण को सीखने की प्रक्रिया के ताने-बाने में बुनकर, यह कार्य उन रोबोटों के लिए एक स्केलेबल आधार प्रदान करता है जो वास्तविक दुनिया के असंरचित, बदलते वातावरण में सुरक्षित और प्रभावी ढंग से काम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →