← नवीनतम पेपर
🤖 AI

LePlanner: An Iterative Amortized Controller For World Models

LePlanner एक इटरेटिव एमोर्टाइज्ड कंट्रोलर है जो कॉन्टैक्ट-रिच वातावरण में तेज़, होराइजन-अवेयर प्लानिंग प्राप्त करने के लिए अ राइवल-एंड-होल्ड ऑब्जेक्टिव के साथ एक फ्रोजन वर्ल्ड मॉडल पर प्रशिक्षित होता है, जो महंगी सर्च-आधारित विधियों के प्रदर्शन से मेल खाता है और साथ ही कम्प्यूटेशनल लेटेंसी को काफी कम करता है।

मूल लेखक: Saksham Bansal, Om Naphade, Chayan Aggarwal, Vrishin M

प्रकाशित 2026-09-15
📖 9 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Saksham Bansal, Om Naphade, Chayan Aggarwal, Vrishin M

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

वास्तविक दुनिया में चलने वाली मशीनें बनाने की खोज में, वैज्ञानिक लंबे समय से "वर्ल्ड मॉडल्स" (विश्व मॉडल) नामक एक रणनीति पर भरोसा करते रहे हैं। एक ऐसे रोबोट की कल्पना करें जो केवल उस चीज़ पर प्रतिक्रिया नहीं देता जो वह उस क्षण में देख रहा है, बल्कि यह भी बनाता है कि दुनिया कैसे काम करती है। एक भी मांसपेशी हिलाने से पहले, वह अपने मन में हजारों काल्पनिक परिदृश्यों को चलाता है, विभिन्न क्रियाओं का परीक्षण करता है ताकि यह देखा जा सके कि कौन सी क्रिया वांछित परिणाम की ओर ले जाती है। यह दृष्टिकोण एक एजेंट को आगे की योजना बनाने की अनुमति देता है, ठीक वैसे ही जैसे एक इंसान कदम उठाने से पहले भीड़भाड़ वाले कमरे में अपने रास्ते की कल्पना करता है। हालाँकि, इस प्रक्रिया में एक निरंतर बाधा बनी रहती है। इन मानसिक सिमुलेशन को उपयोगी बनाने के लिए, रोबोट को या तो हर संभावित पथ की गणना करने में बहुत अधिक समय खर्च करना पड़ता है, जिससे वह धीमा और सुस्त हो जाता है, या उसे एक सरल, पूर्व-सीखे गए व्यवहार (habit) पर निर्भर रहना पड़ता है जो आसान स्थितियों में तो अच्छा काम करता है लेकिन जटिल होने या सटीक भौतिक संपर्क की आवश्यकता होने पर अक्सर विफल हो जाता है।

भारतीय प्रौद्योगिकी संस्थान रुड़की के शोधकर्ताओं ने LePlanner नामक एक नई विधि विकसित की है जो इस अंतर को पाटती है। उन्होंने एक ऐसा सिस्टम बनाया है जो भारी-भरकम गणना या कठोर नकल के बजाय, त्वरित, पुनरावृत्ति समायोजनों (iterative adjustments) की एक श्रृंखला के माध्यम से अपनी योजनाओं को परिष्कृत करना सीखता है। टीम ने इस सिस्टम को चार अलग-अलग सिम्युलेटेड वातावरणों पर प्रशिक्षित किया, जिसमें एक रोबोटिक आर्म द्वारा T-आकार की वस्तु को धकेलने से लेकर दो जुड़े हुए कमरों के माध्यम से एक पात्र (character) के नेविगेशन तक शामिल था। इन परीक्षणों में, LePlanner ने कुछ कार्यों पर 100 प्रतिशत तक सफलता दर हासिल की, जो सबसे अधिक गणनात्मक रूप से महंगी नियोजन विधियों के प्रदर्शन से मेल खाती है, जबकि इसके लिए सैकड़ों गुना कम प्रेडिक्टर इनवोकेशन (predictor invocations) की आवश्यकता पड़ी। इसकी सफलता की कुंजी इस बात में थी कि सिस्टम को अपने लक्ष्य तक पहुँचने के लिए कैसे सिखाया गया। इसे केवल एक निश्चित समय सीमा के अंत में पहुँचने के लिए नहीं बताया गया, बल्कि इसे लक्ष्य तक जल्द से जल्द पहुँचने और फिर वहीं बने रहने के लिए पुरस्कृत किया गया। प्रशिक्षण में इस सरल बदलाव ने रोबोट को हिचकिचाने या आगमन में देरी करने से रोका, जिससे वह जटिल भौतिक स्थितियों में बिना हर एक चाल को रोकने या पुनर्गणना किए, तेज़ और विश्वसनीय निर्णय लेने में सक्षम हुआ।

शोधकर्ताओं ने जिस मूल चुनौती का समाधान किया है वह कृत्रिम बुद्धिमत्ता नियोजन (AI planning) में एक मौलिक ट्रेड-ऑफ (समझौता) है। विधियों का एक परिवार, जिसे सर्च-बेस्ड प्लानर्स (search-based planners) कहा जाता है, सैकड़ों या हजारों संभावित भविष्य के पथ उत्पन्न करके और सर्वोत्तम विकल्प खोजने के लिए प्रत्येक का मूल्यांकन करके काम करता है। जबकि ये विधियाँ अत्यधिक सटीक होती हैं, वे अविश्वसनीय रूप से धीमी होती हैं क्योंकि रोबोट द्वारा प्रत्येक निर्णय के लिए दुनिया के मॉडल को हजारों बार चलाना पड़ता है। इस उच्च विलंबता (latency) का अर्थ है कि रोबोट वास्तविक समय के कार्यों के लिए बहुत धीरे प्रतिक्रिया करता है। दूसरी ओर पॉलिसी-बेस्ड (policy-based) विधियाँ हैं, जो एक ही चरण में स्थिति को सीधे क्रिया से जोड़ने के लिए सीखती हैं। ये तेज़ हैं लेकिन नाजुक (brittle) हैं; वे अक्सर तब विफल हो जाती हैं जब कार्य में जटिल भौतिक संपर्क शामिल होता है, जैसे कि धक्का देना या पकड़ना, क्योंकि वे केवल प्रशिक्षण डेटा में देखी गई क्रियाओं को याद करती हैं और स्थिति बदलने पर अनुकूलित नहीं हो पाती हैं। शोधकर्ताओं ने पाया कि दोनों में से कोई भी दृष्टिकोण वह आदर्श संयोजन प्रदान नहीं करता जो सीखे गए मानसिक स्थान में विश्वसनीय नियंत्रण के लिए आवश्यक गति और मजबूती (robustness) प्रदान कर सके।

इसे हल करने के लिए, टीम ने एक इटरेटिव कंट्रोलर (पुनरावृत्ति नियंत्रक) पेश किया जो नियोजन प्रक्रिया को एम्ोर्टाइज (amortize) करता है। एक विशाल खोज चलाने या एकल अनुमान लगाने के बजाय, सिस्टम एक प्रारंभिक योजना से शुरू होता है और फिर उसे कुछ बार परिष्कृत करता है, ठीक वैसे ही जैसे कोई व्यक्ति मानचित्र पर एक मार्ग का रेखाचित्र बनाता है और फिर इलाके के बारे में गहराई से सोचते हुए मोड़ों को समायोजित करता है। यह परिभाषीकरण (refinement) एक सीखी गई प्रक्रिया के माध्यम through होता है जहाँ सिस्टम अपने स्वयं के कल्पित भविष्य को देखता है, जाँच करता है कि वह लक्ष्य के कितने करीब है, और योजना में छोटे सुधार करता है। महत्वपूर्ण रूप से, यह पूरी प्रक्रिया तेज़ और कुशल होने के लिए प्रशिक्षित की गई है, जिसमें प्रत्येक निर्णय के लिए केवल कुछ ही गणनाओं की आवश्यकता होती है। सिस्टम एक 'फ्रोजन वर्ल्ड मॉडल' (frozen world model) का उपयोग करता है, जिसका अर्थ है कि भौतिकी और दृष्टि की अंतर्निहित समझ स्थिर और पूर्व-प्रशिक्षित रखी जाती है, जबकि नियोजन नियंत्रक उस निश्चित समझ के भीतर नेविगेट करना सीखता है। यह अलगाव शोधकर्ताओं को पूरे विज़न सिस्टम को फिर से प्रशिक्षित किए बिना नियोजन रणनीति में सुधार करने की अनुमति देता है, जिससे यह प्रक्रिया स्थिर और कुशल बनती है।

पेपर का एक बड़ा हिस्सा पिछले नियोजन प्रणालियों में पाए गए एक सूक्ष्म लेकिन महत्वपूर्ण विफलता मोड पर केंद्रित है, जिसे लेखकों ने "होराइजन-रीसेट प्रोक्रैस्टिनेशन" (horizon-reset procrastination - क्षितिज-रीसेट टालमटोल) कहा है। कई मानक नियोजन सेटअपों में, सिस्टम को एक निश्चित समय अवधि के बिल्कुल अंत में लक्ष्य तक पहुँचने के लिए प्रशिक्षित किया जाता है। जब रोबोट वास्तविक दुनिया में अपनी योजना को निष्पादित करता है, तो वह अगले क्षण के लिए पुन: नियोजन करने से पहले केवल पहले कुछ कदम ही उठा पाता है। क्योंकि हर नए प्लान के साथ डेडलाइन (समय सीमा) लगातार रीसेट होती रहती है, सिस्टम लक्ष्य के करीब पहुँचने लेकिन कभी भी पूरी तरह न पहुँचने की आदत सीख लेता है, और आगमन के समय को लगातार भविष्य में धकेलता रहता है। शोधकर्ताओं ने प्रदर्शित किया कि यह व्यवहार रोबोट को तब भी विफल कर देता है जब वह शारीरिक रूप से लक्ष्य तक पहुँचने में सक्षम होता है। इसे ठीक करने के लिए, उन्होंने "अराइवल-एंड-होल्ड" (आगमन और ठहराव) नामक एक नया प्रशिक्षण उद्देश्य पेश किया। यह विधि सिस्टम को सबसे पहले संभव क्षण में लक्ष्य तक पहुँचने और फिर वहीं बने रहने के लिए पुरस्कृत करती है, न कि एक निश्चित समय सीमा की प्रतीक्षा करने के लिए। लक्ष्य तक तत्काल आगमन और स्थिरता को महत्व देकर, उन्होंने टालमटोल वाले व्यवहार को समाप्त कर दिया, जिससे रोबोट को ऐसे प्लान निष्पादित करने में सक्षम बनाया गया जो कितनी भी बार पथ का पुनर्मूल्यांकन करने के बावजूद सुसंगत और प्रभावी हों।

इन प्रयोगों के परिणाम आश्चर्यजनक थे। एक रोबोटिक आर्म द्वारा T-आकार की वस्तु को एक विशिष्ट स्थान पर धकेलने के परीक्षणों में, नया सिस्टम ने 98 प्रतिशत सफलता दर प्राप्त की जब उसने हर एक गतिविधि के बाद पुन: नियोजन किया। यह प्रदर्शन धीमी, भारी सर्च-बेस्ड विधियों के तुलनीय था, लेकिन इसे बहुत कम गणनात्मक प्रयास के साथ प्राप्त किया गया। विशेष रूप से, नए सिस्टम को पारंपरिक खोज विधियों की तुलना में प्रति निर्णय लगभग 2,250 गुना कम प्रेडिक्टर ट्रांजिशन (लेटेंट रोलआउट्स) की आवश्यकता थी। अन्य कार्यों में, जैसे कि एक रोबोटिक आर्म का लक्ष्य तक पहुँचना या एक पात्र का दरवाजे के माध्यम से नेविगेट करना, सिस्टम ने क्रमशः 100 प्रतिशत और 92 प्रतिशत की सफलता दर प्राप्त की। ये संख्याएँ दर्शाती हैं कि सिस्टम न केवल तेज़ है, बल्कि जटिल, संपर्क-युक्त वातावरण में अधिक विश्वसनीय भी है जहाँ साधारण नकल रणनीतियाँ आमतौर पर विफल हो जाती हैं। शोधकर्ताओं ने नोट किया कि सिस्टम का प्रदर्शन पुन: नियोजन की आवृत्ति बदलने पर भी स्थिर रहा, जो यह सुझाव देता है कि सीखा गया व्यवहार मजबूत था और किसी विशिष्ट समय सारणी पर निर्भर नहीं था।

अध्ययन ने सिस्टम के कार्यों को उस दायरे के भीतर रखने के महत्व पर भी प्रकाश डाला जो उसने पहले देखा है। शोधकर्ताओं ने एक प्रतिबंध जोड़ा जिसने प्लानर को ऐसी क्रियाएं सुझाने से रोका जो प्रशिक्षण डेटा के वितरण से बहुत बाहर थीं। इसने एक सुरक्षा घेरे (guardrail) के रूप में कार्य किया, यह सुनिश्चित करते हुए कि रोबвट ऐसी असंभव या खतरनाक युद्धाभ्यास करने की कोशिश न करे जो वर्ल्ड मॉडल ने शायद भ्रमवश (hallucinate) निर्मित किए हों। इस प्रतिबंध के बावजूद, सिस्टम केवल प्रशिक्षण डेटा से क्रियाओं की नकल नहीं कर रहा था; यह लक्ष्यों तक पहुँचने के लिए सक्रिय रूप से नई योजनाएँ बना रहा था। एक परीक्षण में, सिस्टम की पहली अनुमानित क्रिया विशेषज्ञ प्रदर्शन (expert demonstration) से काफी भिन्न थी, फिर भी वह उच्च सटीकता के साथ लक्ष्य तक पहुँचा। यह सिद्ध करता है कि सिस्टम केवल चालों के क्रम को याद करने के बजाय तर्क के माध्यम से कार्य को हल करना सीख रहा है।

शोधकर्ताओं ने चार अलग-अलग वातावरणों में कठोर परीक्षण के माध्यम से अपने निष्कर्षों को मान्य किया, जिसमें नए मेथड और मौजूदा दृष्टिकोणों के बीच निष्पक्ष तुलना सुनिश्चित करने के लिए साझा शुरुआती स्थितियों का उपयोग किया गया। उन्होंने न केवल सफलता दर को मापा, बल्कि प्रत्येक निर्णय लेने में लगने वाले समय को भी मापा, जिससे पता चला कि नया सिस्टम पारंपरिक खोज विधियों की तुलना में कार्य के आधार पर 3 से 49 गुना तेज़ था। अध्ययन में रोबोट के कल्पित भविष्य के विस्तृत दृश्य (visualizations) भी शामिल थे, जो दिखाते हैं कि सिस्टम के मानसिक सिमुलेशन वास्तविक दुनिया की क्रियाओं को निर्देशित करने के लिए पर्याप्त सटीक थे। एक दरवाजे के माध्यम से नेविगेट करने के मामले में, सिस्टम ने दरवाजे के माध्यम से जाने वाले पथ का सही अनुमान लगाया, जबकि अन्य विधियाँ अक्सर फंस गईं या दीवार से टकराने का भ्रम (hallucination) पैदा किया। इन दृश्य जांचों ने पुष्टि की कि सुधार केवल सांख्यिकीय कलाकृतियाँ नहीं थे, बल्कि यह उनके वातावरण के भीतर सिस्टम की समझ और नियोजन में वास्तविक सुधार को दर्शाते थे।

अंततः, यह कार्य प्रदर्शित करता है कि नियोजन के लिए आवश्यक जटिल तर्क का एक बड़ा हिस्सा सीखा जा सकता है और एक हल्के, पुनरावृत्ति नीति (iterative policy) में संकुचित किया जा सकता है। वर्ल्ड मॉडल की भविष्य कहने वाली शक्ति को एक परिष्कृत प्रशिक्षण उद्देश्य के साथ जोड़कर, जो समय पर आगमन को प्रोत्साहित करता है, शोधकर्ताओं ने एक ऐसा कंट्रोलर बनाया है जो तेज़ और मजबूत दोनों है। सिस्टम को निर्णय के समय ऑनलाइन ऑप्टिमाइज़ेशन या भारी गणना की आवश्यकता नहीं होती है, जो इसे वास्तविक समय के अनुप्रयोगों के लिए उपयुक्त बनाता है जहाँ गति महत्वपूर्ण है। हालाँकि वर्तमान प्रयोग सिम्युलेटेड वातावरण में किए गए थे, इसके सिद्धांत वास्तविक दुनिया में अधिक कुशल और सक्षम रोबोटिक नियंत्रण के लिए एक मार्ग सुझाते हैं। LePlanner की सफलता यह संकेत देती है कि रोबोटिक नियोजन का भविष्य तेज़ कंप्यूटरों या अधिक जटिल खोजों में नहीं, बल्कि सोचने के अधिक स्मार्ट और कुशल तरीकों में निहित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →