← नवीनतम पेपर
🤖 AI

A Schema Bounded Language Model for Refining Robot Policies Without Destabilizing Local Learning

यह शोध पत्र विषम रोबोटों (heterogeneous robots) के लिए एक विकेंद्रीकृत नेविगेशन ढांचे को प्रस्तुत करता है जो UCB और Double DQN नियंत्रकों के साथ LLM-आधारित नीति परिशोधन (policy refinement) को एकीकृत करता है, यह प्रदर्शित करते हुए कि टिक-स्तर (tick-level) की क्रियाओं के लिए स्थानीय शिक्षण का उपयोग करते हुए राउंड-स्तर के अपडेट तक LLM अनुमान (inference) को सीमित करने से अन्य कॉन्फ़िगरेशन की तुलना में लक्ष्य पूर्णता दर में काफी सुधार होता है और पूर्णता समय में कमी आती है।

मूल लेखक: Chongwen Dong, Mithun Paul Saint-Germain, Pinjari Asif, Carlo R. daCunha

प्रकाशित 2026-09-07
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chongwen Dong, Mithun Paul Saint-Germain, Pinjari Asif, Carlo R. daCunha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि रोबोटों की एक टीम एक पहेली को हल करने की कोशिश कर रही है, लेकिन प्रत्येक रोबोट अलग-अलग गति से सोचता और चलता है। रोबोटिक्स की दुनिया में, बड़े भाषा मॉडल (Large Language Models) का उपयोग करने में बढ़ती दिलचस्पी है—वही शक्तिशाली कंप्यूटर प्रोग्राम जो कहानियाँ लिख सकते हैं या जटिल प्रश्नों के उत्तर दे सकते हैं—मशीनों को उनके कार्यों को समझने में मदद करने के लिए। ये मॉडल उच्च-स्तरीय सोच के लिए उत्कृष्ट हैं, जैसे कि यह तय करना कि "दरवाजे की ओर जाओ" या "बाधा से बचो।" हालांकि, वे अक्सर उन क्षणिक निर्णयों के लिए बहुत धीमे होते हैं जिनकी आवश्यकता हर सेकंड के कुछ हिस्से में दीवार से टकराने से बचने के लिए होती है। यह इंजीनियरों के लिए एक कठिन समस्या पैदा करता है: आप एक स्मार्ट, धीमे विचारक का उपयोग एक तेज़, प्रतिक्रियाशील मूवर (mover) को निर्देशित करने के लिए कैसे कर सकते हैं बिना धीमे विचारक को बाधा डाले? यदि रोबट हर एक कदम के लिए कंप्यूटर से पूछता है, तो पूरा सिस्टम रुक जाएगा। यदि कंप्यूटर कभी नहीं बोलता, तो रोबोट एक लूप में फंस सकता है, अपनी गलतियों से सीखने में असमर्थ हो सकता है।

यह चुनौती उत्तरी एरिज़ोना यूनिवर्सिटी और न्यू जर्सी इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं के एक नए अध्ययन के केंद्र में है। वे यह देखना चाहते थे कि क्या वे एक ऐसा सिस्टम बना सकते हैं जहाँ रोबोटों की एक टीम कार्य पूरा करने के बाद जो कुछ भी सीखा है उसे साझा कर सके, अगले दौर के लिए अपनी रणनीति में सुधार करने के लिए उस साझा ज्ञान का उपयोग कर सके, और फिर अपने स्वयं के तेज़, स्थानीय नियंत्रकों (local controllers) को वास्तविक हलचल संभालने दे। शोधकर्ताओं ने तीन रोबोटों के साथ एक सिमुलेशन सेट किया, जिनमें से प्रत्येक के पास एक अलग बड़े भाषा मॉडल पर आधारित अपना अनूठा "मस्तिष्क" था। इन रोबोटों को एक विशिष्ट लक्ष्य तक पहुँचने के लिए एक आभासी स्थान (virtual space) में नेविगेट करना था। मुख्य नवाचार एक दो-स्तरीय दृष्टिकोण था: एक धीमा, विचारशील स्तर जो केवल एक दौर समाप्त होने के बाद रोबोटों की सामान्य रणनीति को अपडेट करता था, और एक तेज़, प्रतिक्रियाशील स्तर जो प्रत्येक 'टिक' (tick) के साथ तत्काल गतिविधियों को संभालता था। रोबोट किसी केंद्रीय कमांडर से जुड़े नहीं थे; इसके बजाय, उन्होंने एक सरल डिजिटल बुलेटिन बोर्ड साझा किया जहाँ वे अपने परिणाम और सीखे गए सबक पोस्ट करते थे, जिससे प्रत्येक रोबोट अपने समूह के अनुभव के आधार पर अपनी योजना को परिष्कृत कर सका।

शोधकर्ताओं ने यह देखने के लिए कि कौन सा तरीका सबसे अच्छा काम करता है, टीम वर्क को व्यवस्थित करने के चार अलग-अलग तरीकों का परीक्षण किया। पहले सेटअप में, प्रत्येक रोबोट केवल अपने स्वयं के इतिहास और एक बुनियादी सीखने की प्रणाली पर निर्भर था, उनके बीच सूचना साझा करने की कोई व्यवस्था नहीं थी। दूसरे में, रोबोट साझा बुलेटिन बोर्ड को पढ़ सकते थे और अपनी रणनीति को बदलने के लिए एक सरल गणितीय नियम का उपयोग कर सकते थे, लेकिन वे अभी भी गति के लिए उसी बुनियादी सीखने की प्रणाली का उपयोग कर रहे थे। तीसरे सेटअप में सीखने की प्रणाली को पूरी तरह से हटा दिया गया, जिससे रोबोटों को सीधे भाषा मॉडल के निर्देशों का पालन करने के लिए मजबूर किया गया बिना किसी स्थानीय अनुकूलन के। अंतिम, सबसे पूर्ण सेटअप ने साझा बुलेटिन बोर्ड, रणनीति-संशोधन नियम और एक अधिक उन्नत सीखने की प्रणाली को मिलाया जो भाषा मॉडल के सुझावों पर ध्यान देते हुए अपने स्वयं के तेज़ निर्णय ले सकता था।

परिणामों ने दिखाया कि सबसे पूर्ण सिस्टम सबसे प्रभावी था। सिमुलेशन में, इस पूर्ण विन्यास ने रोबोटों को नब्बे अलग-अलग प्रयासों में हर बार अपने लक्ष्य तक पहुँचने की अनुमति दी। इससे भी महत्वपूर्ण बात यह है कि यह सबसे तेज़ था। इस समूह के रोबोटों ने 69 'टिक्स' (सिमुलेशन में समय की एक इकाई) के मुकाबले 42 टिक्स के औसत समय में अपना लक्ष्य प्राप्त किया। पूर्ण सिस्टम का प्रदर्शन भी सबसे सुसंगत था, जिसमें रोबंडों द्वारा असामान्य रूप से लंबा समय लेने के बहुत कम मामले देखे गए। शोधकर्ताओं ने पाया कि प्रयोग के साथ-साथ रोबोटों में काफी सुधार हुआ; पहले कुछ दौरों में उन्हें पूरा करने में लगने वाला औसत समय 57 टिक्स से घटकर अंतिम दौरों में केवल 41 टिक्स रह गया। यह बताता है कि सूचना साझा करने और एक स्मार्ट स्थानीय नियंत्रक का उपयोग करने के संयोजन ने टीम को तेज़ी से सीखने और अनुकूलित होने की अनुमति दी।

दिलचस्प बात यह है कि अध्ययन ने यह भी खुलासा किया कि केवल एक साझा बुलेटिन बोर्ड या एक स्मार्ट स्ट्रैटेजी-ट्वीकर (strategy-tweaker) होना पर्याप्त नहीं था। वे रोबोट जिन्होंने सूचना साझा की लेकिन उन्नत स्थानीय शिक्षण प्रणाली की कमी थी, वे शुरुआत में प्रतिस्पर्धी थे लेकिन जैसे-जैसे प्रयोग आगे बढ़ा, वे वास्तव में धीमे होते गए। यह इंगित करता है कि विचार साझा करना सहायक है, लेकिन केवल तभी जब रोबोटों के पास एक पर्याप्त परिष्कृत स्थानीय प्रणाली हो कि वे उन विचारों को अपनी तत्काल गतिविधियों पर कैसे लागू करें। अध्ययन ने यह भी नोट किया कि प्रत्येक रोबोट के लिए उपयोग किए जाने वाले विशिष्ट भाषा मॉडल के प्रकार ने कोई स्पष्ट विजेता नहीं बनाया; प्रदर्शन इस बात पर अधिक निर्भर था कि पूरे सिस्टम को कैसे बनाया गया था, न कि उपयोग किए गए विशिष्ट 'कंप्यूटर मस्तिष्क' पर।

शोधकर्ता इस बात पर ध्यान देने में सावधानी बरतते हैं कि ये परिणाम एक कंप्यूटर सिमुलेशन से आते हैं, न कि एक वास्तविक कमरे में भौतिक धातु के रोबोटों के परीक्षण से। अध्ययन में सभी रोबोट गति करने के तरीके में समान थे, वे केवल अपने सॉफ्टवेयर मस्तिष्क और निर्णय लेने की प्रक्रियाओं में भिन्न थे। हालांकि परिणाम उत्साहजनक हैं, लेखक इस बात पर जोर देते हैं कि यह एक नियंत्रित वातावरण में सिस्टम के व्यवहार का वर्णन है, न कि इस बात की गारंटी कि यह वास्तविक दुनिया की अव्यवस्थित और अप्रत्याशित परिस्थितियों में बिल्कुल वैसा ही काम करेगा। उन्होंने यह दावा नहीं किया कि उन्होंने रोबोट टीम वर्क की समस्या को हमेशा के लिए हल कर दिया है, बल्कि उन्होंने उच्च-स्तरीय सोच को निम्न-स्तरीय क्रिया से अलग करने का एक स्पष्ट, कामकाजी उदाहरण प्रदान किया है ताकि एक टीम बिना भ्रमित हुए मिलकर सीख सके।

अंत में, यह अध्ययन स्मार्ट रोबोट टीमों के निर्माण के लिए एक व्यावहारिक ब्लूप्रिंट प्रदान करता है। यह दिखाता है कि आपको मशीनों के समूह को नियंत्रित करने के लिए एक एकल सुपर-कंप्यूटर की आवश्यकता नहीं है। इसके बजाय, आप प्रत्येक रोबोट को उसकी अपनी आवाज़ और सोचने का अपना तरीका दे सकते हैं, उन्हें बाद में अपनी सफलताओं और विफलताओं को साझा करने दें, और अपने स्थानीय नियंत्रकों पर तत्काल विवरणों को संभालने के लिए भरोसा करें। उच्च-स्तरीय सोच और तेज़ कार्रवाई को अलग-अलग लेन में रखकर, टीम तब अधिक तेज़ी से और बेहतर ढंग से चल सकती है और सीख सकती है जब वे एक साथ सब कुछ करने की कोशिश करती है। यह दृष्टिकोण, जिसे शोधकर्ता 'स्कीमा-बाउंडेड लैंग्वेज मॉडल' (schema-bounded language model) कहते हैं, स्वायत्त प्रणालियों को बनाने के लिए एक मार्ग सुझाता है जो विचारशील और फुर्तीले दोनों हैं, और बिना लड़खड़ाए नई चुनौतियों के अनुकूल होने में सक्षम हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →