From LLM-Generated Specifications to Learned Quadruped Locomotion
यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल प्राकृतिक भाषा विवरणों से पैरामीट्रिक सिग्नल टेम्पोरल लॉजिक (PSTL) विनिर्देश उत्पन्न कर सकते हैं ताकि व्याख्या योग्य रिवॉर्ड फंक्शन को स्वचालित रूप से व्युत्पन्न किया जा सके, जिससे क्वाड्रुपेड रोबोट्स को 100% सफलता दर के साथ मजबूत, उच्च-गति लोकोमोशन प्राप्त करने में सक्षम बनाया जा सके जो हस्तनिर्मित और कोड-आधारित रिवॉर्ड विधियों से काफी बेहतर प्रदर्शन करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
=== तकनीकी सारांश: LLM-जनित विनिर्देशों से सीखे गए क्वाड्रुपेड लोकोमोशन तक ===
समस्या विवरण
डीप रिइन्फोर्समेंट लर्निंग (RL) ने क्वाड्रुपेड रोबोट्स को फुर्तीले लोकोमोशन (locomotion) सीखने में सक्षम बनाया है, फिर भी प्रदर्शन काफी हद तक रिवॉर्ड फंक्शन के मैनुअल इंजीनियरिंग पर निर्भर करता है। इन रिवॉर्ड्स को डिजाइन करने के लिए डोमेन विशेषज्ञता की आवश्यकता होती है ताकि स्थानीय पदों (ट्रैकिंग, पोस्चर, ऊर्जा) को संतुलित किया जा सके और यह अक्सर प्रथम सिद्धांतों के बजाय अनुभवजन्य ट्यूनिंग (empirical tuning) पर निर्भर करता है। इसके अलावा, संख्यात्मक स्थानीय रिवॉर्ड्स वांछित वैश्विक टेम्पोरल व्यवहार (global temporal behavior) का स्पष्ट रूप से वर्णन करने में विफल रहते हैं, जो मल्टी-गेट लोकोमोशन के लिए विशेष रूप से महत्वपूर्ण है जहाँ वॉकिंग, ट्रॉटिंग और बाउंडिंग (bounding) में कॉन्टैक्ट टाइमिंग और सपोर्ट पैटर्न भिन्न होते हैं। हालांकि सिग्नल टेम्पोरल लॉजिक (STL) जैसे औपचारिक विनिर्देश व्याख्यात्मकता और मात्रात्मक मजबूती प्रदान करते हैं, फिर भी उन्हें मैन्युअल रूप से लिखना महत्वपूर्ण विशेषज्ञता की मांग करता है। इसके विपरीत, हालिया लार्ज लैंग्वेज मॉडल (LLM) दृष्टिकोण जो प्राकृतिक भाषा से सीधे रिवॉर्ड कोड जनरेट करते हैं, अक्सर जटिल टेम्पोरल बाधाओं के लिए आवश्यक संरचनात्मक कठोरता की कमी रखते हैं। यह शोध पत्र विशेषज्ञ डेटा के माध्यम से उनके संख्यात्मक मापदंडों को ग्राउंड (ground) करते हुए, व्याख्या योग्य और टेम्पोरली स्ट्रक्चर्ड रिवॉर्ड विनिर्देशों को उत्पन्न करने की खाई को संबोधित करता है।
कार्यप्रणाली (Methodology)
लेखक एक पाइपलाइन का प्रस्ताव करते हैं जो पैरामेट्रिक सिग्नल टेम्पोरल लॉजिक (PSTL) विनिर्देशों की संरचना (structure) उत्पन्न करने के लिए LLMs का लाभ उठाती है, जबकि विशेषज्ञ ट्रेजेक्टरीज का उपयोग उनके पैरामीटर्स को स्थापित करने और आउटपुट को फ़िल्टर करने के लिए किया जाता है।
LLM विनिर्देश पीढ़ी (Specification Generation):
- मॉडल्स (GPT-5.5 और Qwen 3.6) को प्राकृतिक भाषा लोकोमोशन उद्देश्यों और एक नियंत्रित STL व्याकरण के साथ प्रॉम्प्ट किया जाता है।
- महत्वपूर्ण रूप से, LLMs को केवल कमांड ट्रैकिंग, सुरक्षा और गेट स्ट्रक्चर के लिए सिम्बोलिक स्ट्रक्चर (टेम्प्लेट्स) प्रस्तावित करने के लिए कहा जाता है। संख्यात्मक थ्रेशोल्ड और टेम्पोरल कांस्टेंट्स को बाद में अनुमान लगाने के लिए सिम्बोलिक पैरामीटर्स के रूप में छोड़ दिया जाता है, जिससे LLM द्वारा मनमाने मानों के आविष्कार को रोका जा सके।
- दो सेटिंग्स का अन्वेषण किया गया है:
- गेट-अवेयर (मल्टी-गेट): प्रॉम्प्ट फ्रौडे नंबर (Froude number) ट्रांजिशन के आधार पर तीन स्पीड रिजीम (walking-trot, trot, bound) को परिभाषित करता है। LLM प्रत्येक रिजीम के लिए विशिष्ट विनिर्देश उत्पन्न करता है।
- गेट-एग्नोस्टिक (Gait-Agnostic): प्रॉम्प्ट विशिष्ट गेट्स को निर्धारित नहीं करता है, जिससे रोबोट को कॉन्टैक्ट पैटर्न खोजने की अनुमति मिलती है।
डेटा ग्राउंडिंग और एक्सपर्ट-कंसिस्टेंसी फ़िल्टरिंग:
- जनरेट किए गए PSTL टेम्प्लेट्स के संख्यात्मक मापदंडों का अनुमान प्रति रिजीम 50 विशेषज्ञ ट्रेजेक्टरीज के डेटासेट से लगाया जाता है।
- एक फ़िल्टरिंग तंत्र लागू किया जाता है: एक जनरेट किया गया विनिर्देश तभी रखा जाता है यदि विशेषज्ञ ट्रेजेक्टरीज पर उसका मीडियन रोबस्टनेस गैर-ऋणात्मक () हो। यह उन विनिर्देशों को हटा देता है जो विशेषज्ञ व्यवहार द्वारा व्यवस्थित रूप से उल्लंघन किए जाते हैं, यह सुनिश्चित करता है कि रिवॉर्ड सिग्नल प्रदर्शित क्षमता के साथ संरेखित हो।
रिवॉर्ड निर्माण और प्रशिक्षण:
- रिटेन किए गए विनिर्देशों को STL रोबस्टनेस सेमेantics का उपयोग करके स्मूथ, फाइनाइट-हिस्ट्री रिवॉर्ड फंक्शन्स में परिवर्तित किया जाता है।
- सक्रिय विनिर्देशों के लिए रोबस्टनेस वैल्यूज को सॉफ्ट-मिन (soft-min) फंक्शन का उपयोग करके एकत्रित किया जाता है और बड़े मैग्नीट्यूड द्वारा प्रभुत्व को रोकने के लिए के माध्यम से सामान्यीकृत किया जाता है।
- अंतिम स्केलर रिवॉर्ड सुरक्षा, ट्रैकिंग और पैटर्न पदों का भारित योग (weighted sum) है।
- नीतियों को Barkour क्वाड्रुपेड रोबोट के साथ MuJoCo XLA (MJX) सिमुलेशन वातावरण में प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन (PPO) का उपयोग करके प्रशिक्षित किया जाता है।
मुख्य योगदान
- LLM-एक्सपर्ट हाइब्रिड पाइपलाइन: एक अभिनव ढांचा जहाँ LLMs व्याख्या योग्य लोकोमोशन विनिर्देशों की सिम्बोलिक संरचना उत्पन्न करते हैं, जबकि विशेषज्ञ डेटा उनके संख्यात्मक मापदंडों को ग्राउंड करता है।
- एक्सपर्ट-कंसिस्टेंसी फ़िल्टर: उन LLM-जनरेटेड विनिर्देशों को हटाने के लिए एक तंत्र जो विशेषज्ञ व्यवहार (मीडियन रोबस्टनेस < 0) के विपरीत हैं, जिससे रिवॉर्ड में व्यवस्थित रूप से उल्लंघन किए गए बाधाओं के प्रवेश को रोका जा सके।
- फॉर्मुलेशन का तुलनात्मक मूल्यांकन: इस बात का अन्वेषण कि गेट स्ट्रक्चर को स्पष्ट रूप से निर्धारित करने (गेट-अवेयर) बनाम उभरते व्यवहार (गेट-एग्नोस्टिक) की अनुमति देने से सीखे गए लोकोमोशन पर क्या प्रभाव पड़ता है।
- बेंचमार्किंग: हैंड-इंजीनियर्ड ह्यूरिस्टिक्स, डायरेक्ट LLM-जनरेटेड रिवॉर्ड कोड (Text2Reward), और एक एक्सपर्ट-स्विचिंग ऑरेकल के विरुद्ध एक व्यापक तुलना।
परिणाम
अध्ययन प्रदर्शन का मूल्यांकन 0.3 m/s से 2.1 m/s तक की फॉरवर्ड स्पीड के लिए कॉस्ट ऑफ ट्रांसपोर्टेशन (CoT), सर्वाइवल रेट, कमांड सक्सेस और गेट मैच सहित मेट्रिक्स का उपयोग करके करता है।
गेट-एग्नोस्टिक प्रदर्शन:
- GPT-5.5 और Text2Reward (गेट-एग्नोस्टिक) ने सभी स्पीड्स पर कम CoT के साथ 100% सर्वाइवल और कमांड सक्सेस बनाए रखते हुए सबसे मजबूत मात्रात्मक प्रदर्शन हासिल किया।
- हालांकि, विजुअल इंस्पेक्शन ने एक गंभीर दोष का खुलासा किया: इन नीतियों ने पूरे स्पीड रेंज (0.3 m/s सहित) में एक "बाउंड-लाइक" (bound-like) कॉन्टैक्ट पैटर्न सीखा। इसके परिणामस्वरूप अप्राकृतिक, उच्च-कैडेन्स लेग मूवमेंट और वर्टिकल ऑसिलेशन हुए, जो दर्शाता है कि उच्च मात्रात्मक सफलता स्कोर गतिशील रूप से उपयुक्त नियंत्रण की गारंटी नहीं देते हैं।
- Qwen 3.6 (गेट-एग्नोस्टिक) m/s की गति पर जीवित रहने में विफल रहा।
गेट-अवेयर (मल्टी-गेट) प्रदर्शन:
- Qwen 3.6 (मल्टी-गेट): पूरी स्पीड रेंज (0.3–2.1 m/s) में 100% सर्वाइवल और कमांड सक्सेस प्राप्त की और हाई स्पीड पर लक्षित "बाउंड" गेट को सफलतापूर्वक मैच किया।
- GPT-5.5 (मल्टी-गेट): लो/मिड-स्पीड गेट्स को अच्छी तरह से कैप्चर किया लेकिन m/s की गति पर कमांड ट्रैकिंग में विफल रहा।
- Text2Reward (मल्टी-गेट): हाई स्पीड (1.9–2.1 m/s) पर पूरी तरह विफल रहा, हर रोलआउट में टर्मिनेशन हुआ।
- हैंड-इंजीनियर्ड (ह्यूरिस्टिक): उच्चतम गति (2.0–2.1 m/s) पर ट्रैकिंग सटीकता खो दी।
रोबस्टनेस होराइजन () पर एब्लेशन:
- छोटे टेम्पोरल होराइजन () ने आम तौर पर अधिक स्थिर और सफल नीतियां प्रदान कीं।
- लंबे होराइजन () ने अक्सर प्रदर्शन को खराब किया, क्योंकि STL में "ऑलवेज" () ऑपरेटर विंडो में सबसे खराब मान पर निर्भर करता है, जिससे पिछले उल्लंघन रिवॉर्ड सिग्नल में लंबे समय तक बने रहते हैं और क्रेडिट असाइनमेंट को जटिल बना देते हैं।
मॉडल तुलना:
- GPT-5.5 और Qwen 3.6 का सापेक्ष प्रदर्शन कंट्रोल सेटिंग पर अत्यधिक निर्भर था। GPT-5.5 ने गेट-एग्नोस्टिक सेटिंग में उत्कृष्टता प्राप्त की, जबकि Qwen 3.6 ने मल्टी-गेट सेटिंग में, विशेष रूप से उच्च गति पर, बेहतर प्रदर्शन किया।
महत्व और दावे
यह शोध दावा करता है कि पॉलिसी लर्निंग और LLM जनरेशन के बीच एक इंटरमीडिएट रिप्रेजेंटेशन के रूप में टेम्पोरल लॉजिक को डालना, डायरेक्ट रिवॉर्ड कोड जनरेशन (Text2Reward) की तुलना में उच्च-गति लोकोमोशन के लिए स्पष्ट लाभ प्रदान करता है। STL-आधारित दृष्टिकोण (विशेष रूप से मल्टी-गेट सेटिंग में Qwen 3.6) सफलतापूर्वक वांछित हाई-स्पीड "बाउंड" गेट को सीख सका जहाँ डायरेक्ट कोड जनरेशन विफल रहा।
हालाँकि, लेखक अपने निष्कर्षों के संबंध में एक मध्यम रुख बनाए रखते हैं:
- कोई सार्वभौमिक प्रभुत्व नहीं: कोई भी एकल रिवॉर्ड फॉर्मुलेशन दोनों टास्क सेटिंग्स (गेट-अवेयर बनाम एग्नोस्टिक) और सभी मूल्यांकन मानदंडों में सार्वभौमिक रूप से हावी नहीं है।
- मात्रात्मक मेट्रिक्स की सीमाएं: परिणाम इस बात पर प्रकाश डालते हैं कि उच्च कमांड-ट्रैकिंग सफलता, इच्छित गेट स्ट्रक्चर या प्राकृतिक गति की रिकवरी की गारंटी नहीं देती है, जैसा कि गेट-एग्नोस्टिक नीतियों में देखा गया जो कम गति पर बाउंड गेट अपना लेती हैं।
- सिमुलेशन बाधा: लेखक स्पष्ट रूप से नोट करते हैं कि मूल्यांकन सिमुलेशन (MJX) तक सीमित है। हालांकि डोमेन रेंडमाइजेशन का उपयोग किया गया था, लेकिन इन सीखे गए मल्टी-गेट व्यवहारों की सिम-टू-रियल ट्रांसफर क्षमता अभी तक भौतिक हार्डवेयर पर स्थापित नहीं हुई है।
यह कार्य प्रदर्शित करता है कि LLMs प्रभावी रूप से औपचारिक विनिर्देशों की संरचना का प्रस्ताव कर सकते हैं, लेकिन इन विनिर्देशों के पैरामीटर्स और वैधता को मजबूत, व्याख्या योग्य और प्रभावी लोकोमोशन नीतियों को उत्पन्न करने के लिए विशेषज्ञ डेटा के माध्यम से कड़ाई से ग्राउंड किया जाना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।