← नवीनतम पेपर
🤖 AI

From LLM-Generated Specifications to Learned Quadruped Locomotion

यह शोध पत्र प्रदर्शित करता है कि बड़े भाषा मॉडल प्राकृतिक भाषा विवरणों से पैरामीट्रिक सिग्नल टेम्पोरल लॉजिक (PSTL) विनिर्देश उत्पन्न कर सकते हैं ताकि व्याख्या योग्य रिवॉर्ड फंक्शन को स्वचालित रूप से व्युत्पन्न किया जा सके, जिससे क्वाड्रुपेड रोबोट्स को 100% सफलता दर के साथ मजबूत, उच्च-गति लोकोमोशन प्राप्त करने में सक्षम बनाया जा सके जो हस्तनिर्मित और कोड-आधारित रिवॉर्ड विधियों से काफी बेहतर प्रदर्शन करते हैं।

मूल लेखक: Merve Atasever, Keyan Azbijari, Cagan Bakirci, Alfredo Reina Corona, Tolga Izdas, Richard Yang, Erdem Biyik, Jyotirmoy V. Deshmukh

प्रकाशित 2026-09-09
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Merve Atasever, Keyan Azbijari, Cagan Bakirci, Alfredo Reina Corona, Tolga Izdas, Richard Yang, Erdem Biyik, Jyotirmoy V. Deshmukh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

=== तकनीकी सारांश: LLM-जनित विनिर्देशों से सीखे गए क्वाड्रुपेड लोकोमोशन तक ===

समस्या विवरण

डीप रिइन्फोर्समेंट लर्निंग (RL) ने क्वाड्रुपेड रोबोट्स को फुर्तीले लोकोमोशन (locomotion) सीखने में सक्षम बनाया है, फिर भी प्रदर्शन काफी हद तक रिवॉर्ड फंक्शन के मैनुअल इंजीनियरिंग पर निर्भर करता है। इन रिवॉर्ड्स को डिजाइन करने के लिए डोमेन विशेषज्ञता की आवश्यकता होती है ताकि स्थानीय पदों (ट्रैकिंग, पोस्चर, ऊर्जा) को संतुलित किया जा सके और यह अक्सर प्रथम सिद्धांतों के बजाय अनुभवजन्य ट्यूनिंग (empirical tuning) पर निर्भर करता है। इसके अलावा, संख्यात्मक स्थानीय रिवॉर्ड्स वांछित वैश्विक टेम्पोरल व्यवहार (global temporal behavior) का स्पष्ट रूप से वर्णन करने में विफल रहते हैं, जो मल्टी-गेट लोकोमोशन के लिए विशेष रूप से महत्वपूर्ण है जहाँ वॉकिंग, ट्रॉटिंग और बाउंडिंग (bounding) में कॉन्टैक्ट टाइमिंग और सपोर्ट पैटर्न भिन्न होते हैं। हालांकि सिग्नल टेम्पोरल लॉजिक (STL) जैसे औपचारिक विनिर्देश व्याख्यात्मकता और मात्रात्मक मजबूती प्रदान करते हैं, फिर भी उन्हें मैन्युअल रूप से लिखना महत्वपूर्ण विशेषज्ञता की मांग करता है। इसके विपरीत, हालिया लार्ज लैंग्वेज मॉडल (LLM) दृष्टिकोण जो प्राकृतिक भाषा से सीधे रिवॉर्ड कोड जनरेट करते हैं, अक्सर जटिल टेम्पोरल बाधाओं के लिए आवश्यक संरचनात्मक कठोरता की कमी रखते हैं। यह शोध पत्र विशेषज्ञ डेटा के माध्यम से उनके संख्यात्मक मापदंडों को ग्राउंड (ground) करते हुए, व्याख्या योग्य और टेम्पोरली स्ट्रक्चर्ड रिवॉर्ड विनिर्देशों को उत्पन्न करने की खाई को संबोधित करता है।

कार्यप्रणाली (Methodology)

लेखक एक पाइपलाइन का प्रस्ताव करते हैं जो पैरामेट्रिक सिग्नल टेम्पोरल लॉजिक (PSTL) विनिर्देशों की संरचना (structure) उत्पन्न करने के लिए LLMs का लाभ उठाती है, जबकि विशेषज्ञ ट्रेजेक्टरीज का उपयोग उनके पैरामीटर्स को स्थापित करने और आउटपुट को फ़िल्टर करने के लिए किया जाता है।

  1. LLM विनिर्देश पीढ़ी (Specification Generation):

    • मॉडल्स (GPT-5.5 और Qwen 3.6) को प्राकृतिक भाषा लोकोमोशन उद्देश्यों और एक नियंत्रित STL व्याकरण के साथ प्रॉम्प्ट किया जाता है।
    • महत्वपूर्ण रूप से, LLMs को केवल कमांड ट्रैकिंग, सुरक्षा और गेट स्ट्रक्चर के लिए सिम्बोलिक स्ट्रक्चर (टेम्प्लेट्स) प्रस्तावित करने के लिए कहा जाता है। संख्यात्मक थ्रेशोल्ड और टेम्पोरल कांस्टेंट्स को बाद में अनुमान लगाने के लिए सिम्बोलिक पैरामीटर्स के रूप में छोड़ दिया जाता है, जिससे LLM द्वारा मनमाने मानों के आविष्कार को रोका जा सके।
    • दो सेटिंग्स का अन्वेषण किया गया है:
      • गेट-अवेयर (मल्टी-गेट): प्रॉम्प्ट फ्रौडे नंबर (Froude number) ट्रांजिशन के आधार पर तीन स्पीड रिजीम (walking-trot, trot, bound) को परिभाषित करता है। LLM प्रत्येक रिजीम के लिए विशिष्ट विनिर्देश उत्पन्न करता है।
      • गेट-एग्नोस्टिक (Gait-Agnostic): प्रॉम्प्ट विशिष्ट गेट्स को निर्धारित नहीं करता है, जिससे रोबोट को कॉन्टैक्ट पैटर्न खोजने की अनुमति मिलती है।
  2. डेटा ग्राउंडिंग और एक्सपर्ट-कंसिस्टेंसी फ़िल्टरिंग:

    • जनरेट किए गए PSTL टेम्प्लेट्स के संख्यात्मक मापदंडों का अनुमान प्रति रिजीम 50 विशेषज्ञ ट्रेजेक्टरीज के डेटासेट से लगाया जाता है।
    • एक फ़िल्टरिंग तंत्र लागू किया जाता है: एक जनरेट किया गया विनिर्देश तभी रखा जाता है यदि विशेषज्ञ ट्रेजेक्टरीज पर उसका मीडियन रोबस्टनेस गैर-ऋणात्मक (Q0.50(Rϕ)0Q_{0.50}(R_\phi) \ge 0) हो। यह उन विनिर्देशों को हटा देता है जो विशेषज्ञ व्यवहार द्वारा व्यवस्थित रूप से उल्लंघन किए जाते हैं, यह सुनिश्चित करता है कि रिवॉर्ड सिग्नल प्रदर्शित क्षमता के साथ संरेखित हो।
  3. रिवॉर्ड निर्माण और प्रशिक्षण:

    • रिटेन किए गए विनिर्देशों को STL रोबस्टनेस सेमेantics का उपयोग करके स्मूथ, फाइनाइट-हिस्ट्री रिवॉर्ड फंक्शन्स में परिवर्तित किया जाता है।
    • सक्रिय विनिर्देशों के लिए रोबस्टनेस वैल्यूज को सॉफ्ट-मिन (soft-min) फंक्शन का उपयोग करके एकत्रित किया जाता है और बड़े मैग्नीट्यूड द्वारा प्रभुत्व को रोकने के लिए tanh\tanh के माध्यम से सामान्यीकृत किया जाता है।
    • अंतिम स्केलर रिवॉर्ड सुरक्षा, ट्रैकिंग और पैटर्न पदों का भारित योग (weighted sum) है।
    • नीतियों को Barkour क्वाड्रुपेड रोबोट के साथ MuJoCo XLA (MJX) सिमुलेशन वातावरण में प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन (PPO) का उपयोग करके प्रशिक्षित किया जाता है।

मुख्य योगदान

  1. LLM-एक्सपर्ट हाइब्रिड पाइपलाइन: एक अभिनव ढांचा जहाँ LLMs व्याख्या योग्य लोकोमोशन विनिर्देशों की सिम्बोलिक संरचना उत्पन्न करते हैं, जबकि विशेषज्ञ डेटा उनके संख्यात्मक मापदंडों को ग्राउंड करता है।
  2. एक्सपर्ट-कंसिस्टेंसी फ़िल्टर: उन LLM-जनरेटेड विनिर्देशों को हटाने के लिए एक तंत्र जो विशेषज्ञ व्यवहार (मीडियन रोबस्टनेस < 0) के विपरीत हैं, जिससे रिवॉर्ड में व्यवस्थित रूप से उल्लंघन किए गए बाधाओं के प्रवेश को रोका जा सके।
  3. फॉर्मुलेशन का तुलनात्मक मूल्यांकन: इस बात का अन्वेषण कि गेट स्ट्रक्चर को स्पष्ट रूप से निर्धारित करने (गेट-अवेयर) बनाम उभरते व्यवहार (गेट-एग्नोस्टिक) की अनुमति देने से सीखे गए लोकोमोशन पर क्या प्रभाव पड़ता है।
  4. बेंचमार्किंग: हैंड-इंजीनियर्ड ह्यूरिस्टिक्स, डायरेक्ट LLM-जनरेटेड रिवॉर्ड कोड (Text2Reward), और एक एक्सपर्ट-स्विचिंग ऑरेकल के विरुद्ध एक व्यापक तुलना।

परिणाम

अध्ययन प्रदर्शन का मूल्यांकन 0.3 m/s से 2.1 m/s तक की फॉरवर्ड स्पीड के लिए कॉस्ट ऑफ ट्रांसपोर्टेशन (CoT), सर्वाइवल रेट, कमांड सक्सेस और गेट मैच सहित मेट्रिक्स का उपयोग करके करता है।

  • गेट-एग्नोस्टिक प्रदर्शन:

    • GPT-5.5 और Text2Reward (गेट-एग्नोस्टिक) ने सभी स्पीड्स पर कम CoT के साथ 100% सर्वाइवल और कमांड सक्सेस बनाए रखते हुए सबसे मजबूत मात्रात्मक प्रदर्शन हासिल किया।
    • हालांकि, विजुअल इंस्पेक्शन ने एक गंभीर दोष का खुलासा किया: इन नीतियों ने पूरे स्पीड रेंज (0.3 m/s सहित) में एक "बाउंड-लाइक" (bound-like) कॉन्टैक्ट पैटर्न सीखा। इसके परिणामस्वरूप अप्राकृतिक, उच्च-कैडेन्स लेग मूवमेंट और वर्टिकल ऑसिलेशन हुए, जो दर्शाता है कि उच्च मात्रात्मक सफलता स्कोर गतिशील रूप से उपयुक्त नियंत्रण की गारंटी नहीं देते हैं।
    • Qwen 3.6 (गेट-एग्नोस्टिक) 1.6\ge 1.6 m/s की गति पर जीवित रहने में विफल रहा।
  • गेट-अवेयर (मल्टी-गेट) प्रदर्शन:

    • Qwen 3.6 (मल्टी-गेट): पूरी स्पीड रेंज (0.3–2.1 m/s) में 100% सर्वाइवल और कमांड सक्सेस प्राप्त की और हाई स्पीड पर लक्षित "बाउंड" गेट को सफलतापूर्वक मैच किया।
    • GPT-5.5 (मल्टी-गेट): लो/मिड-स्पीड गेट्स को अच्छी तरह से कैप्चर किया लेकिन 1.9\ge 1.9 m/s की गति पर कमांड ट्रैकिंग में विफल रहा।
    • Text2Reward (मल्टी-गेट): हाई स्पीड (1.9–2.1 m/s) पर पूरी तरह विफल रहा, हर रोलआउट में टर्मिनेशन हुआ।
    • हैंड-इंजीनियर्ड (ह्यूरिस्टिक): उच्चतम गति (2.0–2.1 m/s) पर ट्रैकिंग सटीकता खो दी।
  • रोबस्टनेस होराइजन (HH) पर एब्लेशन:

    • छोटे टेम्पोरल होराइजन (H{1,5}H \in \{1, 5\}) ने आम तौर पर अधिक स्थिर और सफल नीतियां प्रदान कीं।
    • लंबे होराइजन (H=20,30H=20, 30) ने अक्सर प्रदर्शन को खराब किया, क्योंकि STL में "ऑलवेज" (GG) ऑपरेटर विंडो में सबसे खराब मान पर निर्भर करता है, जिससे पिछले उल्लंघन रिवॉर्ड सिग्नल में लंबे समय तक बने रहते हैं और क्रेडिट असाइनमेंट को जटिल बना देते हैं।
  • मॉडल तुलना:

    • GPT-5.5 और Qwen 3.6 का सापेक्ष प्रदर्शन कंट्रोल सेटिंग पर अत्यधिक निर्भर था। GPT-5.5 ने गेट-एग्नोस्टिक सेटिंग में उत्कृष्टता प्राप्त की, जबकि Qwen 3.6 ने मल्टी-गेट सेटिंग में, विशेष रूप से उच्च गति पर, बेहतर प्रदर्शन किया।

महत्व और दावे

यह शोध दावा करता है कि पॉलिसी लर्निंग और LLM जनरेशन के बीच एक इंटरमीडिएट रिप्रेजेंटेशन के रूप में टेम्पोरल लॉजिक को डालना, डायरेक्ट रिवॉर्ड कोड जनरेशन (Text2Reward) की तुलना में उच्च-गति लोकोमोशन के लिए स्पष्ट लाभ प्रदान करता है। STL-आधारित दृष्टिकोण (विशेष रूप से मल्टी-गेट सेटिंग में Qwen 3.6) सफलतापूर्वक वांछित हाई-स्पीड "बाउंड" गेट को सीख सका जहाँ डायरेक्ट कोड जनरेशन विफल रहा।

हालाँकि, लेखक अपने निष्कर्षों के संबंध में एक मध्यम रुख बनाए रखते हैं:

  • कोई सार्वभौमिक प्रभुत्व नहीं: कोई भी एकल रिवॉर्ड फॉर्मुलेशन दोनों टास्क सेटिंग्स (गेट-अवेयर बनाम एग्नोस्टिक) और सभी मूल्यांकन मानदंडों में सार्वभौमिक रूप से हावी नहीं है।
  • मात्रात्मक मेट्रिक्स की सीमाएं: परिणाम इस बात पर प्रकाश डालते हैं कि उच्च कमांड-ट्रैकिंग सफलता, इच्छित गेट स्ट्रक्चर या प्राकृतिक गति की रिकवरी की गारंटी नहीं देती है, जैसा कि गेट-एग्नोस्टिक नीतियों में देखा गया जो कम गति पर बाउंड गेट अपना लेती हैं।
  • सिमुलेशन बाधा: लेखक स्पष्ट रूप से नोट करते हैं कि मूल्यांकन सिमुलेशन (MJX) तक सीमित है। हालांकि डोमेन रेंडमाइजेशन का उपयोग किया गया था, लेकिन इन सीखे गए मल्टी-गेट व्यवहारों की सिम-टू-रियल ट्रांसफर क्षमता अभी तक भौतिक हार्डवेयर पर स्थापित नहीं हुई है।

यह कार्य प्रदर्शित करता है कि LLMs प्रभावी रूप से औपचारिक विनिर्देशों की संरचना का प्रस्ताव कर सकते हैं, लेकिन इन विनिर्देशों के पैरामीटर्स और वैधता को मजबूत, व्याख्या योग्य और प्रभावी लोकोमोशन नीतियों को उत्पन्न करने के लिए विशेषज्ञ डेटा के माध्यम से कड़ाई से ग्राउंड किया जाना चाहिए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →