← नवीनतम पेपर
⚡ electrical engineering

ManeuverGPT Agentic Control for Safe Autonomous Stunt Maneuvers

यह शोध पत्र ManeuverGPT प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो मॉडल वेट्स को पुन: प्रशिक्षित किए बिना, पुनरावृत्ति प्रॉम्प्ट रिफाइनमेंट और भौतिकी-आधारित सत्यापन के माध्यम से जे-टर्न (J-turn) जैसे उच्च-गतिशील स्वायत्त स्टंट युद्धाभ्यास उत्पन्न करने और सुरक्षित रूप से निष्पादित करने के लिए एक लार्ज लैंग्वेज मॉडल-आधारित एजेंटिक आर्किटेक्चर का लाभ उठाता है।

मूल लेखक: Shawn Azdam, Pranav Doma, Aliasghar Moj Arab

प्रकाशित 2026-04-09
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shawn Azdam, Pranav Doma, Aliasghar Moj Arab

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिल्कुल नए, अविश्वसनीय रूप से स्मार्ट रोबोट ड्राइवर को J-टर्न करना सिखा रहे हैं—वह नाटकीय, 180-डिग्री स्पिन जो आप एक्शन फिल्मों में देखते हैं जहाँ एक कार रिवर्स करती है, तेजी से घूमती है, और विपरीत दिशा में तेजी से निकल जाती है।

आमतौर पर, एक रोबोट को J-टर्न करना सिखाना ऐसा ही है जैसे भौतिक विज्ञान (physics) पर 5,000 पन्नों का मैनुअल लिखकर किसी इंसान को यूनिसाइकिल चलाना सिखाना। आपको हर एक नियम को प्रोग्राम करना पड़ता है, और यदि आप चाहते हैं कि रोबोट कोई दूसरी कार (जैसे एक भारी ट्रक के बजाय स्पोर्ट्स कार) चलाए, तो आपको पूरा मैनुअल फिर से लिखना पड़ता है।

ManeuverGPT इसे करने का एक नया, स्मार्ट तरीका है। मैनुअल लिखने के बजाय, शोधकर्ताओं ने रोबोट को एक सुपर-स्मार्ट "को-पायलट" दिमाग (Large Language Models पर आधारित, वही तकनीक जो चैटबॉट्स के पीछे है) दिया और उससे गलतियों से सीखने को कहा, ठीक वैसे ही जैसे एक इंसान कोई नया कौशल सीखता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. तीन लोगों की पिट क्रू (Pit Crew)

एक रोबोट द्वारा सब कुछ करने के बजाय, ManeuverGPT तीन विशेष "एजेंट्स" (AI सहायकों) की एक टीम का उपयोग करता है जो एक रेस ट्रैक पर पिट क्रू की तरह मिलकर काम करते हैं:

  • अनुवादक (Query Enricher): आप सिस्टम को बताते हैं, "एक J-टर्न करो!" अनुवादक उस अस्पष्ट कमांड को लेता है और उसमें सभी आवश्यक विवरण जोड़ देता है, जैसे "याद रखें, हम बारिश में हैं, और यह कार फिसलन भरी है।" यह एक साधारण इच्छा को एक विस्तृत निर्देश मैनुअल में बदल देता है।
  • ड्राइवर (Driver Agent): यह वह है जो वास्तव में नियंत्रण (controls) चुनता है। अनुवादक के नोट्स के आधार पर, यह कहता है, "ठीक है, मैं गैस को 50% तक दबाऊँगा, स्टीयरिंग को बाईं ओर घुमाऊँगा, फिर जोर से ब्रेक लगाऊँगा।" यह नंबरों का अनुमान लगाता है।
  • सुरक्षा निरीक्षक (Parameter Validator): यह एक सख्त कोच है। कार चलने से पहले, सुरक्षा निरीक्षक ड्राइवर की योजना की जाँच करता है। "रुको, इस कार में स्टीयरिंग को इतनी जोर से घुमाना इसे पलट देगा! चलो, इसे थोड़ा कम करते हैं।" यदि योजना सुरक्षित है, तो यह ड्राइवर को हरी झंडी दे देता है। यदि नहीं, तो यह योजना को फिर से कोशिश करने के लिए ड्राइवर के पास वापस भेज देता है।

2. "बातचीत" करके सीखना (न कि रीवायरिंग करके)

सबसे शानदार बात यह है कि सिस्टम कैसे सीखता है।

  • पुराना तरीका: किसी रोबोट को नया करतब सिखाने के लिए, आपको आमतौर पर उसे "रिट्रेन" करना पड़ता है, जो ऐसा है जैसे किसी इंसान को गणित का नया फॉर्मूला सीखने के लिए एक साल तक वापस स्कूल भेजने के लिए मजबूर करना।
  • ManeuverGPT का तरीका: यह बातचीत करके सीखता है।
    1. टीम एक J-टर्न की कोशिश करती है।
    2. कार थोड़ी ज्यादा चौड़ी घूम जाती है।
    3. सिस्टम गलती को देखता है और ड्राइवर एजेंट को बताता है: "हे, तुमने दूसरे स्टेप में बहुत ज्यादा तीखा मोड़ लिया। अगली बार, कोशिश करें कि 10% कम मुड़ें।"
    4. ड्राइवर एजेंट अपने निर्देशों को अपडेट करता है और फिर से कोशिश करता है।

यह एक मैनुअल ट्रांसमिशन कार चलाने वाले इंसान जैसा है। आपको अपना दिमाग फिर से बनाने की जरूरत नहीं है; आपको बस फीडबैक मिलता है ("आपने इंजन बंद कर दिया!") और अगली बार आप अपने पैर के दबाव को एडजस्ट करते हैं। सिस्टम इसे बार-बार तब तक करता है जब तक कि J-टर्न परफेक्ट न हो जाए, बिना कभी भी इसके अंतर्निहित कोड (underlying code) को बदले।

3. परिणाम: सेडान बनाम स्पोर्ट्स कार

शोधकर्ताओं ने इसका परीक्षण एक वीडियो गेम सिमुलेशन (CARLA) में दो बहुत अलग कारों पर किया:

  • सेडान (Sedan): एक सामान्य, स्थिर पारिवारिक कार। सिस्टम ने बहुत जल्दी पूरी तरह से J-टर्न करना सीख लिया।
  • स्पोर्ट्स कूप (Sports Coupe): एक तेज, संवेदनशील, उच्च-प्रदर्शन वाली कार जिसे नियंत्रित करना बहुत कठिन है।

परिणाम: सिस्टम सेडान के साथ 90% बार सफल रहा और स्पोर्ट्स कूप के साथ 70% बार।

  • अंतर क्यों? स्पोर्ट्स कूप एक रेस के घोड़े की तरह है—बहुत संवेदनशील। स्टीयरिंग में एक छोटी सी गलती भी इसे स्पिन आउट कर सकती है। सेडान एक शांत घोड़े की तरह है; यह छोटी गलतियों को माफ कर देता है। AI को स्पोर्ट्स कूप के साथ बहुत अधिक सटीक होना पड़ा, लेकिन फिर भी इसने बिना क्रैश हुए इसे सफलतापूर्वक पूरा किया।

4. यह क्यों महत्वपूर्ण है

आज की स्वायत्त वाहनों (स्व-चालित कारों) के बारे में सोचें। वे किराने के सामान लेने जाने के लिए बेहतरीन हैं, लेकिन अगर उनके सामने कोई हिरण कूद जाए, तो वे शायद सिर्फ ब्रेक लगा देंगे। वे खतरे से बचने के लिए "स्टंट ड्राइवर" वाले मूव्स करने के लिए नहीं बने हैं।

ManeuverGPT दिखाता है कि हम स्वायत्त कारों को हर बार नया कार मॉडल आने पर उन्हें फिर से प्रोग्राम किए बिना, फुर्तीला और साहसी बना सकते हैं। यह मानवीय रचनात्मकता और तर्क (भाषा का उपयोग करके) को कंप्यूटर के सख्त सुरक्षा जांचों के साथ जोड़ता है।

संक्षेप में:
यह पेपर साबित करता है कि यदि आप एक सेल्फ-ड्राइविंग कार को AI सहायकों की एक ऐसी टीम देते हैं जो एक-दूसरे से बात कर सके, एक-दूसरे की योजनाओं की आलोचना कर सके, और बातचीत के माध्यम से अपनी गलतियों से सीख सके, तो वह कार बिना दोबारा प्रोग्राम किए सुरक्षित रूप से खतरनाक, हाई-स्पीड स्टंट करने सीख सकती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →