← नवीनतम पेपर
🤖 AI

PersonaDrive: Human-Style Retrieval-Augmented VLA Agents for Closed-Loop Driving Simulation

PersonaDrive एक रिट्रीवल-ऑगमेंटेड VLA एजेंट फ्रेमवर्क है जो स्टाइल-इंस्ट्रक्टेड डेटासेट्स से रिट्रीव किए गए मानव प्रदर्शनों पर ड्राइविंग व्यवहार को कंडिशन करता है, जिससे क्लोज्ड-लूप सिमुलेशन एजेंटों को बिना किसी प्रति-स्टाइल रिट्रेनिंग के विविध मानव-समान ड्राइविंग शैलियों (आक्रामक, तटस्थ, रूढ़िवादी) को गतिशील रूप से अपनाने में सक्षम बनाया जाता है और साथ ही अत्याधुनिक प्रदर्शन प्राप्त किया जाता है।

मूल लेखक: Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki

प्रकाशित 2026-06-12
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mahmoud Srewa, Praneetsai Iddamsetty, Mohammad Abdullah Al Faruque, Salma Elmalaki

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। आमतौर पर, जब हम इसे कंप्यूटर में सिम्युलेट (simulate) करते हैं, तो सड़क पर अन्य कारें (यानी "ट्रैफिक") बिल्कुल एक जैसा व्यवहार करती हैं: वे बहुत विनम्र, अनुमानित और बिल्कुल एक ही गति से चलती हैं। यह एक ऐसे नृत्य की तरह है जहाँ हर कोई एक ही कोरियोग्राफी का पालन करता है। लेकिन वास्तविक दुनिया में, ड्राइवर अलग होते हैं। कुछ आक्रामक होते हैं जो दूसरों को कट मारते हैं; कुछ बहुत सावधान होते हैं और धीरे गाड़ी चलाते हैं; और कुछ सामान्य होते हैं।

यह पेपर PersonaDrive पेश करता है, जो एक नया तरीका है जिससे कंप्यूटर ट्रैफिक को अधिक मानवीय बनाया जा सके, इसके लिए वह रोबोट ड्राइवर को वास्तविक मानव ड्राइविंग शैलियों का एक "मेमोरी बैंक" (स्मृति बैंक) देता है।

यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "रोबोट ट्रैफिक" की खामी

वर्तमान ड्राइविंग सिम्युलेटर भौतिकी (physics) में बेहतरीन हैं (जैसे कार कैसे मुड़ती है या रुकती है), लेकिन व्यक्तित्व (personality) के मामले में खराब हैं। वे आसानी से एक "तेज रफ्तार शैतान" से "किराने के सामान के लिए जाने वाली दादी माँ" में स्विच नहीं कर सकते। इसे ठीक करने के पिछले प्रयास जटिल गणित या AI नियमों का उपयोग करके यह अनुमान लगाने पर निर्भर थे कि एक आक्रामक ड्राइवर को क्या करना चाहिए। लेखक तर्क देते हैं कि यह किसी व्यक्ति के स्वाद का अनुमान लगाने के लिए रेसिपी पढ़ने जैसा है, बजाय इसके कि वास्तव में भोजन का स्वाद चखा जाए।

2. समाधान: एक "स्टाइल लाइब्रेरी" (शैली पुस्तकालय)

शोधकर्ताओं ने वास्तविक मानव ड्राइविंग डेटा की एक विशेष लाइब्रेरी बनाई है।

  • सेटअप: उन्होंने 8 वास्तविक मानव ड्राइवरों को एक ड्राइविंग सिम्युलेटर (एक वीडियो गेम जो वास्तविक जीवन जैसा महसूस होता है) में रखा।
  • कार्य: उन्होंने प्रत्येक ड्राइवर को एक ही मार्ग तीन बार चलाने के लिए कहा, लेकिन अलग-अलग निर्देशों के साथ:
    1. रूढ़िवादी (Conservative): धीरे चलें, सुरक्षित रहें, सबको रास्ता दें।
    2. तटस्थ (Neutral): सामान्य रूप से चलें, नियमों का पालन करें।
    3. आक्रामक (Aggressive): बिना क्रैश हुए जितनी तेजी से हो सके उतनी तेजी से चलें, दूसरों को कट मारें, पीछे लगकर चलें (tailgate)।
  • परिणाम: अब उनके पास तीन अलग-अलग "स्टाइल लाइब्रेरी" हैं जो वास्तविक मानव ड्राइवरों के वीडियो और डेटा से भरी हुई हैं कि उन विशिष्ट मूड में वे वास्तव में कैसे व्यवहार करते हैं।

3. जादुई ट्रिक: "स्मार्ट लाइब्रेरियन" (चतुर पुस्तकालयाध्यक्ष)

यही PersonaDrive का मूल है। हर नई पर्सनैलिटी के लिए रोबोट ड्राइवर को फिर से प्रशिक्षित करने के बजाय, वे एक रिट्रीवल-ऑगमेंटेड (Retrieval-Augmented) सिस्टम का उपयोग करते हैं। इसे एक स्मार्ट लाइब्रेरियन की तरह समझें जो रोबोट ड्राइवर को निर्णय लेने में मदद करता है।

यहाँ चरण-दर-चरण प्रक्रिया दी गई है:

  • चरण A: प्रश्न (वर्तमान स्थिति)
    रोबोट ड्राइवर गाड़ी चला रहा है और एक स्थिति देखता है (जैसे, "मेरे सामने एक कार मर्ज हो रही है")।
  • चरण B: खोज (लाइब्रेरियन)
    रोबोट लाइब्रेरियन से पूछता है: "मैं अभी आक्रामक रूप से गाड़ी चला रहा हूँ। मुझे दिखाएं कि एक इंसान इस तरह की स्थिति में कैसे व्यवहार किया था।"
    • लाइब्रेरियन तुरंत आक्रामक लाइब्रेरी (Aggressive Library) में खोज करता है और वास्तविक मानव ड्राइवरों से 2 या 3 एकदम सटीक उदाहरण ढूंढ लेता है।
    • महत्वपूर्ण बिंदु: यदि रोबोट रूढ़िवादी (conservative) होकर गाड़ी चलाना चाहता, तो लाइब्रेरियन तुरंत रूढ़िवादी लाइब्रेरी पर स्विच कर देता और अलग उदाहरण ढूंढ लेता। रोबोट को कुछ भी नया सीखने की आवश्यकता नहीं है; उसे बस अलग किताबें देखनी हैं।
  • चरण C: सबक (इन-कॉन्टेक्स्ट लर्निंग)
    रोबोट इन उदाहरणों को देखता है। वह देखता है, "ओह, जब एक इंसान इस स्थिति में आक्रामक था, तो उसने गति बढ़ाई और रास्ता बदला।"
  • चरण D: क्रिया (Action)
    रोबोट उस व्यवहार की नकल करता है और उसी के अनुसार गाड़ी चलाता है।

4. यह बेहतर क्यों है?

  • पुनः प्रशिक्षण की आवश्यकता नहीं (No Re-training): आमतौर पर, रोबोट को अलग तरह से चलाने के लिए, आपको उसे फिर से सब कुछ सिखाना पड़ता है। PersonaDrive के साथ, आप बस उस "लाइब्रेरी" को बदल देते हैं जिसे रोबोट देख रहा है। यह टीवी पर चैनल बदलने जैसा है; टीवी (रोबोट) वही रहता है, लेकिन शो (ड्राइविंग स्टाइल) बदल जाता है।
  • यथार्थवाद (Realism): क्योंकि रोबोट गणितीय सूत्र का पालन करने के बजाय वास्तविक मानवीय कार्यों की नकल कर रहा है, इसलिए ट्रैफिक बहुत अधिक वास्तविक महसूस होता है।
  • प्रदर्शन (Performance): शोधकर्ताओं ने एक मानक ड्राइविंग टेस्ट (Bench2Drive) पर इसका परीक्षण किया।
    • बिना किसी स्टाइल निर्देश के, रोबोट ने पिछले शीर्ष मॉडलों से बेहतर प्रदर्शन किया (उच्च स्कोर किया और कम क्रैश हुआ)।
    • जब इसे आक्रामक (Aggressive) होने के लिए कहा गया, तो इसने तेजी से गाड़ी चलाई और त्वरण (acceleration) अधिक किया।
    • जब इसे रूढ़िवादी (Conservative) होने के लिए कहा गया, तो इसने धीमी गति से और अधिक सुरक्षित रूप से गाड़ी चलाई।
    • इसने प्रत्येक स्टाइल श्रेणी में अन्य तरीकों की तुलना में उच्चतम स्कोर प्राप्त किया।

निचोड़ (The Bottom Line)

PersonaDrive एक सेल्फ-ड्राइविंग कार को मूड रिंग और मानव यादों की लाइब्रेरी देने जैसा है। यह गणना करने के बजाय कि कैसे व्यवहार किया जाए, यह देखता है कि एक वास्तविक इंसान ने ठीक उसी मूड और स्थिति में कैसे व्यवहार किया था, और फिर उनकी नकल करता है। यह एक ही रोबोट ड्राइवर को केवल उस "लाइब्रेरी" को बदलकर तुरंत एक सावधान दादा-दादी, एक सामान्य यात्री, या एक रेस ड्राइवर बनने की अनुमति देता है जिसे वह देखता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →