← नवीनतम पेपर
🤖 machine learning

Interacting safely with cyclists using Hamilton-Jacobi reachability and reinforcement learning

यह शोध पत्र एक हाइब्रिड फ्रेमवर्क प्रस्तावित करता है जो हैमिल्टन-जैकोबी रीचैबिलिटी विश्लेषण को डीप क्यू-लर्निंग के साथ एकीकृत करता है ताकि सुरक्षा मेट्रिक्स को संरचित पुरस्कारों के रूप में उपयोग करके और मानव व्यवहार अनुकूलन को मॉडल करके स्वायत्त वाहनों को साइकिल चालकों के साथ सुरक्षित और कुशलतापूर्वक बातचीत करने में सक्षम बनाया जा सके।

मूल लेखक: Aarati Andrea Noronha, Jean Oh

प्रकाशित 2026-02-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aarati Andrea Noronha, Jean Oh

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सेल्फ-ड्राइविंग कार चला रहे हैं, और आप अपने आगे एक साइकिल चालक को देखते हैं। यह एक पेचीदा स्थिति है। यदि आप बहुत तेज़ चलते हैं या बहुत करीब जाते हैं, तो आप साइकिल चालक को डरा सकते हैं या दुर्घटना का कारण बन सकते हैं। लेकिन यदि आप बहुत धीरे चलते हैं या बहुत दूर रहते हैं, तो आप यातायात को बाधित कर सकते हैं और सभी का समय बर्बाद कर सकते हैं।

यह शोध पत्र (paper) सेल्फ-ड्राइविंग कारों को यह सिखाने के बारे में है कि कैसे वे वह "गोल्डिलॉक्स" ज़ोन (Goldilocks zone) खोजें: इतना सुरक्षित कि साइकिल चालक को न डराए, लेकिन इतना तेज़ कि गंतव्य तक कुशलतापूर्वक पहुँचा जा सके।

लेखकों ने इस समस्या को कैसे हल किया है, इसे सरल अवधारणाओं और उपमाओं (analogies) में तोड़कर यहाँ समझाया गया है।

1. दो पुराने तरीके (और वे क्यों विफल रहे)

लेखकों ने इसे हल करने के दो मौजूदा तरीकों को देखा:

  • "पैरानॉयड रोबोट" (Hamilton-Jacobi Reachability):
    कल्पना कीजिए कि एक रोबोट है जो किसी भी चीज़ से टकराने से बेहद डरा हुआ है। वह गणना करता है कि एक साइकिल चालक किस तरह से हिल-डुल सकता है और कहता है, "अगर मैं उसके रास्ते के पास भी गया, तो शायद दुर्घटना हो जाएगी!" इसलिए, वह पूरी तरह से रुक जाता है या अविश्वसनीय रूप से धीरे चलता है।

    • समस्या: यह बहुत अधिक सुरक्षित है। यह दुर्घटनाओं की गारंटी देता है, लेकिन यह कार को बेकार बना देता है क्योंकि वह वास्तव में कहीं पहुँच ही नहीं पाती।
  • "जुआरी" (Reinforcement Learning):
    कल्पना कीजिए कि एक रोबोट है जो ट्रायल और एरर (trial and error) के माध्यम से सीखता है, जैसे कि कोई वीडियो गेम का पात्र। वह उच्च स्कोर (तेज़ी से लक्ष्य तक पहुँचना) प्राप्त करने के लिए अलग-अलग चालें आज़माता है।

    • समस्या: यह तेज़ है, लेकिन यह दुर्घटना का कारण बनने वाला जोखिम भरा शॉर्टकट ले सकता है क्योंकि इसके पास सख्त "सुरक्षा नियम पुस्तिका" नहीं है।

2. नया समाधान: "सेफ्टी नेट" + "स्मार्ट कोच"

लेखकों ने इन दोनों तरीकों को एक सुपर-टीम में मिला दिया।

  • सेफ्टी नेट (Hamilton-Jacobi): यह एक सख्त रेफरी की तरह काम करता है। यह हर संभव चाल के लिए लगातार एक "सुरक्षा स्कोर" (Safety Score) की गणना करता है। यदि कोई चाल कार को ऐसे क्षेत्र में डाल देती है जहाँ दुर्घटना अपरिहार्य है, तो सेफ्टी नेट कहता है, "नहीं, यह वर्जित है!"
  • स्मार्ट कोच (Deep Q-Learning): यह वह हिस्सा है जो गाड़ी चलाना सीखता है। यह सेफ्टी नेट के स्कोर का उपयोग इनाम के रूप में करता है। यदि कार सुरक्षित रहती है, तो उसे अंक मिलते हैं। यदि वह लक्ष्य तक जल्दी पहुँचती है, तो उसे अधिक अंक मिलते हैं। कोच कार को सेफ्टी नेट के नियमों को तोड़े बिना जितना संभव हो उतना तेज़ चलने के लिए प्रशिक्षित करता है।

3. गुप्त नुस्खा: साइकिल चालक की भावनाओं को समझना

यह इस शोध पत्र का सबसे रचनात्मक हिस्सा है।

अतीत में, कंप्यूटर साइकिल चालकों को अनिश्चित और यांत्रिक हवा के झोंकों की तरह मानते थे। लेकिन इंसान मशीन नहीं होते; उनकी भावनाएँ होती हैं। यदि कार बहुत करीब आती है, तो साइकिल चालक डर जाता है और अचानक मुड़ सकता है, भले ही कार तकनीकी रूप से उनसे टकराने वाली न हो।

लेखकों ने एक "एम्पैथी इंजन" (Empathy Engine) बनाया (एक टूल का उपयोग करके जिसे ऑटो-एनकोडर कहा जाता है):

  1. उन्होंने कंप्यूटर को हज़ारों वास्तविक दुनिया के ड्राइविंग वीडियो खिलाए।
  2. उन्होंने इसे सिखाया कि एक साइकिल चालक किसे "सुरक्षित" बनाम "डरावना" मानता है।
  3. उन्होंने महसूस किया कि कभी-कभी, एक कार तकनीकी रूप से सुरक्षित होती है (वह साइकिल से नहीं टकराएगी), लेकिन साइकिल चालक असुरक्षित महसूस करता है क्योंकि कार बहुत करीब होती है।

कंप्यूटर अब साइकिल चालक की लेटेंट रिस्पॉन्स (latent response) (उनकी छिपी हुई भावनाओं) को मॉडल करता है। वह सोचता है: "यदि मैं यहाँ से गुज़रता हूँ, तो गणित कहता है कि मैं सुरक्षित हूँ, लेकिन साइकिल चालक डरा हुआ महसूस करेगा और मुड़ जाएगा। इसलिए, मैं उन्हें थोड़ा अतिरिक्त स्थान दूँगा।"

4. परिणाम: यह कैसा रहा?

उन्होंने अपने नए "एम्पैथिक रोबोट" का परीक्षण इनके विरुद्ध किया:

  1. वास्तविक मानव चालक: जो अक्सर बहुत आक्रामक या बहुत धीमे होते हैं।
  2. पुराना "पैरानॉयड रोबोट" (Fisac 2019): जो बहुत अधिक सतर्क था।

विजेता:

  • सुरक्षा: उनका रोबोट मानव चालकों और पुराने रोबोट की तुलना में अधिक सुरक्षित था। उसने "असुरक्षित क्षणों" (डरावने पलों) से अधिक सफलतापूर्वक बचाव किया।
  • गति: यह पुराने पैरानॉयड रोबोट की तुलना में तेज़ था। यह केवल स्थिर नहीं खड़ा रहा; इसने एक सुचारू और कुशल रास्ता खोजा।
  • मानवीय व्यवहार: इसने समझा कि "सुरक्षित" होना केवल गणित के बारे में नहीं है; यह इस बारे में है कि साइकिल चालक सहज महसूस करे।

बड़ी तस्वीर की उपमा (Big Picture Analogy)

एक साइकिल चालक के पास से गाड़ी चलाने को पार्क में एक घबराए हुए कुत्ते के पास से पैदल चलने की तरह समझें।

  • पुराना रोबोट वहीं जम जाएगा और कुत्ते के पास से जाने से मना कर देगा क्योंकि उसे डर है कि कुत्ता काट सकता है।
  • पुराना लर्निंग रोबोट बेंच तक पहुँचने के लिए कुत्ते के पास से तेज़ी से दौड़ सकता है, जिससे अनजाने में कुत्ता डर सकता है।
  • यह नया दृष्टिकोण एक शांत, अनुभवी डॉग वॉकर की तरह है। वह जानता है कि वह कुत्ते को कितना करीब ला सकता है जिससे कुत्ता घबराए नहीं। वह एक स्थिर गति से चलता है, कुत्ते को पर्याप्त जगह देता है ताकि वह सहज महसूस करे, जिससे यह सुनिश्चित होता है कि बिना किसी डर के सभी अपनी मंज़िल तक पहुँच सकें।

संक्षेप में: इस शोध पत्र ने सेल्फ-ड्राइविंग कारों को न केवल भौतिकी (physics) की गणना करना, बल्कि मानव (और साइकिल चालक) के मनोविज्ञान को समझना भी सिखाया, जिसके परिणामस्वरूप ड्राइविंग का ऐसा तरीका मिला जो सुरक्षित और कुशल दोनों है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →