← नवीनतम पेपर
💻 computer science

BeyondSight: Object Permanence for End-to-End Autonomous Driving

यह शोधपत्र BeyondSight को प्रस्तुत करता है, जो एक परमानेंस-अवेयर (permanence-aware) एंड-टू-एंड ऑटोनॉमस ड्राइविंग फ्रेमवर्क है जो तर्क और नियोजन (reasoning and planning) में सुधार करने के लिए अवरोधों (occlusions) के दौरान भी निरंतर एक्टर हाइपोथीसिस (actor hypotheses) बनाए रखता है, जिसे नए nuScenes-Permanence डेटासेट द्वारा मान्य किया गया है।

मूल लेखक: Sandro Papais, Letian Wang, Mudit Jain, Behnaz Rezaei, Steven L. Waslander

प्रकाशित 2026-07-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sandro Papais, Letian Wang, Mudit Jain, Behnaz Rezaei, Steven L. Waslander

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कार चला रहे हैं, लेकिन पहिए के पीछे कोई इंसान नहीं, बल्कि एक सुपर-स्मार्ट रोबोट दिमाग है। यह दिमाग दुनिया को देखने के लिए कैमरों का उपयोग करता है, ठीक वैसे ही जैसे आप करते हैं। लेकिन पेचीदा बात यह है कि दुनिया में कई 'ब्लाइंड स्पॉट्स' (अंधेरे कोने) होते हैं। एक बड़ा ट्रक आपके दृश्य को रोक सकता है जिससे आपको पैदल यात्री दिखाई न दे, या एक इमारत किसी साइकिल सवार को छिपा सकती है।

लंबे समय तक, बेहतरीन रोबोट दिमागों में एक अजीब सी खराबी थी: यदि वे किसी चीज़ को देख नहीं पाते थे, तो वे व्यवहार करते थे जैसे उसका अस्तित्व ही नहीं है।

इसे "मार्को पोलो" के खेल की तरह समझें जहाँ रोबोट केवल उन्हीं खिलाड़ियों को गिनता है जिन्हें वह देख सकता है। यदि कोई खिलाड़ी तैरते हुए द्वीप के पीछे चला जाता है और दृष्टि से ओझल हो जाता है, तो रोबोट तुरंत भूल जाता है कि वे वहाँ थे। ऐसा लगता है जैसे वे हवा में गायब हो गए हों। यह खतरनाक है! यदि रोबोट ट्रक के पीछे छिपे पैदल यात्री को भूल जाता है, तो वह सीधे उस जगह पर जा सकता है जहाँ वह पैदल यात्री निकलने वाला है।

"घोस्ट" (भूत/साया) की समस्या

पेपर इस समस्या को ऑब्जेक्ट परमानेंस (Object Permanence) कहता है। सरल शब्दों में, ऑब्जेक्ट परमानेंस वह क्षमता है जिससे यह पता चलता है कि चीजें तब भी मौजूद रहती हैं जब आप उन्हें देख नहीं सकते। बच्चे इसे बहुत जल्दी सीख जाते हैं; यदि आप किसी खिलौने को कंबल के नीचे छिपा देते हैं, तो आप जानते हैं कि वह अभी भी वहीं है।

वर्तमान के अधिकांश सेल्फ-ड्राइविंग सिस्टम (जैसे कि इस पेपर के तुलनात्मक अध्ययन में दिए गए हैं) उन बच्चों की तरह हैं जिन्होंने अभी तक यह नहीं सीखा है। वे "अस्तित्व" को सीधे "दृष्टि" से जोड़ देते हैं।

  • देखा? तो वह वहाँ है।
  • नहीं देखा? तो वह गया।

लेखक इस दृष्टिकोण के विरुद्ध तर्क देते हैं। वे कहते हैं कि सिर्फ इसलिए कि कोई सेंसर (जैसे कैमरा या लेजर रडार) किसी कार या व्यक्ति से कोई सिग्नल नहीं पकड़ पा रहा है, इसका मतलब यह नहीं है कि वह कार या व्यक्ति अस्तित्व से समाप्त हो गया है। पेपर स्पष्ट रूप से इस विचार को खारिज करता है कि हमें किसी वस्तु के दोबारा प्रकट होने तक प्रतीक्षा करनी चाहिए। प्रतीक्षा करना बहुत देर हो जाना है; इस बीच दुर्घटना हो सकती है।

"बियॉन्डसाइट" (BeyondSight) से परिचय: याददाश्त वाला रोबोट

शोधकर्ताओं ने बियॉन्डसाइट (BeyondSight) नामक एक नया सिस्टम पेश किया है। आप बियॉन्डसाइट को एक ऐसे रोबोट के रूप में सोच सकते हैं जो हर उस कार या व्यक्ति के लिए एक "मानसिक स्टिकी नोट" रखता है जिसे उसने कभी देखा है।

यह कैसे काम करता है, एक मनोरंजक उदाहरण के साथ:
कल्पना कीजिए कि रोबोट एक रहस्य सुलझाने वाला जासूस है।

  1. अवलोकन: जासूस एक संदिग्ध (कार) को सड़क पर दौड़ते हुए देखता है।
  2. ओझल होना: संदिग्ध एक दीवार के पीछे छिप जाता है। जासूस अब उसे देख नहीं सकता।
  3. पुराना तरीका: जासूस कहता है, "खैर, मैं उन्हें देख नहीं पा रहा हूँ, इसलिए वे टेलीपोर्ट होकर कहीं चले गए होंगे। केस बंद!" और वह उन्हें ट्रैक करना बंद कर देता है।
  4. बियॉन्डसाइट का तरीका: जासूस कहता है, "मैं उन्हें देख नहीं सकता, लेकिन मुझे पता है कि वे उस दिशा में दौड़ रहे थे। मैं एक मानसिक नोट रखूँगा कि उन्हें कहाँ होना चाहिए, भले ही दीवार मेरा दृश्य रोक रही हो।"

बियॉन्डसाइट इसे गणितीय रूप से करता है। यह एक "हाइपोथीसिस" (अनुमान) रखता है कि छिपा हुआ पात्र कहाँ है। यह अपने अनुमान को इस आधार पर अपडेट करता है कि छिपा हुआ पात्र दिखने से पहले कितनी गति और किस दिशा में चल रहा था। भले ही कैमरा कुछ न देख रहा हो, रोबोट का दिमाग उस पात्र के "साये" (ghost) को जीवित रखता है।

प्रमाण: क्या यह काम कर गया?

लेखकों ने केवल कल्पना नहीं की; उन्होंने इसका परीक्षण भी किया। उन्होंने nuScenes नामक एक प्रसिद्ध ड्राइविंग डेटासेट का एक नया संस्करण बनाया, जिसे उन्होंने nu-scenes-permanence नाम दिया।

पुराने डेटासेट में, यदि कोई कार किसी इमारत के पीछे छिपी होती थी, तो डेटा कहता था कि "वहाँ कुछ नहीं है।" नया डेटासेट कहता है, "एक कार वहाँ है, लेकिन वह छिपी हुई है।" इसने उन्हें छिपी हुई चीजों को याद रखने के लिए रोबोट को प्रशिक्षित करने की अनुमति दी।

यहाँ उन्हें क्या पता चला, उनके परीक्षणों के सटीक नंबरों के साथ:

  • "इनविजिबल" (अदृश्य) स्कोर: बियॉन्डसाइट से पहले, पूरी तरह से छिपे हुए पात्रों को पहचानने की रोबोट की क्षमता 0 थी। ऐसा लग रहा था जैसे उनका अस्तित्व ही नहीं है। बियॉन्डसाइट के साथ, यह स्कोर 0.249 mAP तक पहुँच गया। यह शून्य से कुछ होने की दिशा में एक बहुत बड़ी छलांग है!
  • सुरक्षा स्कोर: सबसे महत्वपूर्ण हिस्सा यह है कि कार कितनी अच्छी तरह चलती है। शोधकर्ताओं ने "प्लानिंग एरर" (कार का रास्ता आदर्श, सुरक्षित रास्ते से कितना अलग था) को मापा।
    • पुराने तरीके में त्रुटि 0.61 थी।
    • बियॉन्डसाइट ने इस त्रुटि को घटाकर 0.54 कर दिया।
    • उन्होंने "कोलिजन रेट" (कितनी बार रोबोट किसी चीज़ से टकराते-टकराते बचा) को भी मापा। पुराना तरीका 0.08% था, और बियॉन्डसाइट ने इसे घटाकर 0.07% कर दिया।

यह क्यों मायने रखता है

पेपर सुझाव देता है कि यह "याददाश्त" रोबोट को सुरक्षित बनाती है, विशेष रूप से क्रॉसिंग या चौराहों जैसे कठिन स्थानों पर जहाँ कारें अक्सर दूसरी कारों के पीछे छिप जाती हैं।

एक विशिष्ट परीक्षण में, उन्होंने एक स्थिति देखी जहाँ एक पैदल यात्री एक ट्रक के पीछे छिपा हुआ था।

  • पुराना रोबोट: पैदल यात्री को भूल गया। इसने एक ऐसा रास्ता प्लान किया जो पैदल यात्री के भविष्य के स्थान की ओर ही जाता।
  • बियॉन्डसाइट: पैदल यात्री को याद रखा। इसने एक ऐसा रास्ता प्लान किया जिसने छिपे हुए व्यक्ति को पर्याप्त जगह दी, भले ही वह उसे देख नहीं पा रहा था।

कमी (वे अभी क्या नहीं जानते)

लेखक सावधान रहते हैं कि वे यह नहीं कह रहे हैं कि यह एक पूरी तरह से हल की गई समस्या है। वे स्वीकार करते हैं कि यदि कोई छिपी हुई वस्तु बहुत लंबे समय तक छिपी रहती है, तो रोबोट का अनुमान थोड़ा "पुराना" या पथभ्रष्ट हो सकता है। यह एक दीवार के पीछे दौड़ रहे अपने दोस्त का अनुमान लगाने जैसा है; यदि दीवार 100 मीटर लंबी है, तो जब तक वे बाहर आएंगे, आपका अनुमान थोड़ा गलत हो सकता है।

साथ ही, यह सिस्टम तब सबसे अच्छा काम करता है जब छिपा हुआ ऑब्जेक्ट सुचारू रूप से चलता है। यदि एक छिपी हुई कार अचानक रुक जाती है या ऐसे तरीके से मुड़ जाती है जिसकी उम्मीद रोबोट को नहीं थी, तो सिस्टम उसे तुरंत नहीं पकड़ पाएगा।

निष्कर्ष

मुख्य निष्कर्ष यह है कि सेल्फ-ड्राइविंग कारों के वास्तव में सुरक्षित होने के लिए, उन्हें केवल वर्तमान क्षण में मौजूद होने की तरह व्यवहार करना बंद करना होगा। उन्हें याद रखना होगा कि उन्होंने एक सेकंड पहले क्या देखा था, भले ही वह वर्तमान में दृष्टि से बाधित हो।

बियॉन्डसाइट सुझाव देता है कि रोबोट को छिपी हुई वस्तुओं के लिए "याददाश्त" देकर, हम उन्हें बेहतर निर्णय लेने और उन ब्लाइंड स्पॉट्स में दुर्घटनाओं से बचने में मदद कर सकते जहाँ वास्तविक दुनिया के अधिकांश खतरे छिपे होते हैं। यह उन कारों की ओर एक कदम है जो केवल दुनिया को "देखती" नहीं हैं, बल्कि वास्तव में उसे "समझती" हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →