← नवीनतम पेपर
🤖 AI

WM-Cov: Test Adequacy for Interactive World-Model-Style Autonomous Driving Simulation

यह शोध पत्र WM-Cov को प्रस्तुत करता है, जो एक प्रदाता-अज्ञेय (provider-agnostic) मूल्यांकन ढांचा है जो कच्चे विफलता गणनाओं (raw failure counts) या प्रॉम्प्ट कवरेज के बजाय वैध, साकार और विविध विफलता साक्ष्यों के अभिसरण (convergence) पर ध्यान केंद्रित करके इंटरैक्टिव वर्ल्ड-मॉडल-आधारित स्वायत्त ड्राइविंग सिमुलेशन के लिए परीक्षण पर्याप्तता को परिभाषित और मापता है।

मूल लेखक: Jianxun Cui, Ping Wu, Stanisa Peric, Marko Milojkovic, Vladan Devedzic

प्रकाशित 2026-08-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianxun Cui, Ping Wu, Stanisa Peric, Marko Milojkovic, Vladan Devedzic

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं। पुराने दिनों में, आप रोबोट को हर संभव ट्रैफिक स्थिति दिखाने वाले पूर्व-रिकॉर्डेड वीडियो का एक विशाल पुस्तकालय थमा देते—जैसे कि एक बारिश वाला दिन, एक राहगीर का अचानक सड़क पर आना, या एक निर्माण क्षेत्र। आप कहते, "ये 10,000 वीडियो देखो, और अगर तुम इन सभी में जीवित बच जाते हो, तो तुम तैयार हो।" यह एक ऐसे वीडियो गेम की तरह है जहाँ स्तर (levels) निश्चित होते हैं; आप जानते हैं कि दुश्मन क्या करेगा क्योंकि स्क्रिप्ट कभी नहीं बदलती।

लेकिन अब, वैज्ञानिक "वर्ल्ड मॉडल्स" (World Models) बना रहे हैं। इन्हें केवल वीडियो लाइब्रेरी के रूप में नहीं, बल्कि जीवित, सांस लेते वीडियो गेम इंजन के रूप में सोचें। एक पूर्व-रिकॉर्डित स्तर खेलने के बजाय, रोबोट एक ऐसी दुनिया में गाड़ी चलाता है जो उस पर प्रतिक्रिया देती है। यदि रोबोट बाईं ओर मुड़ता है, तो अन्य कारें उससे बचने के लिए दाईं ओर मुड़ सकती हैं। यदि रोबोट हिचकिचाता है, तो एक पैदल यात्री बाहर निकल सकता है। दुनिया अब एक निश्चित स्क्रिप्ट नहीं है; यह एक अनंत, संवादात्मक कहानी है जहाँ रोबोट के अपने चुनाव कथानक (plot) को बदल देते हैं। सुरक्षा विशेषज्ञों के लिए बड़ा सवाल यह है: आप यह कैसे जानते हैं कि आपने पर्याप्त परीक्षण कर लिया है? यदि दुनिया लगातार बदलती रहती है, तो आप यह कैसे जानते हैं कि आप केवल भाग्यशाली नहीं रहे हैं, या इससे भी बदतर, आप यह कैसे जानते हैं कि जो भयानक दुर्घटनाएं आप देख रहे हैं वे वास्तविक खतरे हैं या गेम इंजन में केवल ग्लिच (glitches) हैं?

यह ठीक वही पहेली है जिसे "WM-Cov: Test Adequacy for Interactive World-Model-Style Autonomous Driving Simulation" नामक एक नए शोध पत्र में हल किया गया है। इसके लेखक, जो चीन, सर्बिया के विश्वविद्यालयों और औद्योगिक भागीदारों की एक टीम है, इन परीक्षणों को गिनने और जांचने का एक नया तरीका प्रस्तावित करते हैं। उनका तर्क है कि केवल लाखों डरावने दिखने वाले वीडियो बनाना पर्याप्त नहीं है। वास्तव में, अपने सिमुलेशन में, उन्होंने पाया कि कई "खतरनाक" घटनाएं वास्तव में नकली त्रुटियां या डुप्लिकेट थीं जिन्हें सुरक्षा के रूप में नहीं गिना जाना चाहिए।

इसे हल करने के लिए, उन्होंने WM-Cov (वर्ल्ड मॉडल कवरेज) नामक एक उपकरण बनाया। कल्पना कीजिए कि आप एक खाद्य समीक्षक (food critic) हैं जो एक ऐसे रेस्टोरेंट की समीक्षा कर रहे हैं जहाँ एक रोबोट शेफ द्वारा बनाए गए व्यंजनों का एक अनंत बुफे परोसा जा रहा है। कुछ व्यंजन स्वादिष्ट दिखते हैं लेकिन वास्तव में प्लास्टिक के बने होते हैं (आर्टिफैक्ट्स)। कुछ बस वही बर्गर हैं जिसे आपने सौ बार देखा है (डुप्लिकेट)। कुछ असली, स्वादिष्ट बर्गर हैं (वैध साक्ष्य)। यदि आप केवल उन प्लेटों को गिनते हैं जो शेफ ने रखी हैं, तो आपको लग सकता है कि आपने सब कुछ चख लिया है। लेकिन WM-Cov उस समीक्षक की नोटबुक है जो प्लेटों को छाँटती है। यह "अनुरोधित" व्यंजनों (जो आपने माँगा था), "वास्तविक" व्यंजनों (जो रसोई से बाहर आए) और "वैध" व्यंजनों (जो असली हैं, खाने के लिए सुरक्षित हैं और अद्वितीय हैं) को अलग करती है।

शोधकर्ताओं ने इस विचार का परीक्षण दो मुख्य तरीकों से किया। पहले, उन्होंने 1,219 सिम्युलेटेड ड्राइविंग घटनाओं के एक समूह का अध्ययन किया। उन्होंने पाया कि उनमें से 690 "आर्टिफैक्ट फेल्योर" (artifact failures) थे—मूलतः, सिम्युलेटर में खराबी आई और उसने एक दुर्घटना को डरावना दिखाया, लेकिन वह वास्तविक ड्राइविंग समस्या नहीं थी। यदि आप केवल दुर्घटनाओं को गिनते, तो आप सोचते कि कार बहुत खराब है। लेकिन जब WM-Cov ने उन्हें फ़िल्टर किया, तो इसने दिखाया कि केवल 230 ही वास्तविक, वैध विफलताएं थीं। दूसरा, उन्होंने 'ड्राइवएरिना' (DriveArena) नामक एक वास्तविक विश्व सिमुलेशन सिस्टम के साथ एक बड़ा परीक्षण चलाया, जिसमें 360 अलग-अलग ड्राइविंग अनुरोध शामिल थे। उन्होंने पाया कि "वास्तविकता" का परीक्षण काफी हद तक इस बात पर निर्भर करता था कि कौन गाड़ी चला रहा है (प्लानर), वे कितनी दूर तक देख रहे हैं (होराइजन), और मौसम की स्थितियाँ क्या हैं। उदाहरण के लिए, एक ड्राइविंग AI लंबी दूरी के 90 में से 32 अनुरोधों को पूरा करने में विफल रहा, जबकि दूसरे ने हर बार सफलता प्राप्त की।

इस शोध पत्र का मुख्य निष्कर्ष यह है कि हम केवल वर्ल्ड मॉडल द्वारा उत्पन्न डरावने वीडियो की संख्या को नहीं देख सकते। इसके बजाय, हमें एक ऐसी प्रणाली की आवश्यकता है जो वैध साक्ष्य (valid evidence) को ट्रैक करे। लेखक सुझाव देते हैं कि एक परीक्षण अभियान तब तक "पर्याप्त" (या पूर्ण) होता है जब तक कि सिस्टम ने पर्याप्त वास्तविक, अद्वितीय और तर्कसंगत विफलताओं को खोज लिया हो, ताकि वह आत्मविश्वास के साथ कह सके, बिना ग्लिच या दोहराव पर समय बर्बाद किए। अपने परीक्षणों में, उनके नए तरीके, WM-Cov ने 100 चयनित घटनाओं में से 99 वैध विफलताओं को सफलतापूर्वक पाया, जबकि उसने नकली डेटा को पूरी तरह से अनदेखा कर दिया, जबकि अन्य तरीके जो केवल "जोखिम" या "कवरेज" की तलाश करते थे, वे नकली डेटा से धोखा खा गए।

अंततः, यह शोध पत्र सुझाव देता है कि जैसे-जैसे हम स्थिर वीडियो लाइब्रेरी से संवादात्मक, जीवित सिमुलेशन की ओर बढ़ रहे हैं, हमारे सुरक्षा परीक्षणों को भी विकसित होना चाहिए। हमें कच्चे नंबरों को गिनना बंद करना होगा और साक्ष्य की गुणवत्ता का ऑडिट करना शुरू करना होगा। यह इस बारे में नहीं है कि रोबोट सिमुलेशन में कितनी बार दुर्घटनाग्रस्त होता है; यह इस बारे में है कि क्या वे दुर्घटनाएं हमें कुछ ऐसा सच और उपयोगी बताती हैं कि वह रोबोट वास्तविक दुनिया में कैसा व्यवहार करेगा। लेखक स्वीकार करते हैं कि यह सोचने का एक नया तरीका है जिसे विभिन्न मानचित्रों और ड्राइवरों पर अधिक परीक्षण की आवश्यकता है, लेकिन उनका उपकरण एक स्पष्ट, ऑडिट योग्य तरीका प्रदान करता है जिससे यह अनुमान लगाना बंद किया जा सके और यह जाना जा सके कि एक सेल्फ-ड्राइविंग कार वास्तव में कब तैयार है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →