← नवीनतम पेपर
⚡ electrical engineering

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation

यह शोध पत्र SevDiff को प्रस्तुत करता है, जो एक गंभीरता-सशर्त डिफ्यूजन मॉडल (severity-conditioned diffusion model) है जो एक लक्ष्य 'टाइम-टू-कोलिजन' (TTC) मान को इनपुट के रूप में स्वीकार करके भौतिक रूप से सुसंगत, लॉन्ग-टेल संघर्ष प्रक्षेपवक्र (long-tail conflict trajectories) उत्पन्न करता है, जिससे क्रिटिकल लो-TTC परिदृश्यों के लिए उच्च हिट-रेट प्राप्त होता है और जनरेटर की परिशुद्धता के लिए एक भौतिक रूप से व्याख्या योग्य मीट्रिक प्रदान होता है।

मूल लेखक: Eni Solomon Laughter

प्रकाशित 2026-07-24
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eni Solomon Laughter

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कार चलाना सिखाने की कोशिश कर रहे हैं। आप उसे वास्तविक ड्राइवरों के लाखों घंटों के वीडियो दिखाते हैं, लेकिन एक पेच है: वह सारा वीडियो उबाऊ और सुरक्षित ड्राइविंग का है। रोबोट ट्रैफिक जाम और लेन बदलने को पूरी तरह से संभालना सीख जाता है, लेकिन उसने कभी भी दुर्घटना के करीब पहुँचने वाला क्षण नहीं देखा है। यदि आप रोबोट से पूछते हैं कि दो कारों के आपस में टकराते समय क्या होता है, तो संभावना है कि वह गलत अनुमान लगाएगा क्योंकि उसने कभी उस विशिष्ट, डरावने क्षण का अभ्यास नहीं किया है। यह आर्टिफिशियल इंटेलिजेंस में "लॉन्ग-टेल" (long-tail) समस्या है: दुर्लभ, खतरनाक घटनाएँ सबसे महत्वपूर्ण होती हैं जिन्हें सही करना होता है, लेकिन वे स्वाभाविक रूप से सीखने के लिए वास्तविक डेटा में बहुत दुर्लभ होती हैं।

इसे ठीक करने के लिए, वैज्ञानिक "जेनरेटिव मॉडल्स" (generative models) का उपयोग करते हैं, जो डिजिटल कलाकारों की तरह होते हैं जो नए ट्रैफिक दृश्य बना सकते हैं। आमतौर पर, इन कलाकारों को "लेन बदलना" या "मर्ज होना" दिखाने के लिए कहा जाता है, लेकिन उन्हें यह नहीं बताया जा सकता कि दृश्य कितना खतरनाक होना चाहिए। यह एक चित्रकार से पूछने जैसा है, "मुझे एक तूफान बना कर दिखाओ," लेकिन आपके पास यह बताने का कोई तरीका नहीं है कि आप हल्की हवा चाहते हैं या भीषण चक्रवात। यह पेपर SevDiff नामक एक नया टूल पेश करता है जो इस समस्या को हल करता है। यह इंजीनियरों को यह तय करने देता है कि वे किस स्तर का खतरा देखना चाहते हैं, जिसे टाइम-टू-कोलिजन (TIC/TTC) नामक अवधारणा द्वारा मापा जाता है। TTC को एक काउंटडाउन घड़ी की तरह समझें: यदि दो कारें टक्कर की ओर बढ़ रही हैं, तो घड़ी बताती है कि टकराने में कितने सेकंड बचे हैं। कम संख्या (जैसे 0.5 सेकंड) का मतलब है कि टक्कर निकट है; उच्च संख्या (जैसे 5.0 सेकंड) का मतलब है कि वे सुरक्षित रूप से चल रहे हैं। बड़ा सवाल यह है कि क्या हम एक ऐसा 'रोबोट कलाकार' बना सकते हैं जिसे उस घड़ी पर एक विशिष्ट संख्या दी जाए—मान लीजिए "0.8 सेकंड"—और वह भरोसेमंद तरीके से एक ऐसा ट्रैफिक दृश्य बना सके जो खतरे के उस सटीक स्तर से मेल खाता हो?

लेखकों ने SevDiff बनाया है, जो एक विशेष प्रकार का AI है जो ट्रैफिक दुर्घटनाओं के लिए "सेवेरिटी डायल" (severity dial) के रूप में कार्य करता है। केवल यह अनुमान लगाने के बजाय कि एक खतरनाक दृश्य कैसा दिखता है, SevDiff एक विशिष्ट संख्या (लक्ष्य TTC) को निर्देश के रूप में लेता है और खतरे के उस स्तर से मेल खाने वाले कारों के दो प्रक्षेपवक्र (trajectories) बनाता है। शोधकर्ताओं ने परीक्षण किया कि क्या AI विभिन्न खतरे के स्तरों के लिए 300 अलग-अलग परिदृश्य बना सकता है, जो एक मामूली टक्कर (0.5 सेकंड) से लेकर एक बहुत सुरक्षित दूरी (5.0 सेकंड) तक के बीच हैं।

परिणाम सबसे महत्वपूर्ण क्षणों के लिए आश्चर्यजनक रूप से सटीक थे। जब शोधकर्ताओं ने 0.5 और 1.5 सेकंड के बीच के TTC के साथ एक दुर्घटना के करीब वाले दृश्य के लिए कहा, तो AI ने 100% बार इसे सही किया। प्रत्येक उत्पन्न परिदृश्य अनुरोधित खतरे के स्तर (±0.5 सेकंड के मामूली अंतर के भीतर) के भीतर ही था। यहाँ तक कि 2.0 से 2.5 सेकंड जैसे थोड़े कम तत्काल लक्ष्यों के लिए भी, AI 97% से 99% बार सही था। हालाँकि, जैसे-जैसे अनुरोधित खतरा स्तर अधिक सामान्य होता गया (जैसे कि एक सुरक्षित 5.0 सेकंड का अंतर), AI की सटीकता गिर गई, और इसने लक्ष्य को केवल 39% बार ही प्राप्त किया।

सटीकता में यह गिरावट कोई बग (खामी) नहीं है; यह एक विशेषता है जिसे लेखक समझाते हैं कि यह पूरी तरह से तर्कसंगत है। जब आप एक अत्यंत खतरनाक परिदृश्य मांगते हैं (एक बहुत छोटा TTC), तो AI को कुछ ऐसा करने के लिए कहा जा रहा होता है जो उसके प्रशिक्षण डेटा में देखे गए उबाऊ, सुरक्षित ड्राइविंग से बहुत अलग है। "खतरे का संकेत" इतना स्पष्ट और अद्वितीय है कि AI निर्देशों का पूरी तरह से पालन करता है। लेकिन जब आप एक सुरक्षित, सामान्य परिदृश्य मांगते हैं (एक बड़ा TTC), तो AI को कुछ ऐसा करने के लिए कहा जाता है जो बिल्कुल वैसा ही है जैसा कि वह हजारों सुरक्षित ड्राइविंग सत्रों से पहले से जानता है। उन मामलों में, AI की "सामान्य ड्राइविंग" की अपनी स्मृति आपके विशिष्ट निर्देश के साथ प्रतिस्पर्धा करती है, जिससे यह थोड़ा कम सटीक हो जाता है।

पेपर ने यह भी जांचा कि क्या AI असंभव भौतिकी (physics) बना रहा है, जैसे कि कारें पीछे की ओर चल रही हैं या एक-दूसरे के आर-पार जा रही हैं। उन्होंने पाया कि उत्पन्न दृश्य काफी हद तक यथार्थवादी थे, जिसमें 5% से भी कम विशेषताएं (जैसे गति या दूरी) वास्तविकता के दायरे से बाहर थीं। लेखक नोट करते हैं कि जबकि AI एक खतरनाक क्षण के सांख्यिकीय विवरण (statistics) बनाने में उत्कृष्ट है, यह अभी तक दुर्घटना का पूरा, फ्रेम-दर-फ्रेम मूवी नहीं बनाता है; यह घटना का एक सारांश बनाता है जिसे एक दृश्य कहानी में बदला जा सकता है।

संक्षेप में, SevDiff यह सिद्ध करता है कि हम एक उच्च स्तर के नियंत्रण के साथ मांग पर ट्रैफिक संघर्ष (traffic conflicts) उत्पन्न करने के लिए एक AI को सिखा सकते हैं। यह वास्तविक दुनिया के डेटा की कमी को पूरा करने के लिए सटीक रूप से वांछित, दुर्लभ और खतरनाक स्थितियों को बनाकर सुरक्षा प्रणालियों का परीक्षण करने का एक नया तरीका प्रदान करता है। लेखक सुझाव देते हैं कि हालांकि यह टूल वर्तमान में एक विशिष्ट हाईवे वीविंग सेक्शन तक सीमित है, यह एक ऐसे भविष्य के द्वार खोलता है जहाँ हम केवल सड़क पर किसी दुर्घटना के मिलने की उम्मीद करने के बजाय, किसी भी स्तर के खतरे के खिलाफ स्वायत्त वाहनों (self-driving cars) का व्यवस्थित रूप से परीक्षण कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →