← नवीनतम पेपर
📄 other

MEFP-Net: A Multimodal Recognition Algorithm for Urban Traffic Scenarios

यह शोध पत्र MEFP-Net का प्रस्ताव करता है, जो एक मल्टीमॉडल रिकग्निशन एल्गोरिदम है जो फीचर असंतुलन और लाइटिंग संवेदनशीलता को प्रभावी ढंग से संबोधित करने के लिए पदानुक्रमित मिड-स्टेज फ्यूजन और एक डुअल-पाथ बैकबोन का उपयोग करता है, जिससे जटिल शहरी यातायात परिदृश्यों में छोटे और अवरुद्ध वस्तुओं का पता लगाने में महत्वपूर्ण सुधार होता है।

मूल लेखक: Dahua Li, Yuchen Yan, Siyu He, Xueying Hu, Qiang Gao, Dong Li

प्रकाशित 2026-07-24
📖 3 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dahua Li, Yuchen Yan, Siyu He, Xueying Hu, Qiang Gao, Dong Li

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रात के समय एक घनी धुंधली झाड़ी के पीछे छिपी एक नन्ही, शर्मीली गिलहरी को खोजने की कोशिश कर रहे हैं। यदि आपके पास केवल आपकी आँखें हैं (जो रंग और बनावट देख सकती हैं), तो अंधेरा गिलहरी को अदृश्य बना देता है। यदि आपके पास केवल एक थर्मल कैमरा है (जो गर्मी देखता है), तो गिलहरी एक धुंधले धब्बे जैसी दिख सकती है क्योंकि कैमरा बारीक विवरण दिखाने में उतना सक्षम नहीं है। यह सेल्फ-ड्राइविंग कारों और ट्रैफिक कैमरों के लिए "स्मार्ट आँखों" का दैनिक संघर्ष है। उन्हें हर चीज़, हर जगह, मौसम या समय के बावजूद देखनी होती है। इसे हल करने के लिए, वैज्ञानिक इन दोनों दुनियाओं के सर्वश्रेष्ठ गुणों को मिलाने की कोशिश कर रहे हैं: एक नियमित कैमरे के रंगीन, विस्तृत "RGB" विजन और एक थर्मल कैमरे के ताप-संवेदी "इन्फ्रारेड" विजन को। यह ऐसा है जैसे आप अपनी कार को ऐसे सुपर-ग्लासेस दे रहे हैं जो एक ही समय में गिलहरी के फर के पैटर्न और उसके शरीर की गर्मी, दोनों को देख सकते हैं। लेकिन, तेल और पानी को मिलाने की कोशिश करने की तरह, ये दो प्रकार की छवियां हमेशा अच्छी तरह से नहीं मिल पातीं; कभी-कभी एक दूसरी को दबा देती है, या वे तालमेल से बाहर हो जाती हैं, जिससे छोटी या छिपी हुई वस्तुओं को पहचानना कठिन हो जाता है।

यहाँ आता है MEFP-Net, इन दो प्रकार के विजन को मिलाने की एक नई "रेसिपी" जिसे हाल ही में टियांजिन यूनिवर्सिटी ऑफ टेक्नोलॉजी के शोधकर्ताओं द्वारा परीक्षण किया गया है। इन छवियों को मिलाने के पुराने तरीकों को इन छवियों को एक स्मूदी की तरह मिलाने की कोशिश करने के रूप में सोचें जिसमें आप सभी सामग्रियों को एक साथ डाल देते हैं; परिणाम अक्सर एक अस्त-व्यस्त, असमान पेय होता है जहाँ फल का स्वाद खो जाता है। MEFP-Net, हालांकि, एक मास्टर शेफ की तरह है जो फल और बर्फ को अलग-अलग तैयार करता है, उनकी अनूठी बनावट को बरकरार रखता है, और फिर उन्हें बिल्कुल सही समय पर सावधानी से मिलाता है। शोधकर्ताओं ने एक सिस्टम बनाया जिसमें दो अलग-अलग "पाथ" (एक कलर कैमरे के लिए, एक हीट कैमरे के लिए) हैं जो आपस में मिलने से पहले दुनिया को अपने तरीके से देखना सीखते हैं। उन्होंने विशेष उपकरण पेश किए ताकि यह सुनिश्चित किया जा सके कि मिश्रण की प्रक्रिया के दौरान बारीक विवरण खो न जाएं और खराब मौसम में होने वाले "स्टैटिक" या शोर को फ़िल्टर किया जा सके।

जब उन्होंने इस नई रेसिपी का परीक्षण M3FD नामक एक डेटासेट पर किया, जिसमें बारिश वाली रातों से लेकर धुंधली सुबहओं तक हजारों कठिन ट्रैफिक दृश्य शामिल हैं, तो परिणाम प्रभावशाली थे। सिस्टम ने सटीकता के एक मानक माप (mAP50) का उपयोग करते समय 85.5% बार वस्तुओं को सही ढंग से पहचाना, और वस्तु के आकार के साथ कितनी अच्छी तरह मेल खाता है, इसके प्रति बहुत सख्त होने पर (mAP50-95) 57.8% बार। यह कई वर्तमान शीर्ष प्रदर्शन करने वाले मॉडलों से बेहतर है। अध्ययन बताता है कि इस "डुअल-पाथ" दृष्टिकोण और अपने नए मिक्सिंग टूल्स का उपयोग करके, सिस्टम धुंध में पैदल यात्री या दूर खड़ी साइकिल जैसी छोटी, छिपी हुई या दूर की वस्तुओं को पृष्ठभूमि से भ्रमित हुए बिना पहचानने में बहुत बेहतर है। इसने केवल अनुमान नहीं लगाया; शोधकर्ताओं ने गणना की, और डेटा दिखाता है कि यह विधि उन मामलों की संख्या को काफी कम कर देती है जब सिस्टम किसी लक्ष्य को चूक जाता है या कुछ ऐसा देखता है जो वहां नहीं है, जो इसे सुरक्षित, ऑल-वेदर ट्रैफिक मॉनिटरिंग की ओर एक आशाजनक कदम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →