← नवीनतम पेपर
💻 computer science

Le-DETR: Revisiting Real-Time Detection Transformer with Efficient Encoder Design

Le-DETR एक कुशल बैकबोन (EfficientNAT) और एक पुनर्गठित हाइब्रिड एनकोडर पेश करता है ताकि महत्वपूर्ण रूप से कम प्री-ट्रेनिंग लागत के साथ अत्याधुनिक रियल-टाइम ऑब्जेक्ट डिटेक्शन प्रदर्शन प्राप्त किया जा सके, जो महंगी प्री-ट्रेनिंग की आवश्यकता को समाप्त करते हुए सटीकता और गति दोनों में YOLOv12 और DEIM-D-FINE जैसे अग्रणी मॉडलों से बेहतर प्रदर्शन करता है।

मूल लेखक: Jiannan Huang, Aditya Kane, Fengzhe Zhou, Yunchao Wei, Humphrey Shi

प्रकाशित 2026-02-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiannan Huang, Aditya Kane, Fengzhe Zhou, Yunchao Wei, Humphrey Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त हवाई अड्डे के लिए एक सुपर-फास्ट सुरक्षा गार्ड बनाने की कोशिश कर रहे हैं। इस गार्ड को हर व्यक्ति, बैग या संदिग्ध वस्तु को तुरंत पहचानना होगा (लो लेटेंसी/कम विलंबता) जबकि उसे अविश्वसनीय रूप से सटीक (हाई एक्यूरेसी) भी होना चाहिए।

लंबे समय तक, सबसे अच्छे गार्ड दो अलग-अलग ब्लूप्रिंट का उपयोग करके बनाए गए थे:

  1. "YOLO" गार्ड: पारंपरिक, तेज़ गति वाली ईंटों (कन्वोल्यूशनल न्यूरल नेटवर्क - CNN) से बना। ये तेज़ हैं लेकिन कभी-कभी सूक्ष्म विवरणों को मिस कर देते हैं।
  2. "DETR" गार्ड: एक भविष्यवादी, सर्वव्यापी AI मस्तिष्क (ट्रांसफॉर्मर्स) से बना। ये अविश्वसनीय रूप से स्मार्ट और सटीक हैं लेकिन आमतौर पर बहुत धीमे होते हैं और इन्हें सीखने के लिए किताबों के एक विशाल पुस्तकालय (डेटा) की आवश्यकता होती है।

समस्या: "महंगी ट्रेनिंग स्कूल"

यह पेपर DETR गार्ड्स के साथ जुड़ी एक बड़ी सिरदर्द की ओर इशारा करता है। उन्हें रियल-टाइम उपयोग के लिए पर्याप्त तेज़ बनाने के लिए, पिछले शोधकर्ताओं को उन्हें एक बेहद महंगी, विशिष्ट ट्रेनिंग स्कूल में भेजना पड़ा।

  • लागत: उन्हें बुनियादी बातें सीखने के लिए मानक 1 मिलियन छवियों (इमेजनेट) के ऊपर 4 मिलियन अतिरिक्त छवियों का अध्ययन करना पड़ा।
  • बाधा (बॉटलनेक): यह "स्कूल" इतना महंगा और जटिल था कि सामान्य शोधकर्ता अपने गार्ड्स को वहां भेजने का खर्च नहीं उठा सकते थे। इसने नवाचार (इनोवेशन) को डेटा और कंप्यूटिंग पावर के पीछे लॉक कर दिया। यह ऐसा ही था जैसे कहना, "आप एक तेज़ कार तभी बना सकते हैं जब आप पहले उसे टेस्ट करने के लिए एक निजी द्वीप खरीद लें।"

समाधान: Le-DETR (द "स्मार्ट लोकल" गार्ड)

इस पेपर के लेखकों ने एक सरल प्रश्न पूछा, "क्या हमें वास्तव में उस महंगे स्कूल की आवश्यकता है, या हमने बस अपने गार्ड के मस्तिष्क को अक्षम तरीके से बनाया है?"

उन्होंने महसूस किया कि पिछले डिजाइन "ग्लोबल" दृष्टिकोण (एक साथ पूरी दुनिया को देखने) का उपयोग करने की कोशिश कर रहे थे, जो धीमा और डेटा-भूखा है। इसके बजाय, उन्होंने एक नया गार्ड डिज़ाइन किया जो लोकल अटेंशन (स्थानीय ध्यान) का उपयोग करता है।

उपमा: लाइब्रेरी बनाम पड़ोस

  • पुराना तरीका (ग्लोबल अटेंशन): कल्पना कीजिए कि गार्ड को किसी एक विशिष्ट तथ्य को खोजने के लिए एक विशाल लाइब्रेरी की हर किताब पढ़नी पड़ती है। इसमें बहुत समय लगता है और इसके लिए एक विशाल लाइब्रेरी (4 मिलियन इमेज) की आवश्यकता होती है।
  • नया तरीका (लोकल अटेंशन / Le-DETR): कल्पना कीजिए कि गार्ड को केवल अपने पड़ोस को देखने की आवश्यकता है जो उसके ठीक बगल में है। यदि वह एक लाल टोपी की तलाश कर रहा है, तो वह केवल 5 फीट के भीतर के लोगों को स्कैन करेगा। यह बहुत तेज़ है, इसमें कम मेमोरी लगती है, और भीड़ में विशिष्ट चीजों को पहचानने के लिए यह वास्तव में अधिक सटीक है।

उन्होंने यह कैसे किया (द "सीक्रेट सॉस")

टीम ने अपने गार्ड के लिए एक नया इंजन बनाया जिसे EfficientNAT कहा जाता है। इसे एक हाइब्रिड कार इंजन के रूप में सोचें जो दो दुनियाओं के सर्वश्रेष्ठ गुणों को जोड़ता है:

  1. एफिशिएंट कन्वोल्यूशन (Efficient Convolution): इधर-उधर घूमने के लिए तेज़, विश्वसनीय गियर।
  2. नेबरहुड अटेंशन (Neighborhood Attention): एक स्मार्ट रडार जो ऊर्जा बचाने के लिए बाकी दुनिया को अनदेखा करते हुए केवल तत्काल क्षेत्र को स्कैन करता है।

उन्होंने "डिकोडर" (वह हिस्सा जो अंतिम निर्णय लेता है) को भी फिर से डिज़ाइन किया। एक धीमी, भारी प्रक्रिया के बजाय, उन्होंने इसे सुव्यवस्थित किया ताकि गार्ड लगभग तुरंत निर्णय ले सके।

परिणाम: तेज़, स्मार्ट, सस्ता

परिणाम ऐसे हैं जैसे एक फेरारी मिल गई हो जो रॉकेट फ्यूल के बजाय साधारण अनलीडेड पेट्रोल पर चलती है।

  • ट्रेनिंग लागत: उन्होंने अपनी ट्रेनिंग डेटा की आवश्यकता को 80% कम कर दिया। उन्होंने अन्यों द्वारा आवश्यक विशाल 5 मिलियन छवियों के बजाय केवल मानक 1 मिलियन छवियों (ImageNet) का उपयोग किया। इसका मतलब है कि अब कोई भी बिना किसी सुपरकंप्यूटर फार्म के अपने परिणामों को दोहरा सकता है।
  • प्रदर्शन:
    • उनका मीडियम-साइज़ मॉडल (Le-DETR-M) वर्तमान चैंपियनों (जैसे YOLOv12 और D-FINE) की तुलना में तेज़ और अधिक सटीक है।
    • यह अविश्वसनीय सटीकता के साथ 4.45 मिलीसेकंड में वस्तुओं को पहचान सकता है (यह मानव आंख के झपकने से भी तेज़ है)।
    • यह पिछले "स्मार्ट" मॉडल्स (DETRs) को काफी तेज़ गति के साथ मात देता है।

यह क्यों मायने रखता है

इस पेपर से पहले, यदि आप सर्वश्रेष्ठ रियल-टाइम ऑब्जेक्ट डिटेक्शन चाहते थे, तो आपको एक बड़ी टेक कंपनी होना पड़ता था जिसके पास भारी पैसा हो ताकि आप विशाल प्री-ट्रेनिंग के लिए भुगतान कर सकें।

Le-DETR तकनीक का लोकतंत्रीकरण करता है। यह साबित करता है कि एक सुपर-गार्ड बनाने के लिए आपको "सुपर-स्कूल" की आवश्यकता नहीं है। आपको बस एक बेहतर आर्किटेक्चरल डिज़ाइन की आवश्यकता है। यह दिखाने जैसा है कि आप एक बड़ा इंजन खरीदने के बजाय, इंजन को अधिक कुशलता से चलाकर एक तेज़ कार बना सकते हैं।

संक्षेप में: उन्होंने एक धीमे, महंगे, डेटा-भूखे AI को लिया, उसे "लोकल नेबरहुड" फोकस दिया, और उसे बाजार के सबसे तेज़, सबसे कुशल रियल-टाइम डिटेक्टर में बदल दिया, और वह भी प्रशिक्षण लागत में 80% की बचत करते हुए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →