← नवीनतम पेपर
💻 computer science

Getting the Numbers Right\unicodex2014\unicode{x2014}Modelling Multi-Class Object Counting in Dense and Varied Scenes

यह शोधपत्र मल्टी-क्लास ऑब्जेक्ट काउंटिंग के लिए पहले विजन-ट्रांसफॉर्मर-आधारित दृष्टिकोण को प्रस्तुत करता है जो घने और विरल दोनों दृश्यों में अत्याधुनिक प्रदर्शन प्राप्त करने के लिए एक मल्टीस्केल CNN डिकोडर और एक ऑक्सिलरी सेगमेंटेशन मॉड्यूल के साथ ट्विन्स-SVT बैकबोन को जोड़ता है, जो मौजूदा डेंसिटी एस्टिमेटर्स और डिटेक्टर्स से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Villanelle O'Reilly, Jonathan Cox, Georgios Leontidis, Marc Hanheide, Petra Bosilj, James M. Brown

प्रकाशित 2026-04-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Villanelle O'Reilly, Jonathan Cox, Georgios Leontidis, Marc Hanheide, Petra Bosilj, James M. Brown

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक संगीत उत्सव (म्यूजिक फेस्टिवल) में एक विशाल, अराजक भीड़ के बीच खड़े हैं। आपको ठीक-ठीक यह गिनना है कि कितने लोगों ने लाल टोपियाँ पहनी हैं, कितने लोग नीली छतरियाँ पकड़े हुए हैं, और कितने लोग गिटार ले जा रहे हैं।

यदि आप उन्हें एक-एक करके गिनने की कोशिश करते हैं (जैसे कि एक मानक कंप्यूटर "डिटेक्टिव" जो व्यक्तिगत चेहरों को खोज रहा हो), तो आप जल्दी ही घबरा जाएंगे। लोग एक-दूसरे को रोक रहे हैं, भीड़ बहुत घनी है, और आप उनमें से आधे को छोड़ देंगे।

यह शोध पत्र इस समस्या को हल करने का एक नया, स्मार्ट तरीका पेश करता है। हर व्यक्ति को खोजने के बजाय, यह नया तरीका पूरे दृश्य को एक हीट मैप (heat map) के रूप में देखता है।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. पुराना तरीका बनाम नया तरीका

  • पुराना तरीका (ऑब्जेक्ट डिटेक्शन): कल्पना कीजिए कि एक सुरक्षा गार्ड भीड़ में हर व्यक्ति की ओर इशारा करते हुए और कहते हुए गिन रहा है, "वह एक व्यक्ति है, वह दूसरा है।" घनी भीड़ में, यह विफल हो जाता है क्योंकि लोग एक-दूसरे के ऊपर आ जाते हैं, और गार्ड भ्रमित हो जाता है।
  • नया तरीका (डेंसिटी एस्टीमेशन): कल्पना कीजिए कि आप एक ड्रोन से भीड़ को देख रहे हैं और एक "हीट मैप" देख रहे हैं। अधिक लोगों वाले क्षेत्र अधिक चमकते हैं। कंप्यूटर सिर नहीं गिनता; वह भीड़ की "गर्मी" (heat) को मापता है। यदि जमीन का एक हिस्सा बहुत चमकीला लाल दिख रहा है, तो वह जानता है कि वहां बहुत से लोग हैं। वह कुल संख्या प्राप्त करने के लिए "गर्मी" को जोड़ता है। यह तब बहुत बेहतर काम करता है जब लोग बहुत पास-पास पैक होते हैं।

2. समस्या: बहुत सारे रंग

पेचीदा बात यह है कि वास्तविक जीवन में, हमारे पास केवल एक प्रकार की वस्तु नहीं होती है। हमारे पास कारें, ट्रक, बसें और लोग सब आपस में मिले हुए हैं।

  • चुनौती: यदि कंप्यूटर केवल "गर्मी" को देखता है, तो वह कारों के एक समूह और लोगों के एक समूह को केवल "चीजों" का एक बड़ा ढेर समझ सकता है। इसे यह जानने की आवश्यकता है कि कौन सी गर्मी कारों की है और कौन सी लोगों की है।
  • पिछले प्रयास: पुराने तरीकों ने उन्हें रंगों के चारों ओर "बाड़" (मास्क) लगाकर अलग करने की कोशिश की। लेकिन एक अत्यंत घनी भीड़ में, आप लोगों के बगल में मौजूद कारों के हिस्सों को गलती से काटे बिना उनके चारों ओर स्पष्ट बाड़ नहीं खींच सकते।

3. समाधान: "सुपर-आई" और "फोकस फिल्टर"

लेखकों ने एक नया सिस्टम बनाया जिसमें दो मुख्य महाशक्तियाँ हैं:

A. "सुपर-आई" (विज़न ट्रांसफॉर्मर)

एक मानक कैमरा लेंस की कल्पना करें जो एक समय में एक स्थान को देखने वाले आवर्धक लेंस (magnifying glass) की तरह है। यह नया सिस्टम एक विज़न ट्रांसफॉर्मर (विशेष रूप से एक "Twins-SVT") का उपयोग करता है।

  • उपमा: कल्पना कीजिए कि एक बहुत बुद्धिमान पक्षी उत्सव के ऊपर ऊँचाई से उड़ रहा है। वह केवल एक व्यक्ति को नहीं देखता; वह पूरे उत्सव को एक साथ देखता है। वह "बड़ी तस्वीर" के संदर्भ (ग्लोबल व्यू) को समझता है और साथ ही सूक्ष्म विवरणों (जैसे कि एक अकेला गिटार स्ट्रैप) पर भी ध्यान देता है। यह पुराने कैमरों की तुलना में भीड़ भरे दृश्य में वस्तुओं के बीच के संबंध को समझने में इसे बेहतर बनाता है।

B. "फोकस फिल्टर" (कैटेगरी फोकस मॉड्यूल)

यही इस पेपर का असली राज है।

  • उपमा: कल्पना कीजिए कि आप लाल टोपियों और नीली छतरियों को एक साथ गिनने की कोशिश कर रहे हैं। आपका दिमाग भ्रमित हो जाता है क्योंकि लाल टोपियाँ नीली छतरियों के बिल्कुल बगल में हैं।
  • समाधान: सिस्टम एक विशेष प्रशिक्षण तकनीक का उपयोग करता है जिसे कैटेगरी फोकस मॉड्यूल कहा जाता है। प्रशिक्षण (सीखने के समय) के दौरान, यह ऐसे "चश्मे" पहनता है जो इसे नीली छतरियों को अनदेखा करते हुए केवल लाल टोपियों पर ध्यान केंद्रित करने में मदद करते हैं, और फिर नीली छतरियों पर ध्यान केंद्रित करने के लिए स्विच करता है।
  • जादू: एक बार जब सिस्टम इन रंगों को पूरी तरह से अलग करना सीख जाता है, तो यह अंतिम परीक्षण के लिए अपने चश्मे उतार देता है। इसे अब बाड़ या मास्क खींचने की आवश्यकता नहीं है। यह बस हीट मैप को देखता है और तुरंत जान जाता है, "यह गर्मी कारों की है, वह गर्मी लोगों की है।" यह इसे तेज़ और अधिक सटीक बनाता है क्योंकि यह उलझनों से भ्रमित नहीं होता है।

4. यह क्यों एक बड़ी बात है

शोधकर्ताओं ने तीन बहुत अलग "भीड़ों" पर इसका परीक्षण किया:

  1. शहर की सड़कें: ट्रैफिक में कारों, ट्रकों और लोगों को गिनना (VisDrone)।
  2. सैटेलाइट दृश्य: अंतरिक्ष से जहाजों, विमानों और नावों को गिनना (iSAID)।
  3. प्रकृति: घास के मैदान में विभिन्न प्रकार के फूलों को गिनना (Hicks dataset)।

परिणाम:

  • उन भीड़ भरे दृश्यों में जहाँ पुराने तरीके पूरी तरह विफल हो गए, यह नया तरीका मौजूदा सर्वोत्तम ऑब्जेक्ट डिटेक्टर्स (जैसे YOLO11) की तुलना में 10 गुना अधिक सटीक था।
  • इसने गिनती की त्रुटियों को 64% तक कम कर दिया।
  • यह तब भी बहुत अच्छा काम करता है जब चित्र में 5 वस्तुएं हों या 5,000।

सारांश

यह शोध पत्र एक आवर्धक लेंस (जो भीड़ में संघर्ष करता है) से एक स्मार्ट, सर्वव्यापी ड्रोन में अपग्रेड करने जैसा है जो बिना किसी उलझी हुई रेखाओं को खींचे, उनकी "हीट सिग्नेचर" द्वारा विभिन्न प्रकार की वस्तुओं को तुरंत अलग कर सकता है। यह ट्रैफिक जाम से लेकर फूलों के मैदानों तक, व्यस्त और अस्त-व्यस्त वास्तविक दुनिया के वातावरण में चीजों को गिनने के लिए एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →