← नवीनतम पेपर
💻 computer science

Counting Through Occlusion: Framework for Open World Amodal Counting

यह शोधपत्र CountOCC को प्रस्तुत करता है, जो एक नवीन अमोडल काउंटिंग फ्रेमवर्क है जो मल्टीमॉडल मार्गदर्शन और विजुअल इक्विवेलेंस उद्देश्यों के माध्यम से पूर्ण ऑब्जेक्ट फीचर्स को पदानुक्रमित रूप से पुनर्गठित करके अवरोध (occlusion) के तहत मौजूदा विधियों की सीमाओं को दूर करता है, और नए स्थापित ऑक्लूजन-ऑगमेंटेड बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Safaeid Hossain Arib, Rabeya Akter, Abdul Monaf Chowdhury, Md Jubair Ahmed Sourov, Md Mehedi Hasan

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Safaeid Hossain Arib, Rabeya Akter, Abdul Monaf Chowdhury, Md Jubair Ahmed Sourov, Md Mehedi Hasan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक भीड़ भरे कमरे में खड़े हैं और वहां मौजूद लोगों की संख्या गिनने की कोशिश कर रहे हैं।

समस्या: "पीक-ए-बू" (लुका-छिपी) की विफलता
अधिकांश वर्तमान कंप्यूटर प्रोग्राम लुका-छिपी खेलते बच्चे की तरह होते हैं। यदि वे किसी व्यक्ति का चेहरा देख पाते हैं, तो वे उन्हें गिन लेते हैं। लेकिन यदि कोई लंबा व्यक्ति उनके सामने खड़ा हो जाए और दृश्य को रोक दे, तो कंप्यूटर सोचता है, "ओह, वह व्यक्ति अब वहां नहीं है!" यह केवल उसी को गिनता है जो स्पष्ट रूप से दिखाई दे रहा है। इसमें कल्पना की कमी है कि वह यह कह सके, "रुको, मुझे पता है कि उस लंबे व्यक्ति के पीछे कोई खड़ा है क्योंकि मैं उनके जूते देख सकता हूँ।"

AI की दुनिया में, इसे occlusion (अवरोध) कहा जाता है। जब वस्तुएं अन्य चीजों के पीछे छिप जाती हैं, तो मानक काउंटिंग AI बुरी तरह विफल हो जाता है। वह "रोकने" वाली वस्तु (उस लंबे व्यक्ति) से भ्रमित हो जाता है और छिपे हुए व्यक्ति को भूल जाता है।

समाधान: CountOCC (एक "कल्पनाशील जासूस")
इस शोध पत्र के लेखकों ने एक नई प्रणाली बनाई है जिसे CountOCC कहा जाता है। CountOCC को केवल एक कैमरे के रूप में नहीं, बल्कि एक कल्पनाशील जासूस के रूप में सोचें।

केवल जो दिखाई दे रहा है उसे देखने के बजाय, CountOCC के पास दो विशेष महाशक्तियाँ हैं:

1. "फीचर रिकंस्ट्रक्शन" मॉड्यूल (द 3D प्रिंटर)

कल्पना कीजिए कि आपके पास एक टूटा हुआ पहेली (पज़ल) का टुकड़ा है। एक सामान्य कंप्यूटर टूटे हुए किनारों को देखकर पहेली को गिनने की कोशिश करता है। वह भ्रमित हो जाता है।

हालाँकि, CountOCC उस टूटे हुए टुकड़े को देखता है और कहता है, "मुझे पता है कि वह पूरा टुकड़ा कैसा दिखता है।" यह दिखाई देने वाले हिस्सों (पहेली का वह हिस्सा जो आप देख सकते हैं) से मिलने वाले सुरागों का उपयोग करता है और उन्हें एक "मानसिक ब्लूप्रिंट" (जो टेक्स्ट विवरणों और अन्य उदाहरणों से सीखा गया है) के साथ जोड़कर अपने दिमाग में गायब हिस्से को पुनर्निर्मित (reconstruct) करता है।

  • उपमा: यह एक बाड़ (fence) के पीछे खड़ी कार को देखने जैसा है। एक सामान्य AI बाड़ और एक बंपर देखता है। CountOCC उस बंपर और कारों के बारे में अपनी जानकारी का उपयोग करके अपने डिजिटल मस्तिष्क में अदृश्य मध्य और पिछले हिस्से को "प्रिंट" करता है, जिससे वह केवल बंपर को नहीं, बल्कि पूरी कार को गिन पाता है।

2. "विजुअल इक्विवेलेंस" चेक (दोहरा सत्यापन)

यह सुनिश्चित करने के लिए कि यह केवल कल्पना (hallucination) नहीं कर रहा है, CountOCC एक "टीचर-स्टूडेंट" (शिक्षक-शिष्य) प्रणाली का उपयोग करता है।

  • शिक्षक (The Teacher) एक स्पष्ट, बिना अवरोध वाली फोटो को देखता है और सीखता है कि 'अटेंशन मैप' (जहाँ AI देखता है) कैसा होना चाहिए।
  • छात्र (The Student) एक बाधित फोटो को देखता है और प्रयास करता है कि उसका "अटेंशन मैप" शिक्षक के मैप जैसा ही दिखे।

यदि छात्र केवल दिखाई देने वाले हिस्सों को गिनने की कोशिश करता है, तो उसका अटेंशन मैप शिक्षक के मैप से अलग दिखेगा, और सिस्टम उसे सुधारता है। यह AI को यह समझने के लिए मजबूर करता है, "हे, भले ही मैं कार का पिछला हिस्सा नहीं देख पा रहा हूँ, लेकिन मेरा ध्यान अभी भी पूरी कार पर होना चाहिए, ठीक वैसे ही जैसे शिक्षक का था।"

नए प्रशिक्षण मैदान

इसे सिद्ध करने के लिए, शोधकर्ताओं ने केवल सामान्य तस्वीरों का परीक्षण नहीं किया। उन्होंने नए, कठिन परीक्षण (FSC-147-OCC और CARPK-OCC) बनाए।

  • उन्होंने कारों, लोगों और वस्तुओं की हजारों तस्वीरें लीं।
  • उन्होंने भारी अवरोध का अनुकरण करने के लिए उन पर डिजिटल रूप से काले बॉक्स पेंट किए।
  • उन्होंने AI को छिपी हुई और दिखाई देने वाली वस्तुओं की कुल संख्या गिनने के लिए कहा।

परिणाम: एक बड़ी छलांग
जब उन्होंने परीक्षण किए, तो CountOCC एक सुपरस्टार साबित हुआ।

  • पुराना AI: केवल दिखाई देने वाली कारों को गिनता था। यदि 5 कारें छिपी हुई थीं, तो इसने 5 को छोड़ दिया।
  • CountOCC: दिखाई देने वाली कारों साथ ही छिपी हुई कारों को भी गिनता है।
  • स्कोर: इसने पिछले सर्वोत्तम तरीकों की तुलना में गणना त्रुटियों को लगभग 50% तक कम कर दिया। यह इतना अच्छा था कि यह उन डेटासेट्स पर भी काम कर गया जिन्हें इसने पहले कभी नहीं देखा था (जैसे पार्किंग लॉट), जिससे यह सिद्ध हुआ कि इसने वास्तव में छिपी हुई चीजों को गिनने के सिद्धांत को सीखा है, न कि केवल उत्तर रटे हैं।

यह क्यों महत्वपूर्ण है

यह केवल कारों को गिनने के बारे में नहीं है। कल्पना कीजिए:

  • किसान: फसल की कटाई कितनी होगी, यह जानने के लिए ऊंचे खरपतवारों के पीछे छिपी फसलों को गिनना।
  • कारखाने: यह देखना कि भले ही बॉक्स दृश्य को रोक रहे हों, कन्वेयर बेल्ट पर कितनी वस्तुएं हैं।
  • भीड़ सुरक्षा: एक घनी भीड़ में कितने लोग हैं, इसका अनुमान लगाना, भले ही वे इतने सटे हुए हों कि आप केवल सिर ही देख पा रहे हों।

संक्षेप में:
पिछला AI ऐसे व्यक्ति की तरह था जो केवल अपनी आँखें खुली रखकर देख पाता है। CountOCC एक ऐसे व्यक्ति की तरह है जो अपनी आँखें बंद कर सकता है, अपनी याददाश्त और तर्क का उपयोग कर सकता है, और फिर भी आपको बता सकता है कि कमरे में कितने लोग हैं, भले ही उनमें से आधे दीवार के पीछे छिपे हों। यह कंप्यूटरों को अदृश्य को "देखना" सिखाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →