CoDi -- an exemplar-conditioned diffusion model for low-shot counting
यह शोध पत्र CoDi को प्रस्तुत करता है, जो एक नवीन एक्सेम्पलर-कंडीशन्ड लेटेंट डिफ्यूजन मॉडल है जो एक विशेष कंडीशनिंग मॉड्यूल के माध्यम से उच्च-गुणवत्ता वाले डेंसिटी मैप्स उत्पन्न करके सटीक लोकलाइजेशन के लिए सघन, छोटे-ऑब्जेक्ट क्षेत्रों की चुनौतियों को प्रभावी ढंग से संबोधित करता है और लो-शॉट ऑब्जेक्ट काउंटिंग में मौजूदा अत्याधुनिक विधियों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक समुद्र तट पर रेत के हर एक कण या रात के भीड़ भरे आसमान में हर एक छोटे तारे को गिनने की कोशिश कर रहे हैं। यदि आप केवल पूरी तस्वीर को देखते हैं, तो यह एक धुंधला सा दृश्य है। यदि आप उन्हें एक आवर्धक लेंस (magnifying glass) के साथ एक-एक करके गिनने की कोशिश करते हैं, तो आप कुछ को छोड़ सकते हैं या एक ही चीज़ को दो बार गिन सकते हैं। यह कंप्यूटरों के लिए छवियों में चीजों को "गिनने" की दैनिक संघर्ष है, जिसे ऑब्जेक्ट काउंटिंग (object counting) कहा जाता है। लंबे समय तक, कंप्यूटरों के पास इसे करने के दो मुख्य तरीके थे। पहला तरीका रेत पर पानी डालने जैसा था: उन्होंने एक "डेंसिटी मैप" (density map) बनाया, जो एक चिकनी पहाड़ी की तरह था जहाँ ऊंचाई इस बात का प्रतिनिधित्व करती थी कि वहाँ कितनी चीजें थीं। यह एक मोटा अनुमान लगाने के लिए तो अच्छा था, लेकिन यह आपको बिल्कुल सटीक रूप से नहीं बता पाता था कि प्रत्येक कण कहाँ था। दूसरा तरीका हर एक तारे को टैग करने के लिए लेजर पॉइंटर का उपयोग करने जैसा था। यह स्थानों को खोजने के लिए बहुत अच्छा था, लेकिन यदि तारे बहुत अधिक घने होते, तो कंप्यूटर भ्रमित हो जाता, अपने "पॉइंटर्स" का उपयोग करने में असमर्थ हो जाता, और चीजें छोड़ना शुरू कर देता या एक लूप में फंस जाता।
अब, एक नए प्रकार के कलाकार की कल्पना करें जो न केवल एक धुंधली पहाड़ी बनाता है और न ही सीमित संख्या में लेजर पॉइंटर का उपयोग करता है। इसके बजाय, यह कलाकार एक कैनवास से शुरुआत करता है जो स्टैटिक नॉइज़ (static noise) से भरा होता है—जैसे बिना सिग्नल वाला टीवी स्क्रीन—और धीरे-धीरे, चरण-दर-चरण, वह शोर को हटाकर ठीक वहीं एक स्पष्ट, तीखी तस्वीर प्रकट करता है जहाँ हर वस्तु मौजूद है। यह CoDi (Counting by Diffusion) नामक एक नई विधि के पीछे का मूल विचार है। इस शोध पत्र के पीछे के शोधकर्ताओं, ग्रेगा शुस्टार (Grega Šuštar) और उनकी टीम ने एक ऐसा सिस्टम बनाया है जो काउंटिंग की समस्या को हल करने के लिए "डिफ्यूजन मॉडल" (diffusion model) का उपयोग करता है—जो इमेज जेनरेट करने के लिए प्रसिद्ध एक प्रकार का AI है। वस्तुओं की गिनती करने के लिए केवल एक संख्या का अनुमान लगाने या बॉक्स बनाने के बजाय, CoDi एक खाली कैनवास को "डिनोइज़" (denoise) करना सीखता है जब तक कि उसमें से स्पष्ट, अलग-अलग बिंदु उभर न आ जाएं। यह जादू का कमाल है कि यह यह सब तब भी कर सकता है जब आप इसे केवल एक या दो उदाहरण दिखाएं, या फिर बिना किसी उदाहरण के भी। यह अपने दोस्त को एक विशिष्ट प्रकार के मशरूम की एक फोटो दिखाने और फिर जंगल में उन सभी मशरूम को खोजने के लिए कहने जैसा है; CoDi केवल कुल संख्या का अनुमान नहीं लगाता, बल्कि यह हर एक मशरूम के लिए सटीक स्थान की ओर इशारा करता है, यहाँ तक कि जंगल के सबसे घने हिस्सों में भी।
समस्या: "भीड़ वाले कमरे" की दुविधा
फोटो में चीजों को गिनना तब आसान होता है जब वस्तुएं बिखरी हुई हों। लेकिन क्या होता है जब आपके पास मधुमक्खियों का झुंड, अंगूरों का ढेर, या लोगों की भीड़ की फोटो हो? यहीं पर पुराने तरीके विफल हो जाते हैं।
"डेंसिटी" (घनत्व) विधियाँ भीड़ को उनके "हीट" (गर्मी) की ऊंचाई मापकर गिनने की कोशिश करने जैसी हैं। यदि भीड़ घनी है, तो गर्मी अधिक है, और कंप्यूटर जानता है कि वहाँ कई लोग हैं। लेकिन यह आपको यह नहीं बता सकता कि कौन कहाँ है। यदि आप उस हीट मैप के उच्चतम शिखरों को देखकर व्यक्तिगत लोगों को खोजने की कोशिश करते हैं, तो आप अक्सर गलत हो जाते हैं क्योंकि गर्मी आपस में मिल जाती है।
"डिटेक्शन" (पहचान) विधियाँ एक सीमित वॉकी-टॉकी वाले सुरक्षा गार्ड की तरह हैं। गार्ड विशिष्ट लोगों की ओर इशारा कर सकता है, लेकिन यदि बहुत अधिक लोग हैं (वॉकी-टकी की संख्या से अधिक), तो गार्ड को भीड़ को छोटे समूहों में विभाजित करना होगा, उन्हें अलग-अलग गिनना होगा, और फिर उत्तरों को वापस जोड़ने की कोशिश करनी होगी। यह धीमा, अव्यवस्थित है, और अक्सर एक ही व्यक्ति को दो बार गिनने या किसी को पूरी तरह से छोड़ने का कारण बनता है।
समाधान: CoDi का "जादुई शोर"
लेखक प्रस्ताव देते हैं कि CoDi, काउंटिंग को "स्टैटिक को साफ करने" के खेल की तरह मानता है।
यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:
- शुरुआती बिंदु: एक खाली, शोर वाले टीवी स्क्रीन की कल्पना करें। यह CoDi के लिए शुरुआती बिंदु है। इसे अभी नहीं पता कि वस्तुएं कहाँ हैं।
- "एग्ज़ेंप्लर" (Exemplar) सुराग: यदि आप सेब गिनना चाहते हैं, तो आप कंप्यूटर को सेबों की कुछ तस्वीरें दिखाते हैं (जिन्हें "एग्ज़ेंप्लर" कहा जाता है)। CoDi के पास एक विशेष "कंडीशनिंग मॉड्यूल" है जो एक सुपर-स्मार्ट फिल्टर की तरह काम करता है। यह आपके सेब के उदाहरणों को देखता है और कहता है, "ठीक है, मुझे ऐसी चीजें ढूंढनी हैं जो बिल्कर इनके जैसी दिखती हों, और बाकी सब को अनदेखा करना है।"
- डिनोइजिंग डांस: CoDi टीवी स्क्रीन से शोर को हटाना शुरू करता है, लेकिन यह इसे एक बहुत ही विशिष्ट तरीके से करता है। यह केवल अनुमान नहीं लगाता; यह धीरे-धीरे छवि को परिष्कृत करता है। हर कदम के साथ, धुंधला शोर अधिक स्पष्ट और तीखे बिंदुओं में बदल जाता है।
- परिणाम: प्रक्रिया के अंत तक, स्क्रीन एक धुंधली पहाड़ी या एक अव्यवस्थित सूची नहीं होती। यह एक साफ मानचित्र होता है जिसमें छोटे, तीखे शिखर होते हैं। प्रत्येक शिखर एक वस्तु का प्रतिनिधित्व करने वाला एक पूर्ण बिंदु है। कंप्यूटर बस उन बिंदुओं को गिन लेता है।
इसका गुप्त मंत्र यह है कि CoDi इन तीखे बिंदुओं को औसत निकालने के बजाय एक-एक करके उत्पन्न करना सीखता है। इसका मतलब है कि अत्यधिक भीड़ वाले दृश्य में भी जहाँ वस्तुएं एक-दूसरे को छू रही हों, CoDi उन्हें अलग कर सकता है और सटीक रूप से गिन सकता है।
उन्होंने क्या पाया: सर्वश्रेष्ठ को पछाड़ते हुए
टीम ने CoDi का परीक्षण कुछ बहुत कठिन डेटासेट्स पर किया, जिसमें FSC147 (जिसमें 147 अलग-अलग प्रकार की वस्तुएं हैं) और MCAC (एक मल्टी-क्लास काउंटिंग डेटासेट) शामिल हैं। परिणाम प्रभावशाली थे:
- फ्यू-शॉट काउंटिंग (Few-Shot Counting): जब इसे केवल कुछ उदाहरण दिए गए (जैसे लक्षित वस्तु की 3 छवियां), तो CoDi ने सटीकता (मीन एब्सोल्यूट एरर, या MAE) के मामले में वर्तमान सर्वोत्तम विधियों को 15% से पछाड़ दिया।
- वन-शॉट काउंटिंग (One-Shot Counting): यहाँ तक कि जब इसे केवल एक उदाहरण दिया गया, तब भी CoDi सर्वश्रेष्ठ था, जिसने पिछले शीर्ष विधि को 13% से पीछे छोड़ दिया।
- कोई उदाहरण नहीं (Reference-less): जब इसे कोई उदाहरण नहीं दिया गया और छवि में सबसे सामान्य वस्तु को गिनने के लिए कहा गया, तब भी CoDT ने मौजूदा सर्वोत्तम विधियों को 10% से पछाड़ दिया।
- मल्टी-क्लास चुनौती: MCAC डेटासेट पर, जहाँ एक ही छवि में सेब, संतरे और केले सब मिले हुए हो सकते हैं, CoDi ने प्रतियोगिता को बुरी तरह हरा दिया, और शीर्ष विधि को 38% के भारी अंतर से पीछे छोड़ दिया।
यह क्यों महत्वपूर्ण है
यह शोध पत्र स्पष्ट रूप से इस विचार को खारिज करता है कि बड़ी भीड़ को गिनने के लिए आपको बड़ी संख्या में प्री-ट्रेन्ड "पॉइंटर्स" (जैसे पुरानी डिटेक्शन विधियों में होते हैं) की आवश्यकता है। उन्होंने दिखाया कि छवियों को टाइलिंग करना (उन्हें टुकड़ों में काटना) एक भद्दा जुगाड़ है जो प्रक्रिया को धीमा करता है और त्रुटियां पैदा करता है। CoDi साबित करता है कि आपको छवि को काटने की आवश्यकता नहीं है; आप पूरी छवि को एक साथ प्रोसेस कर सकते हैं और फिर भी सटीक परिणाम प्राप्त कर सकते हैं।
उन्होंने यह भी दिखाया कि CoDi मजबूत (robust) है। भले ही आप इसे जो उदाहरण दें वे थोड़े अस्त-व्यस्त हों या वस्तुएं बहुत छोटी हों, यह स्थिर रहता है। वास्तव में, लेखकों ने पाया कि CoDi इतना स्थिर है कि यदि आप एक ही छवि को बीस बार इसके माध्यम से चलाते हैं, तो गणना औसतन 1% से कम बदलती है।
सीमाएं और भविष्य
हालाँकि CoDi एक बड़ी प्रगति है, लेखक ईमानदारी से बताते हैं कि यह कहाँ संघर्ष करता है। इसे कभी-कभी उन वस्तुओं के साथ समस्या होती है जो बहुत लंबी और पतली हैं (जैसे किनारे पर खड़ी किताबों की एक पंक्ति) या जब वस्तुएं बहुत अजीब तरीके से एक-दूसरे के ऊपर ओवरलैप होती हैं। उन्होंने यह भी नोट किया कि हालांकि यह किसी वस्तु के केंद्र को खोजने में बहुत अच्छा है, लेकिन यह अभी तक पूरी वस्तु के चारों ओर एक बॉक्स नहीं बनाता है (हालांकि वे इस पर काम करने की योजना बना रहे हैं)।
संक्षेप में, CoDi यह सुझाव देता है कि गिनती को "संख्या का अनुमान लगाने" के बजाय "शोर को साफ करने" की प्रक्रिया मानकर, हम कंप्यूटरों को भीड़ को वैसे ही देखने के योग्य बना सकते हैं जैसे इंसान देखते हैं: एक धुंधलेपन के रूप में नहीं, बल्कि अलग-अलग, गिनी जा सकने वाली व्यक्तिगत इकाइयों के रूप में। यह दुनिया को देखने का एक नया तरीका है, एक समय में एक बिंदु।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।