← नवीनतम पेपर
💻 computer science

A Survey on Class-Agnostic Counting: Advancements from Reference-Based to Open-World Text-Guided Approaches

यह शोध पत्र क्लास-एग्नोस्टिक काउंटिंग (CAC) का पहला व्यापक सर्वेक्षण प्रदान करता है, जो एक वर्गीकरण प्रस्तावित करता है जो कार्यप्रणालियों को रेफरेंस-आधारित, रेफरेंस-लेस और ओपन-वर्ल्ड टेक्स्ट-गाइडेड प्रतिमानों में वर्गीकृत करता है, साथ ही प्रमुख बेंचमार्क पर 30 आर्किटेक्चर का मूल्यांकन करता है।

मूल लेखक: Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi

प्रकाशित 2026-02-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Luca Ciampi, Ali Azmoudeh, Elif Ecem Akbaba, Erdi Sarıtaş, Ziya Ata Yazıcı, Hazım Kemal Ekenel, Giuseppe Amato, Fabrizio Falchi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, भीड़भाड़ वाले संगीत उत्सव में हैं। आपको चीजें गिनने का काम सौंपा गया है, लेकिन एक पेंच है: आपको तब तक पता नहीं चलेगा कि आप क्या ढूंढ रहे हैं जब तक कि आखिरी सेकंड न आ जाए।

एक पल, कोई चिल्लाता है, "लाल टोपियों को गिनो!" अगले ही पल, "सोडा के कैन गिनो!" और फिर, "धूप का चश्मा पहने हुए लोगों को गिनो!"

यह पेपर एक "स्टेट-ऑफ-द-आर्ट रिपोर्ट" है कि कैसे वैज्ञानिक आर्टिफिशियल इंटेलिजेंस (AI) को बिल्कुल यही करने के लिए सिखा रहे हैं। इस क्षेत्र को क्लास-एग्नोस्टिक काउंटिंग (CAC) कहा जाता है।

समस्या: "स्पेशलिस्ट" बनाम "जनरलिस्ट"

अधिकांश वर्तमान AI एक स्पेशलिस्ट (विशेषज्ञ) की तरह है। यदि आप एक AI को सेब गिनने के लिए प्रशिक्षित करते हैं, तो वह सेबों का विशेषज्ञ बन जाता है। लेकिन यदि आप उसे एक अकेला संतरा दिखा दें, तो वह उसे खाली आंखों से देखता रहेगा, या इससे भी बुरा, वह उसे सेब बताने की कोशिश करेगा। किसी स्पेशलिस्ट को कुछ नया गिनने के लिए, आपको उसे वापस स्कूल भेजना होगा, उसे हजारों नई तस्वीरें देनी होंगी, और उसे फिर से प्रशिक्षित करना होगा। यह धीमा और महंगा है।

इस पेपर के शोधकर्ता जनरलिस्ट (सामान्यज्ञ) की ओर देख रहे हैं—ऐसे AI जो किसी कमरे में जा सकते हैं, कुछ नया देख सकते हैं, और कह सकते हैं, "मैंने यह पहले कभी नहीं देखा है, लेकिन मैं देख सकता हूँ कि यहाँ 12 चीजें हैं।"


बुद्धिमत्ता के तीन "स्तर"

यह पेपर इन जनरलिस्ट AI को तीन अलग-अलग "विकासवादी चरणों" में व्यवस्थित करता है, ठीक वैसे ही जैसे मनुष्य सीखते हैं:

1. "दिखाओ और बताओ" विधि (रेफरेंस-बेस्ड)

उपमा: कल्पना कीजिए कि एक छोटा बच्चा है। यदि आप चाहते हैं कि वह कंचे गिने, तो आप एक कंचा उठाते हैं, उसे दिखाते हैं, और कहते हैं, "इन्हें गिनो।"
यह कैसे काम करता है: आप AI को एक "चीट शीट" (जिसे एक्सेम्प्लर कहा जाता है) देते हैं। आप उसे एक या दो वस्तुओं वाला एक छोटा बॉक्स दिखाते हैं, और AI कहता है, "समझ गया! मैं वह सब ढूंढ लूंगा जो इसके जैसा दिखता है।"

  • पक्ष (Pros): यह अविश्वसनीय रूप से सटीक है।
  • विपक्ष (Cons): यह थोड़ा कठिन काम है। एक इंसान को पहले मैन्युअल रूप से वस्तुओं की ओर इशारा करना पड़ता है।

2. "पैटर्न खोजने वाला" विधि (रेफरेंस-लेस)

उपमा: कल्पना कीजिए कि आप एक पैटर्न वाले वॉलपेपर को देख रहे हैं। आपको किसी के द्वारा यह बताने की आवश्यकता नहीं है कि "फूल" क्या है; आप बस देखते हैं कि वही आकार बार-बार दोहराया जा रहा है। आप सोचते हैं, "वह आकार जो भी है, उनके 50 экземпля हैं।"
यह कैसे काम करता है: AI दोहराव की तलाश करता है। इसे चीट शीट की आवश्यकता नहीं होती; यह बस सबसे आम, दोहराए जाने वाले पैटर्न की पहचान करता है और उसे गिनता है।

  • पक्ष (Pros): यह पूरी तरह से स्वचालित है। किसी मानवीय सहायता की आवश्यकता नहीं है।
  • विपक्ष (Cons): यह भ्रमित हो सकता है। यदि वहां दो अलग-अलग दोहराए जाने वाले पैटर्न हैं (जैसे पोल्का डॉट्स और धारियां), तो यह "विचलित" हो सकता है और गलत चीज़ गिन सकता है।

3. "जादुई छड़ी" विधि (टेक्स्ट-गाइडेड)

उपमा: यह एक जिन्न के पास होने जैसा है। आप जिन्न को कोई तस्वीर नहीं दिखाते; आप बस फुसफुसाते हैं, "नीली तितलियों को गिनो," और यह हो जाता है।
यह कैसे काम करता है: यह नवीनतम और सबसे शानदार तकनीक है। यह "विज़न-लैंग्वेज मॉडल्स" (जैसे कि ChatGPT का एक विशेष संस्करण जो देख सकता है) का उपयोग करता है। आप साधारण अंग्रेजी में एक विवरण टाइप करते हैं, और AI आपके शब्दों को छवि के पिक्सेल से जोड़ने के लिए अपने "मस्तिष्क" का उपयोग करता है।

  • पक्ष (Pros): यह अविश्वसनीय रूप से लचीला है और उपयोग करने में स्वाभाविक लगता है।
  • विपक्ष (Cons): कभी-कभी जिन्न बहुत शाब्दिक हो जाता है या "भ्रम" (hallucinate) पैदा कर देता है। यदि आप नीले फूलों के मैदान में "नीली तितलियों" को गिनने के लिए कहते हैं, तो यह गलती से फूलों को गिन सकता है।

मुख्य निष्कर्ष: "सुविधा की कीमत"

शोधकर्ताओं ने AI में एक मौलिक नियम की खोज की है: आप AI को जितनी अधिक स्वतंत्रता देते हैं, वह उतनी ही अधिक गलतियाँ करता है।

  • यदि आप AI को एक चीट शीट (रेफरेंस-बेस्ड) देते हैं, तो वह एक मास्टर काउंटर (बहुत उच्च सटीकता) है।
  • यदि आप इसे केवल शब्द (टेक्स्ट-गाइडेड) देते हैं, तो यह एक आलसी जीनियस (बहुत सुविधाजनक, लेकिन मूर्खतापूर्ण त्रुटियों के प्रति प्रवृत्त) है।

यह क्यों मायने रखता है?

यह केवल खिलौने गिनने के बारे में नहीं है। यह तकनीक निम्नलिखित के लिए कुंजी है:

  • कृषि: एक ड्रोन जो खेत के ऊपर उड़कर कीटों या पकते हुए फलों को गिनता है, बिना किसी इंसान द्वारा हर एक कीट प्रकार को प्रोग्राम किए जाने की आवश्यकता के।
  • यातायात: शहर के प्रवाह को प्रबंधित करने के लिए वास्तविक समय में कारों, बाइक या पैदल यात्रियों को गिनना।
  • चिकित्सा: लैब सेटिंग में कोशिकाओं या बैक्टीरिया को गिनना।

संक्षेप में: यह पेपर AI को "कठोर मशीनों जो केवल वही जानती हैं जो उन्हें बताया जाता है" से "लचीले पर्यवेक्षकों तक जो केवल देखकर और सुनकर दुनिया को समझ सकते हैं" की ओर ले जाने का एक रोडमैप है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →