Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting
यह शोध पत्र WS-COC को प्रस्तुत करता है, जो क्लास-एग्नोस्टिक ऑब्जेक्ट काउंटिंग के लिए पहला MLLM-संचालित वीकली-सुपरवाइज्ड फ्रेमवर्क है, जो पूर्णतः सुपरवाइज्ड विधियों के समान प्रदर्शन प्राप्त करने और एनोटेशन लागत को महत्वपूर्ण रूप से कम करने के लिए डिवाइड-एंड-डिसर्न डायलॉग ट्यूनिंग, कंपेयर-एंड-रैंक ऑप्टिमाइज़ेशन और ग्लोबल-एंड-लोकल एन्हांसमेंट रणनीतियों का उपयोग करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित लाइब्रेरियन (MLLM) को एक तस्वीर में वस्तुओं को गिनना सिखाने की कोशिश कर रहे हैं। इस लाइब्रेरियन ने लाखों किताबें पढ़ी हैं और वह जानता है कि "कार," "व्यक्ति," या "मछली" क्या होती है, लेकिन उसे कभी भी भीड़ में उन्हें गिनने के लिए स्पष्ट रूप से नहीं सिखाया गया है।
यदि आप बस उन्हें एक भीड़ भरे स्टेडियम की फोटो थमा दें और उनसे पूछें, "यहाँ कितने लोग हैं?", तो लाइब्रेरियन अंदाज़ा लगा सकता है कि "लगभग 50," क्योंकि उसने कहानियों में ऐसा नंबर देखा है, भले ही वास्तव में वहाँ 5,000 लोग हों। वे यह समझने में बेहतरीन हैं कि चीजें क्या हैं, लेकिन वे कितनी हैं, इसमें वे कमजोर हैं, खासकर जब चीजें बहुत घनी भरी हों।
यह पेपर इस समस्या को ठीक करने के लिए WS-COC नामक एक नई विधि पेश करता है। हर फोटो में हर एक व्यक्ति पर एक छोटा सा बिंदु (dot) बनाने के लिए इंसानों की फौज को काम पर रखने के बजाय (जो महंगा और धीमा है), लेखक लाइब्रेरियन को केवल फोटो के पीछे लिखे कुल लोगों की संख्या (एक "कमजोर" संकेत) का उपयोग करके कुछ चतुर तरीके सिखाते हैं।
वे इसे तीन सरल रणनीतियों का उपयोग करके करते हैं, जो यहाँ दी गई हैं:
1. "अनुमान लगाने वाला खेल" (विभाजित करो और पहचानो - Divide-and-Discern)
समस्या: लाइब्रेरियन से सटीक संख्या का अनुमान लगाने के लिए कहना (जैसे, "क्या यह 1,243 है?") बहुत कठिन है। यह बिना घड़ी की सुइयों को देखे किसी सटीक सेकंड का अनुमान लगाने जैसा है।
समाधान: सटीक संख्या पूछने के बजाय, लेखक लाइब्रेरियन को "ऊंचा या नीचा" (Higher or Lower) का खेल खेलने के लिए सिखाते हैं।
- राउंड 1: "क्या यहाँ 1,000 से अधिक लोग हैं?" (लाइब्रेरियन कहता है: "हाँ।")
- राउंड 2: "क्या यहाँ 500 से अधिक हैं?" (लाइब्रेरियन कहता है: "हाँ।")
- राउंड 3: "क्या यहाँ 250 से अधिक हैं?" (लाइब्रेरियन कहता है: "नहीं।")
- राउंड 4: "क्या यहाँ 375 से अधिक हैं?" ... और इसी तरह।
बड़ी, डरावनी संख्या को छोटे, आसान सवालों में तोड़कर, लाइब्रेरियन उत्तर को बेहतर तरीके से सीमित करना सीख जाता है जब तक कि वह एक बहुत सटीक गिनती दे सके। यह छिपे हुए खजाने को खोजने जैसा है, जैसे पहले यह देखना कि क्या वह उत्तर दिशा में है, फिर दक्षिण आधा, फिर पूर्व चौथाई, आदि।
2. "किसके पास अधिक है?" की दौड़ (तुलना करो और रैंक करो - Compare-and-Rank)
समस्या: कभी-कभी लाइब्रेरियन भ्रमित हो जाता है क्योंकि "गिनना" एक गणितीय अवधारणा है, जबकि "देखना" एक दृश्य अवधारणा है। चित्र को सीधे संख्या में बदलना कठिन होता है।
समाधान: "कितने हैं?" पूछने के बजाय, लेखक लाइब्रेरियन को चित्रों की तुलना करने के लिए कहते हैं।
- वे लाइब्रेरियन को कारों की चार अलग-अलग तस्वीरें दिखाते हैं।
- वे उनसे पूछते हैं: "इन तस्वीरों को सबसे कम कारों वाली से सबसे अधिक कारों वाली फोटो के क्रम में रखें।"
- लाइब्रेरियन यह देखने में बहुत अच्छा है कि कौन सा ढेर बड़ा या छोटा दिखता है। इस "रैंकिंग" खेल का अभ्यास करके, लाइब्रेरियन दृश्य भीड़ और संख्या के बीच के संबंध को सीख जाता है, जिससे उसे बाद में वास्तविक संख्या का अनुमान लगाने में मदद मिलती है।
3. "ज़ूम-इन" सुरक्षा जाल (वैश्विक और स्थानीय - Global-and-Local)
समस्या: जब भीड़ बहुत घनी होती है (जैसे कि मोश पिट), तो लाइब्रेरियन अक्सर संख्या को कम आंकता है। वे लोगों के एक "धुंधले समूह" को देखते हैं और सोचते हैं, "ओह, यह बस एक बड़ा समूह है," बजाय इसके कि वे व्यक्तियों को गिनें।
समाधान: लेखक लाइब्रेरियन को दो-चरणीय सुरक्षा जाल देते हैं।
- चरण A (बड़ी तस्वीर): पूरी छवि की कुल संख्या के लिए पूछें।
- चरण B (ज़ूम-इन): यदि लाइब्रेरियन को लगता है कि भीड़ बहुत बड़ी है, तो छवि को चार छोटे वर्गों में काट दें (जैसे एक पिज्जा)। लाइब्रेरियन से प्रत्येक छोटे वर्ग में लोगों को गिनने के लिए कहें।
- जादुई मिश्रण: कभी-कभी लाइब्रेरियन पूरी तस्वीर को कम आंकता है, लेकिन छोटे वर्गों को अधिक आंक देता है (क्योंकि वे लोगों के किनारों को दो बार देख लेते हैं)। लेखक बस "बड़ी तस्वीर" के अनुमान और "छोटे वर्गों" के अनुमान का औसत ले लेते हैं। यह दो अलग-अलग मानचित्रों को लेकर और वास्तविक स्थान खोजने के लिए उनका औसत निकालने जैसा है।
परिणाम
इन तीन तरीकों का उपयोग करके, लेखकों ने लाइब्रेरियन को किसी भी श्रेणी (कारें, लोग, मछली, पक्षी) में वस्तुओं को गिनना सिखाया, बिना किसी इंसान द्वारा हर वस्तु पर बिंदु बनाने की आवश्यकता के।
- पहले: लाइब्रेरियन बिखरी हुई भीड़ के लिए ठीक था लेकिन घनी भीड़ के लिए बहुत बुरा था।
- अब: लाइब्रेरियन अब उन सबसे महंगे, पूरी तरह से प्रशिक्षित विशेषज्ञों के लगभग बराबर है (जिन्हें हजारों घंटों के मानव बिंदु-ड्राइंग की आवश्यकता थी), लेकिन उन्होंने यह सब बहुत सस्ते, सरल संकेतों का उपयोग करके सीखा है।
संक्षेप में: उन्होंने AI को उत्तर रटने के लिए मजबूर नहीं किया; उन्होंने उसे समस्याओं को तोड़ने, दृश्यों की तुलना करने और अपने काम की दोबारा जांच करने के माध्यम से गिनने के बारे में सोचना सिखाया।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।