← नवीनतम पेपर
💻 computer science

Bootstrapping MLLM for Weakly-Supervised Class-Agnostic Object Counting

यह शोध पत्र WS-COC को प्रस्तुत करता है, जो क्लास-एग्नोस्टिक ऑब्जेक्ट काउंटिंग के लिए पहला MLLM-संचालित वीकली-सुपरवाइज्ड फ्रेमवर्क है, जो पूर्णतः सुपरवाइज्ड विधियों के समान प्रदर्शन प्राप्त करने और एनोटेशन लागत को महत्वपूर्ण रूप से कम करने के लिए डिवाइड-एंड-डिसर्न डायलॉग ट्यूनिंग, कंपेयर-एंड-रैंक ऑप्टिमाइज़ेशन और ग्लोबल-एंड-लोकल एन्हांसमेंट रणनीतियों का उपयोग करता है।

मूल लेखक: Xiaowen Zhang, Zijie Yue, Yong Luo, Cairong Zhao, Qijun Chen, Miaojing Shi

प्रकाशित 2026-02-16
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiaowen Zhang, Zijie Yue, Yong Luo, Cairong Zhao, Qijun Chen, Miaojing Shi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, सुशिक्षित लाइब्रेरियन (MLLM) को एक तस्वीर में वस्तुओं को गिनना सिखाने की कोशिश कर रहे हैं। इस लाइब्रेरियन ने लाखों किताबें पढ़ी हैं और वह जानता है कि "कार," "व्यक्ति," या "मछली" क्या होती है, लेकिन उसे कभी भी भीड़ में उन्हें गिनने के लिए स्पष्ट रूप से नहीं सिखाया गया है।

यदि आप बस उन्हें एक भीड़ भरे स्टेडियम की फोटो थमा दें और उनसे पूछें, "यहाँ कितने लोग हैं?", तो लाइब्रेरियन अंदाज़ा लगा सकता है कि "लगभग 50," क्योंकि उसने कहानियों में ऐसा नंबर देखा है, भले ही वास्तव में वहाँ 5,000 लोग हों। वे यह समझने में बेहतरीन हैं कि चीजें क्या हैं, लेकिन वे कितनी हैं, इसमें वे कमजोर हैं, खासकर जब चीजें बहुत घनी भरी हों।

यह पेपर इस समस्या को ठीक करने के लिए WS-COC नामक एक नई विधि पेश करता है। हर फोटो में हर एक व्यक्ति पर एक छोटा सा बिंदु (dot) बनाने के लिए इंसानों की फौज को काम पर रखने के बजाय (जो महंगा और धीमा है), लेखक लाइब्रेरियन को केवल फोटो के पीछे लिखे कुल लोगों की संख्या (एक "कमजोर" संकेत) का उपयोग करके कुछ चतुर तरीके सिखाते हैं।

वे इसे तीन सरल रणनीतियों का उपयोग करके करते हैं, जो यहाँ दी गई हैं:

1. "अनुमान लगाने वाला खेल" (विभाजित करो और पहचानो - Divide-and-Discern)

समस्या: लाइब्रेरियन से सटीक संख्या का अनुमान लगाने के लिए कहना (जैसे, "क्या यह 1,243 है?") बहुत कठिन है। यह बिना घड़ी की सुइयों को देखे किसी सटीक सेकंड का अनुमान लगाने जैसा है।
समाधान: सटीक संख्या पूछने के बजाय, लेखक लाइब्रेरियन को "ऊंचा या नीचा" (Higher or Lower) का खेल खेलने के लिए सिखाते हैं।

  • राउंड 1: "क्या यहाँ 1,000 से अधिक लोग हैं?" (लाइब्रेरियन कहता है: "हाँ।")
  • राउंड 2: "क्या यहाँ 500 से अधिक हैं?" (लाइब्रेरियन कहता है: "हाँ।")
  • राउंड 3: "क्या यहाँ 250 से अधिक हैं?" (लाइब्रेरियन कहता है: "नहीं।")
  • राउंड 4: "क्या यहाँ 375 से अधिक हैं?" ... और इसी तरह।

बड़ी, डरावनी संख्या को छोटे, आसान सवालों में तोड़कर, लाइब्रेरियन उत्तर को बेहतर तरीके से सीमित करना सीख जाता है जब तक कि वह एक बहुत सटीक गिनती दे सके। यह छिपे हुए खजाने को खोजने जैसा है, जैसे पहले यह देखना कि क्या वह उत्तर दिशा में है, फिर दक्षिण आधा, फिर पूर्व चौथाई, आदि।

2. "किसके पास अधिक है?" की दौड़ (तुलना करो और रैंक करो - Compare-and-Rank)

समस्या: कभी-कभी लाइब्रेरियन भ्रमित हो जाता है क्योंकि "गिनना" एक गणितीय अवधारणा है, जबकि "देखना" एक दृश्य अवधारणा है। चित्र को सीधे संख्या में बदलना कठिन होता है।
समाधान: "कितने हैं?" पूछने के बजाय, लेखक लाइब्रेरियन को चित्रों की तुलना करने के लिए कहते हैं।

  • वे लाइब्रेरियन को कारों की चार अलग-अलग तस्वीरें दिखाते हैं।
  • वे उनसे पूछते हैं: "इन तस्वीरों को सबसे कम कारों वाली से सबसे अधिक कारों वाली फोटो के क्रम में रखें।"
  • लाइब्रेरियन यह देखने में बहुत अच्छा है कि कौन सा ढेर बड़ा या छोटा दिखता है। इस "रैंकिंग" खेल का अभ्यास करके, लाइब्रेरियन दृश्य भीड़ और संख्या के बीच के संबंध को सीख जाता है, जिससे उसे बाद में वास्तविक संख्या का अनुमान लगाने में मदद मिलती है।

3. "ज़ूम-इन" सुरक्षा जाल (वैश्विक और स्थानीय - Global-and-Local)

समस्या: जब भीड़ बहुत घनी होती है (जैसे कि मोश पिट), तो लाइब्रेरियन अक्सर संख्या को कम आंकता है। वे लोगों के एक "धुंधले समूह" को देखते हैं और सोचते हैं, "ओह, यह बस एक बड़ा समूह है," बजाय इसके कि वे व्यक्तियों को गिनें।
समाधान: लेखक लाइब्रेरियन को दो-चरणीय सुरक्षा जाल देते हैं।

  • चरण A (बड़ी तस्वीर): पूरी छवि की कुल संख्या के लिए पूछें।
  • चरण B (ज़ूम-इन): यदि लाइब्रेरियन को लगता है कि भीड़ बहुत बड़ी है, तो छवि को चार छोटे वर्गों में काट दें (जैसे एक पिज्जा)। लाइब्रेरियन से प्रत्येक छोटे वर्ग में लोगों को गिनने के लिए कहें।
  • जादुई मिश्रण: कभी-कभी लाइब्रेरियन पूरी तस्वीर को कम आंकता है, लेकिन छोटे वर्गों को अधिक आंक देता है (क्योंकि वे लोगों के किनारों को दो बार देख लेते हैं)। लेखक बस "बड़ी तस्वीर" के अनुमान और "छोटे वर्गों" के अनुमान का औसत ले लेते हैं। यह दो अलग-अलग मानचित्रों को लेकर और वास्तविक स्थान खोजने के लिए उनका औसत निकालने जैसा है।

परिणाम

इन तीन तरीकों का उपयोग करके, लेखकों ने लाइब्रेरियन को किसी भी श्रेणी (कारें, लोग, मछली, पक्षी) में वस्तुओं को गिनना सिखाया, बिना किसी इंसान द्वारा हर वस्तु पर बिंदु बनाने की आवश्यकता के।

  • पहले: लाइब्रेरियन बिखरी हुई भीड़ के लिए ठीक था लेकिन घनी भीड़ के लिए बहुत बुरा था।
  • अब: लाइब्रेरियन अब उन सबसे महंगे, पूरी तरह से प्रशिक्षित विशेषज्ञों के लगभग बराबर है (जिन्हें हजारों घंटों के मानव बिंदु-ड्राइंग की आवश्यकता थी), लेकिन उन्होंने यह सब बहुत सस्ते, सरल संकेतों का उपयोग करके सीखा है।

संक्षेप में: उन्होंने AI को उत्तर रटने के लिए मजबूर नहीं किया; उन्होंने उसे समस्याओं को तोड़ने, दृश्यों की तुलना करने और अपने काम की दोबारा जांच करने के माध्यम से गिनने के बारे में सोचना सिखाया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →