← नवीनतम पेपर
🤖 AI

LVLM-COUNT: Enhancing the Counting Ability of Large Vision-Language Models

यह शोध पत्र LVLM-COUNT का प्रस्ताव करता है, जो एक विभाजित-और-विजय (divide-and-conquer) आधारभूत विधि है जो कार्यों को विभाजित करके और दोहराव वाली गिनती से बचने के लिए वस्तुओं के विभाजन को रोककर बड़े विजन-लैंग्वेज मॉडलों की बड़ी संख्या में वस्तुओं को गिनने की क्षमता को बढ़ाता है।

मूल लेखक: Muhammad Fetrat Qharabagh, Mohammadreza Ghofrani, Kimon Fountoulakis

प्रकाशित 2026-02-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Muhammad Fetrat Qharabagh, Mohammadreza Ghofrani, Kimon Fountoulakis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ सरल भाषा और रचनात्मक उपमाओं का उपयोग करते हुए पेपर LVLM-Count की व्याख्या दी गई है।

समस्या: "अतिभारित लाइब्रेरियन" (The Overwhelmed Librarian)

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन है (यह एक लार्ज विजन-लैंग्वेज मॉडल, या LVLM है)। यह लाइब्रेरियन किताब पढ़ सकता है, तस्वीर देख सकता है और आपको बता सकता है कि उसमें क्या हो रहा है। वे जटिल कहानियों को समझने में अद्भुत हैं।

हालाँकि, यदि आप इस लाइब्रेरियन से पूछते हैं, "इस बड़ी टोकरी में कितने लाल सेब हैं?" और वहाँ केवल तीन सेब हैं, तो वे इसे सही बता देंगे। लेकिन यदि आप उन्हें 300 सेबों वाली टोकरी दिखाते हैं, तो वे अक्सर भ्रमित हो जाते हैं। वे कह सकते हैं "298" या "315"।

क्यों? क्योंकि हमारे वर्तमान AI मॉडल चीजों को पहचानने में तो माहिर हैं लेकिन बड़े समूहों को गिनने में बहुत खराब हैं। यह एक साथ पूरे समुद्र तट को देखते हुए रेत के हर एक कण को गिनने की कोशिश करने जैसा है; आपका मस्तिष्क बस अभिभूत (overwhelmed) हो जाता है।

समाधान: "विभाजित करो और जीतो" की रणनीति (The "Divide and Conquer" Strategy)

इस पेपर के लेखकों ने महसूस किया कि लाइब्रेरियन को एक साथ पूरा समुद्र तट गिनने के लिए कहने के बजाय, हमें उन्हें एक बेहतर रणनीति देनी चाहिए। वे अपने तरीके को LVLM-Count कहते हैं।

इसे इस तरह समझें:

  1. नाइफ (Naive) दृष्टिकोण: आप लाइब्रेरियन को एक भीड़ भरे स्टेडियम की फोटो देते हैं और पूछते हैं, "कितने लोगों ने नीली टोपी पहनी है?" वे आँखें सिकोड़ते हैं, चक्कर खाते हैं और गलत अनुमान लगाते हैं।
  2. LVLM-Count दृष्टिकोण: आप एक कैंची लेते हैं और फोटो को छोटे, प्रबंधनीय टुकड़ों में काट देते हैं। आप लाइब्रेरियन को एक छोटा टुकड़ा देते हैं और पूछते हैं, "यहाँ कितनी नीली टोपियाँ हैं?" फिर आप अगले टुकड़े के लिए भी ऐसा ही करते हैं। अंत में, आप कुल योग प्राप्त करने के लिए सभी छोटे उत्तरों को जोड़ देते हैं।

यह सुनने में सरल लगता है, लेकिन इस योजना में एक बड़ा जाल है।

जाल: "स्लाइस की हुई पिज्जा" की समस्या (The "Sliced Pizza" Problem)

यदि आप फोटो को सीधी रेखाओं से काटते हैं (जैसे पिज्जा काटना), तो आप गलती से नीली टोपी पहने हुए किसी व्यक्ति को बीच से ही काट सकते हैं।

  • गलती: लाइब्रेरियन बाएं टुकड़े को देखता है और उसे एक "आधा-टोपी" दिखता है। वे दाएं टुकड़े को देखते हैं और उन्हें एक और "आधा-टोपी" दिखता है। वे उन्हें एक व्यक्ति के बजाय दो अलग व्यक्तियों के रूप में गिन सकते हैं। या, वे भ्रमित होकर एक को पूरी तरह से छोड़ भी सकते हैं।

इसे डबल-काउंटिंग (दो बार गिनना) या फ्रैगमेंटेशन (टुकड़ों में टूटना) कहा जाता है।

गुप्त मंत्र: "ऑब्जेक्ट-अवेयर" कटिंग (The "Object-Aware" Cutting)

यहीं पर इस पेपर का मुख्य नवाचार चमकता है। लेखकों ने केवल सीधी कैंची का उपयोग नहीं किया। उन्होंने एक स्मार्ट कटिंग मशीन बनाई।

  1. लक्ष्यों को पहचानना: सबसे पहले, सिस्टम एक "स्पॉटर" (एक डिटेक्शन मॉडल) का उपयोग करके बिल्कुल यह पता लगाता है कि नीली टोपियाँ कहाँ हैं।
  2. नक्शा बनाना: यह एक नक्शा बनाता है जहाँ टोपियाँ "बाधाओं" (जैसे नदी में पत्थर) की तरह होती हैं।
  3. रास्ता खोजना (Pathfinding): इसके बाद सिस्टम एक पाथफाइंडिंग एल्गोरिदम का उपयोग करता है (जैसे ट्रैफिक के चारों ओर रास्ता खोजने वाला GPS) ताकि काटने वाली रेखाएं खींची जा सकें। रेखाओं को टोपियों के चारों ओर जाने के लिए मजबूर किया जाता है, कभी भी उनके बीच से नहीं।

उपमा: कल्पना कीजिए कि आप एक केक काट रहे हैं, लेकिन आपको उसके ऊपर रखी चेरी को काटकर अलग नहीं करना है। आप सावधानी से अपने चाकू को चेरी के बीच से घुमाते हैं, यह सुनिश्चित करते हुए कि हर चेरी केक के एक हिस्से पर पूरी बनी रहे।

यह चरण-दर-चरण कैसे काम करता है

  1. सुनना: AI आपके प्रश्न को पढ़ता है (जैसे, "भूरे रंग के अंडों को गिनें")।
  2. ज़ूम इन करना: यह इमेज को केवल उस क्षेत्र तक क्रॉप करता है जहाँ अंडे हैं, बाकी रसोई को अनदेखा कर देता है।
  3. अंडों का मानचित्र बनाना: यह हर एक अंडे के चारों ओर अदृश्य रूपरेखा खींचता है।
  4. स्मार्ट कट: यह इमेज के माध्यम से एक रेखा खींचता है, लेकिन रेखा मुड़ती और टेढ़ी-मेढ़ी होती है ताकि वह अंडों के बीच से जाए, कभी भी एक अंडे को आधा न काटे।
  5. गिनना और जोड़ना: यह इन छोटे, सुरक्षित चित्रों को AI लाइब्रेरियन को भेजता है। लाइब्रेरियन प्रत्येक छोटे चित्र में अंडों को आसानी से गिन लेता है। सिस्टम अंतिम उत्तर के लिए उन सभी को जोड़ देता है।

यह क्यों महत्वपूर्ण है

इस पेपर ने कई कठिन डेटासेट्स पर इस पद्धति का परीक्षण किया:

  • भीड़भाड़ वाले दृश्य: जैसे पेंगुइन कॉलोनी जहाँ पेंगुइन एक-दूसरे के ऊपर चढ़े हुए हैं।
  • जटिल वस्तुएं: जैसे विशिष्ट इमोजी को गिनना जो दिखने में बहुत समान हैं (जैसे 2:30 बनाम 2:35 दिखाने वाली घड़ी)।
  • वास्तविक दुनिया के काम: गोदाम में बैरल गिनना या माइक्रोस्कोप में कोशिकाओं (cells) को गिनना।

परिणाम: AI केवल थोड़ा बेहतर नहीं हुआ; यह काफी अधिक बेहतर हो गया। इसने एक भ्रमित अनुमान लगाने वाले को एक विश्वसनीय काउंटर में बदल दिया, यहाँ तक कि सैकड़ों वस्तुओं के लिए भी।

मुख्य निष्कर्ष (The Takeaway)

यह पेपर हमें सिखाता है कि जब AI बड़े नंबरों के साथ संघर्ष करता है, तो हमें जरूरी नहीं कि AI को "अधिक स्मार्ट" बनाने की आवश्यकता हो (जो कठिन और महंगा है)। इसके बजाय, हम समस्या को छोटे हिस्सों में तोड़कर और गिनती जाने वाली वस्तुओं को टूटने से बचाकर, AI के लिए कार्य को आसान बना सकते हैं।

यह एक दोस्त से एक साथ 500 सिक्कों के ढेर को गिनने के लिए कहने बनाम उन्हें 10-10 के ढेर में बांटने के लिए ट्रे देने के बीच का अंतर है। दोस्त वही है, लेकिन तरीका ही अंतर पैदा करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →