Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs
यह शोध पत्र 'ग्रैस्प एनी रीजन' (GAR) को प्रस्तुत करता है, जो एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो सटीक, इंटरैक्टिव क्षेत्र-स्तरीय समझ और संरचनात्मक तर्क के लिए वैश्विक संदर्भ को एकीकृत करने हेतु RoI-अलाइन्ड फीचर रिप्ले का लाभ उठाता है, और इमेज एवं वीडियो बेंचमार्क दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप चश्मे के माध्यम से एक व्यस्त, बिखरे हुए कमरे को देख रहे हैं।
पुराने AI चश्मों की समस्या
अधिकांश वर्तमान "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (AI जो देख और बात कर सकता है) ऐसे हैं जैसे लोग वाइड-एंगल लेंस पहने हुए हों। वे आपको कमरे का एक सामान्य दौरा कराने में माहिर हैं: "यह एक बेडरूम है जिसमें एक बिस्तर, एक डेस्क और एक खिड़की है।" लेकिन यदि आप किसी विशिष्ट वस्तु की ओर इशारा करते हैं और पूछते हैं, "वह हरी चीज़ क्या है?", तो वाइड-एंगल लेंस अक्सर भ्रमित हो जाता है। यह आपको बता सकता है, "वह एक असली मेंढक है!" क्योंकि यह हरे रंग के आकार को देख लेता है, लेकिन यह पूरी तरह से इस तथ्य को मिस कर देता है कि वह वास्तव में एक मेंढक के आकार की स्लीपर है जो बिस्तर पर रखी है। इसमें कमरे के संदर्भ (context) को खोए बिना ज़ूम करने की क्षमता की कमी है।
अन्य AI मॉडलों ने आवर्धक लेंस (magnifying glasses) का उपयोग करके इसे ठीक करने की कोशिश की। वे केवल उस हरी वस्तु को काटकर उसे करीब से देखते थे। लेकिन यह एक अलग थलग पड़े पहेली के टुकड़े को देखने जैसा है; आप उसकी बनावट तो देख सकते हैं, लेकिन आपको यह नहीं पता चलेगा कि वह मेंढक है या स्लीपर क्योंकि आप उस बिस्तर को नहीं देख पा रहे हैं जिस पर वह रखा है।
समाधान: ग्रैस्प एनी रीजन (GAR)
यह पेपर एक नया AI पेश करता है जिसे GAR (ग्रैस्प एनी रीजन) कहा जाता है। GAR को एक सुपर-इंटेलिजेंट जासूस के रूप में सोचें जो एक विशेष चश्मा पहनता है जिसमें एक अनूठी विशेषता है: "RoI-Aligned Feature Replay"।
GAR कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से दिया गया है:
1. "पूरी तस्वीर" बनाम "ज़ूम" (जादुई लेंस)
कल्पना कीजिए कि आप एक जंगल की पेंटिंग देख रहे हैं।
- पुराना AI: या तो पूरे जंगल को देखता है (और नन्हे पक्षी को मिस कर देता है) या पक्षी पर ज़ूम करता है (और भूल जाता है कि वह जंगल में है)।
- GAR: यह पक्षी पर ज़ूम करते समय भी पूरे जंगल को अपने दिमाग में रखता है। यह RoI-Aligned Feature Replay नामक तकनीक का उपयोग करता है।
- उपमा: कल्पना कीजिए कि आपके पास पूरे शहर का एक हाई-रिज़ॉल्यूशन मैप है। जब आप किसी विशेष सड़क को देखना चाहते हैं, तो GAR उस सड़क को मैप से काटता नहीं है। इसके बजाय, यह मैप पर एक "स्पॉटलाइट" प्रोजेक्ट करता है। आप सड़क को हाई डेफिनेशन में देखते हैं, लेकिन आप बैकग्राउंड में आसपास की इमारतों और सड़कों को भी देख सकते हैं। यह GAR को यह समझने में मदद करता है, "आह, वह हरी चीज़ मेंढक नहीं है; वह एक स्लीपर है क्योंकि वह बिस्तर पर है।"
2. "ग्रुप चैट" (मल्टी-प्रॉम्ट इंटरैक्शन)
अधिकांश AI मॉडल ऐसे लोगों की तरह हैं जो एक बार में केवल एक व्यक्ति से बात कर सकते हैं। यदि आप उन्हें कुत्ते, गेंद और एक व्यक्ति वाली तस्वीर दिखाते हैं और कुत्ते के बारे में पूछते हैं, तो वे कुत्ते के बारे में बात करते हैं। यदि आप गेंद के बारे में पूछते हैं, तो वे गेंद के बारे में बात करते हैं। वे उनके बीच के संबंध को समझने में संघर्ष करते हैं।
GAR एक ग्रुप चैट मॉडरेटर की तरह है।
- आप एक साथ कुत्ते, गेंद और व्यक्ति की ओर इशारा कर सकते हैं।
- GAR गतिशीलता (dynamic) को समझता है: "व्यक्ति गेंद को कुत्ते की ओर फेंक रहा है।"
- यह जटिल प्रश्न भी संभाल सकता है जैसे, "क्या कुत्ता गेंद की ओर देख रहा है, या गेंद कुत्ते की ओर देख रही है?" (ठीक है, गेंदें देख नहीं सकतीं, लेकिन आप समझ गए होंगे—यह इंटरैक्शन को समझता है)।
3. "जासूस की नोटबुक" (कंपोजिशनल रीजनिंग)
GAR केवल वह नहीं बताता जो वह देखता है; वह एक जासूस की तरह तर्क (reasoning) करता है।
- दर्पण परीक्षण: यदि आप GAR को एक दर्पण के सामने खड़े व्यक्ति की तस्वीर दिखाते हैं, और आप प्रतिबिंब की ओर इशारा करते हैं, तो GAR जानता है, "वह असली व्यक्ति नहीं है; वह एक प्रतिबिंब है।" पुराना AI अक्सर धोखा खा जाता है और सोचता है कि वहाँ दो लोग हैं।
- "कहाँ" का परीक्षण: यदि आप पूछते हैं, "क्या लाल कप नीले कप के बाईं ओर है या दाईं ओर?", तो GAR केवल कप के रंग के आधार पर अनुमान लगाने के बजाय स्थानिक लेआउट (spatial layout) को समझने के लिए पूरे दृश्य को देखता है।
यह क्यों महत्वपूर्ण है (परिणाम)
शोधकर्ताओं ने GAR का परीक्षण एक नए "परीक्षा" पर किया जिसे उन्होंने GAR-Bench नाम दिया है।
- परिणाम: GAR इतना अच्छा है कि इसका एक छोटा संस्करण (GAR-1B), एक विशाल और महंगे मॉडल (InternVL3-78B) को इन विशिष्ट कार्यों पर हरा देता है।
- वीडियो बोनस: भले ही GAR को फोटो पर प्रशिक्षित किया गया था, फिर भी यह इतना स्मार्ट था कि जब उन्हें वीडियो दिखाया गया, तो इसने वीडियो के लिए विशेष रूप से बनाए गए मॉडलों की तुलना में एक्शन को बेहतर ढंग से समझा। यह सिम्युलेटर पर ड्राइविंग सीखने जैसा है, और फिर वे वास्तविक कार में बेहतर ड्राइविंग करते हैं जैसे कि कोई व्यक्ति जिसने केवल वास्तविक सड़कों पर अभ्यास किया हो।
संक्षेप में
GAR एक ऐसा AI है जिसने आखिरकार यह सीख लिया है कि बड़ी तस्वीर को खोए बिना ज़ूम कैसे किया जाए। यह एक छोटी सी चीज़ को देख सकता है, याद रख सकता है कि वह दुनिया में कहाँ है, यह समझ सकता है कि उसका अन्य वस्तुओं के साथ क्या संबंध है, और अन्य संबंधों के बारे में जटिल प्रश्न भी हल कर सकता है, और वह उन मूर्खतापूर्ण गलतियों (जैसे स्लीपर को मेंढक कहना) से बचता है जो अन्य AI करते हैं।
यह AI को एक निष्क्रिय पर्यवेक्षक (जो केवल पूरे कमरे का वर्णन करता है) से एक सक्रिय भागीदार (जो किसी भी चीज़ की ओर इशारा कर सकता है, संदर्भ समझ सकता है, और उसके बारे में गहरी बातचीत कर सकता है) में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।