← नवीनतम पेपर
💻 computer science

Grasp Any Region: Towards Precise, Contextual Pixel Understanding for Multimodal LLMs

यह शोध पत्र 'ग्रैस्प एनी रीजन' (GAR) को प्रस्तुत करता है, जो एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जो सटीक, इंटरैक्टिव क्षेत्र-स्तरीय समझ और संरचनात्मक तर्क के लिए वैश्विक संदर्भ को एकीकृत करने हेतु RoI-अलाइन्ड फीचर रिप्ले का लाभ उठाता है, और इमेज एवं वीडियो बेंचमार्क दोनों पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang
प्रकाशित 2026-03-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Haochen Wang, Yuhao Wang, Tao Zhang, Yikang Zhou, Yanwei Li, Jiacong Wang, Jiani Zheng, Ye Tian, Jiahao Meng, Zilong Huang, Guangcan Mai, Anran Wang, Yunhai Tong, Zhuochen Wang, Xiangtai Li, Zhaoxiang Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप चश्मे के माध्यम से एक व्यस्त, बिखरे हुए कमरे को देख रहे हैं।

पुराने AI चश्मों की समस्या
अधिकांश वर्तमान "मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स" (AI जो देख और बात कर सकता है) ऐसे हैं जैसे लोग वाइड-एंगल लेंस पहने हुए हों। वे आपको कमरे का एक सामान्य दौरा कराने में माहिर हैं: "यह एक बेडरूम है जिसमें एक बिस्तर, एक डेस्क और एक खिड़की है।" लेकिन यदि आप किसी विशिष्ट वस्तु की ओर इशारा करते हैं और पूछते हैं, "वह हरी चीज़ क्या है?", तो वाइड-एंगल लेंस अक्सर भ्रमित हो जाता है। यह आपको बता सकता है, "वह एक असली मेंढक है!" क्योंकि यह हरे रंग के आकार को देख लेता है, लेकिन यह पूरी तरह से इस तथ्य को मिस कर देता है कि वह वास्तव में एक मेंढक के आकार की स्लीपर है जो बिस्तर पर रखी है। इसमें कमरे के संदर्भ (context) को खोए बिना ज़ूम करने की क्षमता की कमी है।

अन्य AI मॉडलों ने आवर्धक लेंस (magnifying glasses) का उपयोग करके इसे ठीक करने की कोशिश की। वे केवल उस हरी वस्तु को काटकर उसे करीब से देखते थे। लेकिन यह एक अलग थलग पड़े पहेली के टुकड़े को देखने जैसा है; आप उसकी बनावट तो देख सकते हैं, लेकिन आपको यह नहीं पता चलेगा कि वह मेंढक है या स्लीपर क्योंकि आप उस बिस्तर को नहीं देख पा रहे हैं जिस पर वह रखा है।

समाधान: ग्रैस्प एनी रीजन (GAR)
यह पेपर एक नया AI पेश करता है जिसे GAR (ग्रैस्प एनी रीजन) कहा जाता है। GAR को एक सुपर-इंटेलिजेंट जासूस के रूप में सोचें जो एक विशेष चश्मा पहनता है जिसमें एक अनूठी विशेषता है: "RoI-Aligned Feature Replay"

GAR कैसे काम करता है, यहाँ सरल उपमाओं के माध्यम से दिया गया है:

1. "पूरी तस्वीर" बनाम "ज़ूम" (जादुई लेंस)

कल्पना कीजिए कि आप एक जंगल की पेंटिंग देख रहे हैं।

  • पुराना AI: या तो पूरे जंगल को देखता है (और नन्हे पक्षी को मिस कर देता है) या पक्षी पर ज़ूम करता है (और भूल जाता है कि वह जंगल में है)।
  • GAR: यह पक्षी पर ज़ूम करते समय भी पूरे जंगल को अपने दिमाग में रखता है। यह RoI-Aligned Feature Replay नामक तकनीक का उपयोग करता है।
    • उपमा: कल्पना कीजिए कि आपके पास पूरे शहर का एक हाई-रिज़ॉल्यूशन मैप है। जब आप किसी विशेष सड़क को देखना चाहते हैं, तो GAR उस सड़क को मैप से काटता नहीं है। इसके बजाय, यह मैप पर एक "स्पॉटलाइट" प्रोजेक्ट करता है। आप सड़क को हाई डेफिनेशन में देखते हैं, लेकिन आप बैकग्राउंड में आसपास की इमारतों और सड़कों को भी देख सकते हैं। यह GAR को यह समझने में मदद करता है, "आह, वह हरी चीज़ मेंढक नहीं है; वह एक स्लीपर है क्योंकि वह बिस्तर पर है।"

2. "ग्रुप चैट" (मल्टी-प्रॉम्ट इंटरैक्शन)

अधिकांश AI मॉडल ऐसे लोगों की तरह हैं जो एक बार में केवल एक व्यक्ति से बात कर सकते हैं। यदि आप उन्हें कुत्ते, गेंद और एक व्यक्ति वाली तस्वीर दिखाते हैं और कुत्ते के बारे में पूछते हैं, तो वे कुत्ते के बारे में बात करते हैं। यदि आप गेंद के बारे में पूछते हैं, तो वे गेंद के बारे में बात करते हैं। वे उनके बीच के संबंध को समझने में संघर्ष करते हैं।

GAR एक ग्रुप चैट मॉडरेटर की तरह है।

  • आप एक साथ कुत्ते, गेंद और व्यक्ति की ओर इशारा कर सकते हैं।
  • GAR गतिशीलता (dynamic) को समझता है: "व्यक्ति गेंद को कुत्ते की ओर फेंक रहा है।"
  • यह जटिल प्रश्न भी संभाल सकता है जैसे, "क्या कुत्ता गेंद की ओर देख रहा है, या गेंद कुत्ते की ओर देख रही है?" (ठीक है, गेंदें देख नहीं सकतीं, लेकिन आप समझ गए होंगे—यह इंटरैक्शन को समझता है)।

3. "जासूस की नोटबुक" (कंपोजिशनल रीजनिंग)

GAR केवल वह नहीं बताता जो वह देखता है; वह एक जासूस की तरह तर्क (reasoning) करता है।

  • दर्पण परीक्षण: यदि आप GAR को एक दर्पण के सामने खड़े व्यक्ति की तस्वीर दिखाते हैं, और आप प्रतिबिंब की ओर इशारा करते हैं, तो GAR जानता है, "वह असली व्यक्ति नहीं है; वह एक प्रतिबिंब है।" पुराना AI अक्सर धोखा खा जाता है और सोचता है कि वहाँ दो लोग हैं।
  • "कहाँ" का परीक्षण: यदि आप पूछते हैं, "क्या लाल कप नीले कप के बाईं ओर है या दाईं ओर?", तो GAR केवल कप के रंग के आधार पर अनुमान लगाने के बजाय स्थानिक लेआउट (spatial layout) को समझने के लिए पूरे दृश्य को देखता है।

यह क्यों महत्वपूर्ण है (परिणाम)

शोधकर्ताओं ने GAR का परीक्षण एक नए "परीक्षा" पर किया जिसे उन्होंने GAR-Bench नाम दिया है।

  • परिणाम: GAR इतना अच्छा है कि इसका एक छोटा संस्करण (GAR-1B), एक विशाल और महंगे मॉडल (InternVL3-78B) को इन विशिष्ट कार्यों पर हरा देता है।
  • वीडियो बोनस: भले ही GAR को फोटो पर प्रशिक्षित किया गया था, फिर भी यह इतना स्मार्ट था कि जब उन्हें वीडियो दिखाया गया, तो इसने वीडियो के लिए विशेष रूप से बनाए गए मॉडलों की तुलना में एक्शन को बेहतर ढंग से समझा। यह सिम्युलेटर पर ड्राइविंग सीखने जैसा है, और फिर वे वास्तविक कार में बेहतर ड्राइविंग करते हैं जैसे कि कोई व्यक्ति जिसने केवल वास्तविक सड़कों पर अभ्यास किया हो।

संक्षेप में

GAR एक ऐसा AI है जिसने आखिरकार यह सीख लिया है कि बड़ी तस्वीर को खोए बिना ज़ूम कैसे किया जाए। यह एक छोटी सी चीज़ को देख सकता है, याद रख सकता है कि वह दुनिया में कहाँ है, यह समझ सकता है कि उसका अन्य वस्तुओं के साथ क्या संबंध है, और अन्य संबंधों के बारे में जटिल प्रश्न भी हल कर सकता है, और वह उन मूर्खतापूर्ण गलतियों (जैसे स्लीपर को मेंढक कहना) से बचता है जो अन्य AI करते हैं।

यह AI को एक निष्क्रिय पर्यवेक्षक (जो केवल पूरे कमरे का वर्णन करता है) से एक सक्रिय भागीदार (जो किसी भी चीज़ की ओर इशारा कर सकता है, संदर्भ समझ सकता है, और उसके बारे में गहरी बातचीत कर सकता है) में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →