← नवीनतम पेपर
💬 NLP

GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning

GazeVLM एक 4B-पैरामीटर वाला मल्टीमॉडल मॉडल है जो उच्च-रिज़ॉल्यूशन तर्क (reasoning) को बेहतर बनाने के लिए गेज़ टोकन (gaze tokens) को गतिशील रूप से उत्पन्न करने हेतु मेटाकॉग्निटिव नियंत्रण को आंतरिक रूप से आत्मसात करता है, जिससे यह मॉडल बाहरी क्रॉपिंग टूल या बढ़े हुए कॉन्टेक्स्ट विंडोज़ पर निर्भर किए बिना सक्रिय फोवियल अटेंशन (foveal attention) का स्वायत्त रूप से अनुकरण करने और अप्रासंगिक विजुअल फीचर्स को दबाने में सक्षम होता है।

मूल लेखक: Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

प्रकाशित 2026-05-11
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Brown Ebouky, Gabriele Carrino, Niccolo Avogaro, Christoph Studer, Andrea Bartezzaghi, Mattia Rigotti

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जटिल पहेली सुलझाने की कोशिश कर रहे हैं, लेकिन पूरी तस्वीर को एक साथ देखने के बजाय, आपके पास जादुई चश्मे का एक जोड़ा है जो आपको बड़े चित्र का ट्रैक खोए बिना विशिष्ट छोटे टुकड़ों पर ज़ूम करने की अनुमति देता है। यह अनिवार्य रूप से GazeVLM है जो कंप्यूटर के लिए करता है।

यहाँ इस पेपर के विचारों का एक सरल विवरण दिया गया है, जो रोजमर्रा के उदाहरणों का उपयोग करता है:

समस्या: "धुंधला पढ़ने वाला" कंप्यूटर

वर्तमान AI मॉडल जो छवियों को देखते हैं (जिन्हें विजन-लैंग्वेज मॉडल कहा जाता है), वे एक ऐसे छात्र की तरह हैं जो किताब पढ़ने की कोशिश कर रहा है जबकि कोई उसके कान में एक हजार यादृच्छिक तथ्य चिल्ला रहा हो।

  • वे अब कैसे काम करते हैं: वे एक ही बार में पूरी छवि को प्रोसेस करने की कोशिश करते हैं, हर एक पिक्सेल को शब्दों की एक विशाल सूची (टोकन) में बदल देते हैं। जैसे ही वे अपना उत्तर सोचने और लिखने लगते हैं, उन अतिरिक्त शब्दों का "शोर" महत्वपूर्ण विवरणों को दबा देता है।
  • परिणाम: वे अक्सर भ्रमित हो जाते हैं, मनगढ़ंत बातें बनाने लगते हैं (hallucinate), या सूक्ष्म लेकिन महत्वपूर्ण विवरणों को मिस कर देते हैं क्योंकि वे एक ही समय में पूरी दुनिया को अपने दिमाग में रखने की कोशिश कर रहे होते हैं।

समाधान: "सक्रिय दृष्टि" (Active Gaze)

इस पेपर के लेखकों ने, GazeVLM, AI को उस तरह से देखना सिखाना चाहा जैसे एक इंसान देखता है: सक्रिय रूप से

एक मानव जासूस के बारे में सोचें जो अपराध स्थल की जांच कर रहा है:

  1. ग्लोबल व्यू (Global View): वे पहले लेआउट का अंदाजा लगाने के लिए पूरे कमरे को देखते हैं।
  2. फोवियल फोकस (Foveal Focus): वे कुछ दिलचस्प देखते हैं (जैसे कि एक कीचड़ वाला पदचिह्न) और बाकी कमरे को एक पल के लिए अनदेखा करते हुए विशेष रूप से उस स्थान पर अपनी आँखों को ज़ूम करते हैं।
  3. ग्लोबल पर वापसी (Return to Global): एक बार जब वे पदचिह्न की जांच कर लेते हैं, तो वे अगले सुराग की ओर बढ़ने से पहले यह देखने के लिए पीछे हटते हैं कि वह पूरे दृश्य में कैसे फिट बैठता है।

वर्तमान AI स्वाभाविक रूप से चरण 2 और 3 नहीं करता है। या तो वे पूरी छवि को घूरते रहते हैं या भारी बाहरी उपकरणों (जैसे कि एक रोबोटिक हाथ जो फोटो के एक टुकड़े को भौतिक रूप से काटता है और उसे फिर से स्कैन करता है) का उपयोग करते हैं, जो धीमा और महंगा है।

GazeVLM नियमों को बदल देता है: यह AI को बिना किसी बाहरी उपकरण के, अपने ही मस्तिष्क के भीतर यह "ज़ूमिंग" करना सिखाता है।

यह कैसे काम करता है: जादुई "लुक" टोकन

शोधकर्ताओं ने AI को निर्देशों का एक विशेष सेट दिया, जैसे कि एक गुप्त भाषा:

  • <LOOK>: जब AI को एहसास होता है कि उसे एक विशिष्ट विवरण की जांच करने की आवश्यकता है, तो वह <LOOK> टाइप करता है और छवि पर उस क्षेत्र के चारों ओर एक बॉक्स बनाता है।
  • "साइलेंस" बटन: यही जादुई हिस्सा है। जब AI <LOOK> कहता है, तो वह वास्तव में छवि को नहीं काटता है। इसके बजाय, वह छवि के बाकी हिस्से पर एक "म्यूट बटन" दबा देता है। यह अपने स्वयं के अटेंशन सिस्टम को बताता है: "एक सेकंड के लिए इस बॉक्स के बाहर की हर चीज़ को अनदेखा करो। केवल यहाँ ध्यान केंद्रित करो।"
  • </LOOK>: एक बार जब वह उस स्थान की जांच पूरी कर लेता है, तो वह </LOOK> टाइप करता है, "म्यूट" को बंद कर देता है, और अपने अगले कदम की योजना बनाने के लिए पूरी छवि को फिर से देख सकता है।

प्रशिक्षण: करके सीखना (और पुरस्कृत होना)

आप केवल AI को "ज़ोर से देखने" के लिए नहीं कह सकते; इसे इसे सीखना होगा। शोधकर्ताओं ने दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग किया:

  1. दिखाना और बताना (SFT): उन्होंने AI को हजारों उदाहरण दिखाए कि कैसे चरण-दर-चरण छवियों को देखा जाता है, उसे <LOOK> और <THINK> का सिंटैक्स सिखाया।
  2. खेल (Reinforcement Learning): उन्होंने AI के साथ एक खेल खेला। यदि इसने सही स्थान पर देखा और सही उत्तर प्राप्त किया, तो इसे एक "इनाम" (ट्रीट) मिला। यदि इसने गलत जगह देखा, बहुत अधिक बार देखा, या केवल अनुमान लगाया, तो इसे "टाइम-आउट" (दंड) मिला।

समय के साथ, AI ने सीखा कि जीतने का स्मार्ट तरीका पूरे चित्र को घूरना नहीं था, बल्कि रणनीतिक रूप से उन सुरागों पर ज़ूम करना था जिनकी उसे आवश्यकता थी।

परिणाम: स्मार्ट और तेज़

पेपर का दावा है कि यह नई विधि एक बड़ा सुधार है:

  • बेहतर सटीकता: उच्च-रिज़ॉल्यूशन वाली छवियों (जैसे चार्ट पर छोटा टेक्स्ट या फोटो में छोटी वस्तुएं) से संबंधित कठिन परीक्षणों पर, GazeVLM ने अन्य शीर्ष मॉडलों की तुलना में काफी अधिक स्कोर किया। इसने लगभग 4% से 5% बेहतर स्कोर किया, जो AI की दुनिया में एक बड़ी छलांग है।
  • कम बर्बादी: क्योंकि इसे छवि को काटने और फिर से स्कैन करने की आवश्यकता नहीं है (जैसा कि अन्य "ज़ूम-इन" टूल्स को होता है), यह बहुत कम कंप्यूटर पावर का उपयोग करता है। यह उसी समस्या को हल करने के लिए 5 गुना कम शब्द उत्पन्न करता है, जिससे यह चलाने में बहुत तेज़ और सस्ता हो जाता है।
  • आंतरिक कौशल: दिलचस्प बात यह है कि एक बार जब AI ने यह कौशल सीख लिया, तो उसे अंतिम परीक्षण के दौरान "म्यूट बटन" (बायस) को चालू करने की भी आवश्यकता नहीं थी। इसने ध्यान केंद्रित करने की इतनी अच्छी आदत विकसित कर ली थी कि यह स्वाभाविक रूप से कर सकता था, ठीक वैसे ही जैसे एक मानव जासूस को अपनी आँखों को केंद्रित करने के लिए किसी मैनुअल की आवश्यकता नहीं होती।

सारांश में

GazeVLM एक कंप्यूटर को यह सिखाने जैसा है कि एक बार में पूरे समुद्र को निगलने की कोशिश करने के बजाय, सही कप से एक घूँट लेना कैसे सीखें। AI को अपने स्वयं के आंतरिक अटेंशन का उपयोग करके स्वेच्छा से "ज़ूम इन" और "ज़ूम आउट" करने की क्षमता देकर, यह दृश्य पहेलियों को अधिक सटीक, तेज़ और शोर से अभिभूत हुए बिना हल करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →