GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
GazeVLM एक 4B-पैरामीटर वाला मल्टीमॉडल मॉडल है जो उच्च-रिज़ॉल्यूशन तर्क (reasoning) को बेहतर बनाने के लिए गेज़ टोकन (gaze tokens) को गतिशील रूप से उत्पन्न करने हेतु मेटाकॉग्निटिव नियंत्रण को आंतरिक रूप से आत्मसात करता है, जिससे यह मॉडल बाहरी क्रॉपिंग टूल या बढ़े हुए कॉन्टेक्स्ट विंडोज़ पर निर्भर किए बिना सक्रिय फोवियल अटेंशन (foveal attention) का स्वायत्त रूप से अनुकरण करने और अप्रासंगिक विजुअल फीचर्स को दबाने में सक्षम होता है।