GazeVLM: Active Vision via Internal Attention Control for Multimodal Reasoning
يُعد GazeVLM نموذجاً متعدد الوسائط بـ 4 مليارات معلمة، يعزز الاستدلال عالي الدقة من خلال استيعاب التحكم الميتا-معرفي لتوليد رموز التحديق ديناميكياً، مما يمكّن النموذج من محاكاة الانتباه البؤري النشط ذاتياً وكبح الميزات المرئية غير ذات الصلة دون الاعتماد على أدوات قص خارجية أو نوافذ سياق متضخمة.