Question-Guided Evidence Acquisition for Multimodal Visual Question Answering
تقدم الورقة البحثية Q-Guide، وهو وكيل موجه بالأسئلة يعمل على تحسين الإجابة على الأسئلة البصرية متعددة الوسائط من خلال تخصيص حوسبة وقت الاستدلال ديناميكيًا للحصول على أدلة مستهدفة (مثل قراءة النصوص، أو التكبير، أو تحديد المناطق) بدلاً من الاعتماد على ترميز ثابت واحد، مما يتفوق بشكل كبير على الأساليب الحالية في DocVQA2026 وManga109 من خلال الإدراك المتعمد متعدد الجولات.