Catching the Details: Self-Distilled RoI Predictors for Fine-Grained MLLM Perception
تقترح هذه الورقة البحثية إطار عمل SD-RPN، وهو إطار عمل فعال وخالٍ من التوسيم يعزز الإدراك دقيق التفاصيل للنماذج اللغوية الكبيرة متعددة الوسائط عبر تدريب شبكة اقتراح مناطق خفيفة الوزن باستخدام تسميات مستعارة منزوعة الضجيج مستخلصة من خرائط الانتباه الداخلية للنموذج نفسه.