Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering
تقترح هذه الورقة إطار عمل للضبط الدقيق كفء في المعلمات يجمع بين نموذج الرؤية واللغة Florence-2 للإجابة على الأسئلة البصرية السريرية، ونموذج Stable Diffusion 2.1 المعزز بتقنية LoRA لتوليد صور جهاز هضمي اصطناعية تحافظ على الخصوصية، مما يظهر أداءً فائقًا وتكاليف حوسبة منخفضة مقارنة بالنماذج الحالية.