Efficient Inference of Large Vision Language Models
تقدم هذه الورقة مسحاً شاملاً للتقنيات الحديثة لتسريع استنتاج نماذج اللغة والرؤية الكبيرة (LVLM)، حيث تقدم تصنيفاً منهجياً عبر أربعة أبعاد هي: ضغط الرموز المرئية، وإدارة الذاكرة، والبنية الفعالة، واستراتيجيات فك الترميز، مع فحص نقدي للقيود الحالية وتحديد الاتجاهات البحثية المستقبلية.