Beyond Vision: Contextually Enriched Image Captioning with Multi-Modal Retrieval
تقترح هذه الورقة مساراً متعدد الوسائط يعزز وصف الصور من خلال استرجاع ومحاذاة الصور المتشابهة دلالياً واستخراج المعلومات السياقية من المقالات ذات الصلة لتعزيز الأوصاف البصرية الأساسية، مما يؤدي إلى توليد أوصاف أكثر ثراءً وإدراكاً للأحداث تم تقييمها على مجموعة بيانات OpenEvents v1.