Bridging Pixels and Words: Mask-Aware Local Semantic Fusion for Multimodal Media Verification
تقدم هذه الورقة MaLSF، وهو إطار عمل جديد للتحقق متعدد الوسائط يتغلب على قيود الدمج الشمولي السلبي من خلال توظيف أزواج قناع-تسمية كمرتكزات دلالية واستخدام التحقق المتبادل ثنائي الاتجاه عبر الوسائط مع التجميع الهرمي للكشف بنشاط عن التناقضات الدلالية المحلية الدقيقة في المعلومات المضللة المعقدة وتفسيرها.