💻 computer science

Finetune Like You Pretrain: Boosting Zero-shot Adversarial Robustness in Vision-language Models

تقترح هذه الورقة البحثية AdvFLYP، وهو نموذج جديد للضبط الدقيق الخصمي لنماذج الرؤية واللغة يحاكي وصفة التدريب المسبق الأصلية باستخدام أزواج الصور والنصوص المجموعة من الويب مع فقد التباين وتنظيم الميزات، مما يعزز بشكل كبير المتانة الخصمية في حالة الصفر والقدرة على النقل عبر مجالات متنوعة دون المساس بالدقة في الحالات الطبيعية.

Songlong Xing, Weijie Wang, Zhengyu Zhao, Jindong Gu, Philip Torr, Nicu Sebe2026-04-15
💻 computer science

Seeing Through Touch: Tactile-Driven Visual Localization of Material Regions

تقترح هذه الورقة نموذجاً جديداً لتحديد الموقع البصري المدفوع باللمس، حيث يتعلم تفاعلات الميزات الكثيفة عبر الوسائط لتوليد خرائط بروز المواد، مع معالجة محدودية البيانات من خلال إدخال صور متنوعة من الواقع، واستراتيجية اقتران تنوع المواد، ومجموعتي بيانات تجزئة جديدتين، ليتفوق في النهاية على الأساليب البصرية-اللمسية الحالية.

Seongyu Kim, Seungwoo Lee, Hyeonggon Ryu, Joon Son Chung, Arda Senocak2026-04-15
💻 computer science

GazeVaLM: A Multi-Observer Eye-Tracking Benchmark for Evaluating Clinical Realism in AI-Generated X-Rays

تقدم هذه الورقة GazeVaLM، وهو عبارة عن مجموعة بيانات مرجعية عامة شاملة تتألف من تسجيلات تتبع حركة العين من أطباء أشعة خبراء وتنبؤات من النماذج اللغوية الكبيرة متعددة الوسائط أثناء تقييم صور الأشعة السينية للصدر الحقيقية والمولدة بواسطة الذكاء الاصطناعي، والمصممة لتسهيل البحث في الإدراك السريري، والمقارنة بين البشر والذكاء الاصطناعي، وكشف الصور الطبية الاصطناعية.

David Wong, Zeynep Isik, Bin Wang, Marouane Tliba, Gorkem Durak, Elif Keles, Halil Ertugrul Aktas, Aladine Chetouani, Ca (…)2026-04-15
💻 computer science

UNIGEOCLIP: Unified Geospatial Contrastive Learning

يُعد UNIGEOCLIP إطار عمل موحداً للتعلم التبايني متعدد الوسائط يقوم بمحاذاة خمسة أنماط جغرافية مكانية من خلال المحاذاة الشاملة (all-to-all alignment) ومشفر خطوط الطول والعرض المقيّس، مما يتيح استرجاعاً واستدلالاً فائقين عبر الأنماط المختلفة لجميع التوليفات التعسفية من أنواع البيانات.

Guillaume Astruc, Eduard Trulls, Jan Hosang, Loic Landrieu, Paul-Edouard Sarlin2026-04-15
💻 computer science

Towards Brain MRI Foundation Models for the Clinic: Findings from the FOMO25 Challenge

تُظهر تحدي FOMO25 أن النماذج التأسيسية ذات التعلم الذاتي المدربة على مجموعات بيانات سريرية ضخمة وغير متجانسة يمكنها التفوق على النماذج المرجعية الخاضعة للإشراف والمخصصة لنفس النطاق في مهام التصوير بالرنين المغناطني للدماغ في حالات التعلم من عينات قليلة والتعميم خارج النطاق، مما يكشف أن أهداف التدريب المسبق المثلى تختلف باختلاف المهمة وأن مكاسب الأداء لا تعتمد بشكل صارم على زيادة حجم النموذج أو مدة التدريب.

Asbjørn Munk, Stefano Cerri, Vardan Nersesjan, Christian Hedeager Krag, Jakob Ambsdorf, Pablo Rocamora García, Julia Mac (…)2026-04-15
💻 computer science

Representations Before Pixels: Semantics-Guided Hierarchical Video Prediction

يُعد Re2Pix إطار عمل هرمي للتنبؤ بالفيديو يعمل على تعزيز الاتساق الدلالي الزمني والدقة البصرية في البيئات الديناميكية المعقدة من خلال التنبؤ أولاً ببنية المشهد في فضاء الميزات الخاص بنموذج رؤية مجمد، ثم استخدام هذه التمثيلات المتنبأ بها لتوجيه نموذج انتشار كامن لتركيب إطارات واقعية للغاية.

Efstathios Karypidis, Spyros Gidaris, Nikos Komodakis2026-04-15
💻 computer science

Seeing Through the Tool: A Controlled Benchmark for Occlusion Robustness in Foundation Segmentation Models

تقدم هذه الورقة البحثية OccSAM-Bench، وهو معيار مرجعي منضبط لتقييم نماذج عائلة SAM التأسيسية تحت ظروف الانسداد الجراحي المُصنّع، والذي يكشف عن سلوكيات بنيوية متميزة بين النماذج "المدركة للمُعتِق" التي تعطي الأولوية للأنسجة المرئية، والنماذج "غير المبالية بالمُعتِق" التي تستنتج التشريح المخفي، مما يوجه عملية اختيار النموذج بناءً على القصد السريري المحدد.

Nhan Ho, Luu Le, Thanh-Huy Nguyen, Thien Nguyen, Xiaofeng Liu, Ulas Bagci2026-04-15
💻 computer science

HDR Video Generation via Latent Alignment with Logarithmic Encoding

تُثبت هذه الورقة أنه يمكن تحقيق توليد فيديو عالي الجودة بنطاق ديناميكي مرتفع (HDR) من خلال الاستفادة من النماذج التوليدية مسبقة التدريب عبر الترميز اللوغاريتمي لمواءمة صور الـ HDR مع الفضاءات الكامنة الحالية، مقترنة باستراتيجية تدهور تحاكي الكاميرا لاستنتاج التفاصيل المفقودة عبر الضبط الدقيق خفيف الوزن.

Naomi Ken Korem, Mohamed Oumoumad, Harel Cain, Matan Ben Yosef, Urska Jelercic, Ofir Bibi, Yaron Inger, Or Patashnik, Da (…)2026-04-15
💻 computer science

LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation

تقدم هذه الورقة مراجعة شاملة للتطورات الأخيرة عند تقاطع النماذج اللغوية الكبيرة متعددة الوسائط (LMMs) والرؤية المتمحورة حول الأشياء، حيث تنظم الأدبيات في أربعة محاور رئيسية هي الفهم، والتقسيم، والتحرير، والتوليد، مع تلخيص نماذج النمذجة وتحديد التحديات المستقبلية لتطوير أنظمة متعددة الوسائط دقيقة وموثوقة.

Yuqian Yuan, Wenqiao Zhang, Juekai Lin, Yu Zhong, Mingjian Gao, Binhe Yu, Yunqi Cao, Wentong Li, Yueting Zhuang, Beng Ch (…)2026-04-15
💻 computer science

SyncFix: Fixing 3D Reconstructions via Multi-View Synchronization

يُعد SyncFix إطار عمل مبتكر يعزز جودة إعادة البناء ثلاثي الأبعاد من خلال فرض الاتساق عبر الرؤى أثناء عملية الصقل القائمة على الانتشار عبر مسألة مطابقة الجسر الكامن المشتركة، مما يمكّنه من التفوق على الأساليب الرائدة حتى في غياب الصور المرجعية النقية.

Deming Li, Abhay Yadav, Cheng Peng, Rama Chellappa, Anand Bhattad2026-04-15