💬 NLP

Caption First, VQA Second: Knowledge Density, Not Task Format, Drives Multimodal Scaling

تجادل هذه الورقة بأن العائق الأساسي في توسيع نطاق النماذج اللغوية الكبيرة متعددة الوسائط ليس تنوع تنسيق المهام، بل هو كثافة المعرفة في بيانات التدريب، حيث تُثبت أن إثراء التعليقات التوضيحية للصور بمعرفة مهيكلة يحقق تحسينات أكثر اتساقاً في الأداء من إضافة الإشراف الخاص بالمهام مثل الإجابة على الأسئلة البصرية.

Hongjian Zou, Yue Ge, Qi Ding, Yixuan Liao, Xiaoxin Chen2026-04-16
💻 computer science

C2^2T: Captioning-Structure and LLM-Aligned Common-Sense Reward Learning for Traffic--Vehicle Coordination

تقدم الورقة البحثية إطار عمل C2T، وهو إطار عمل مبتكر يسخر النماذج اللغوية الكبيرة لاستخلاص المعرفة القائمة على المنطق السليم في دالة مكافأة جوهرية، مما يعزز بشكل كبير مستويات السلامة والكفاءة والراحة في التعلم التعزيزي متعدد الوكلاء لتنسيق إشارات المرور والمركبات ذاتية القيادة مقارنة بالنماذج المرجعية التقليدية المصممة يدويًا للمكافآت.

Yuyang Chen, Kaiyan Zhao, Yiming Wang, Ming Yang, Bin Rao, Zhenning Li2026-04-16
💻 computer science

A Lightweight Multi-Metric No-Reference Image Quality Assessment Framework for UAV Imaging

تقدم هذه الورقة البحثية MM-IQA، وهو إطار عمل لتقييم جودة الصور بدون مرجع يتميز بخفته وكفاءته الحسابية، حيث يجمع بين دلالات التشوه القابلة للتفسير لتوليد درجة جودة واحدة، مُظهراً أداءً قوياً عبر مجموعات بيانات معيارية متعددة وملاءمة للفحص السريع في تطبيقات تصوير الطائرات بدون طيار.

Koffi Titus Sergio Aglin, Anthony K. Muchiri, Celestin Nkundineza2026-04-16
🤖 AI

Graph Propagated Projection Unlearning: A Unified Framework for Vision and Audio Discriminative Models

تقدم هذه الورقة البحثية "الإسقاط المنتشر عبر الرسوم البيانية" (GPPU)، وهو إطار عمل موحد وقابل للتوسع يستفيد من الانتشار القائم على الرسوم البيانية والإسقاط المتعامد لمحو المعلومات الخاصة بفئة معينة بشكل فعال وغير قابل للاسترداد من كل من النماذج التمييزية للرؤية والصوت، محققاً تسريعاً يتراوح بين 10 إلى 20 ضعفاً مقارنة بالطرق الحالية مع الحفاظ على الفائدة في الفئات المتبقية.

Shreyansh Pathak, Jyotishman Das2026-04-16
🤖 machine learning

Depth-Resolved Coral Reef Thermal Fields from Satellite SST and Sparse In-Situ Loggers Using Physics-Informed Neural Networks

تقدم هذه الورقة شبكة عصبية مستوحاة من الفيزياء تدمج بيانات درجة حرارة سطح البحر عبر الأقمار الصناعية مع قياسات أجهزة التسجيل الميدانية المتفرقة لإعادة بناء الحقول الحرارية الموزعة حسب العمق وإجهاد ابيضاض المرجان بدقة عبر الحاجز المرجاني العظيم، متفوقة بشكل كبير على النماذج الإحصائية والنماذج القائمة على الفيزياء فقط حتى في ظل ندرة البيانات الشديدة.

Alzayat Saleh, Mostafa Rahimi Azghadi2026-04-16
🤖 AI

Multitasking Embedding for Embryo Blastocyst Grading Prediction (MEmEBG)

تقترح هذه الورقة نهجاً للتمثيل المتعدد المهام باستخدام بنية ResNet-18 سابقة التدريب لأتمتة التقييم الموضوعي والمتسق لمكونات الكيسة الأريمية (الأرومة المغذية، والكتلة الخلوية الداخلية، والتمدد) من صور أجنة اليوم الخامس، وذلك لمعالجة الذاتية والتباين المتأصلين في التقييمات اليدوية التقليدية لعمليات الإخصاب في المختبر.

Nahid Khoshk Angabini, Mohsen Tajgardan, Mahesh Madhavan, Zahra Asghari Varzaneh, Reza Khoshkangini, Thomas Ebner2026-04-16
💻 computer science

A High-Resolution Landscape Dataset for Concept-Based XAI With Application to Species Distribution Models

تقدم هذه الورقة مجموعة بيانات لمفاهيم المناظر الطبيعية عالية الدقة، وأول إطار عمل للذكاء الاصطناعي القابل للتفسير القائم على المفاهيم باستخدام تقنية (Robust TCAV) لتعزيز القابلية للتفسير والصلاحية البيئية لنماذج توزيع الأنواع القائمة على التعلم العميق، وهو ما تم إثباته من خلال دراسة حالة على الحشرات المائية.

Augustin de la Brosse, Damien Garreau, Thomas Houet, Thomas Corpetti2026-04-16
🤖 AI

4th Workshop on Maritime Computer Vision (MaCVi): Challenge Overview

تقدم هذه الورقة نظرة عامة على ورشة عمل الرؤية الحاسوبية البحرية الرابعة (MaCVi) في مؤتمر CVPR 2026، حيث تفصل تحديات معايير القياس الخمسة التي تركز على دقة التنبؤ والجدوى في الوقت الفعلي، إلى جانب مجموعات البيانات المرتبطة بها، وبروتوكولات التقييم، والنتائج الكمية، والرؤى التقنية من الفرق الأعلى أداءً.

Benjamin Kiefer, Jan Lukas Augustin, Jon Muhovič, Mingi Jeong, Arnold Wiliem, Janez Pers, Matej Kristan, Alberto Quattri (…)2026-04-16
🤖 AI

Rethinking Uncertainty in Segmentation: From Estimation to Decision

تجادل هذه الورقة بأنه في تقسيم الصور الطبية، يجب تقييم عدم اليقين بناءً على جودة القرارات التي يتيحها بدلاً من تقييمه بمعزل عنها، حيث تُظهر أن سياسة تأجيل بسيطة تعتمد على الوعي بالثقة يمكن أن تقضي على ما يصل إلى 80% من الأخطاء مع تأجيل 25% فقط من البكسلات، مما يكشف عن انفصال بين مقاييس المعايرة القياسية والمنفعة في العالم الحقيقي.

Saket Maganti2026-04-16
💬 NLP

Indexing Multimodal Language Models for Large-scale Image Retrieval

تقترح هذه الورقة نهجاً لا يتطلب تدريباً يستفيد من النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) كأدوات لتقدير التشابه بنمط "التعلم الصفري" لاسترجاع الصور واسع النطاق، مما يثبت متانتها الفائقة تجاه التحديات البصرية وفعاليتها كبديل لأدوات إعادة الترتيب المتخصصة دون الحاجة إلى الضبط الدقيق.

Bahey Tharwat, Giorgos Kordopatis-Zilos, Pavel Suma, Ian Reid, Giorgos Tolias2026-04-16