💻 computer science

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

تقترح هذه الورقة CLIPF، وهي استراتيجية لإخفاء النصوص تعتمد على تكرار الكلمات للتدريب المسبق لنماذج الرؤية واللغة، والتي تتفوق على الأساليب الحالية مثل الإخفاء القائم على بناء الجملة، خاصة عندما تكون بيانات التدريب محدودة، بينما تُظهر أيضاً أن الاستراتيجيات الأخرى يمكن أن تتجاوز الإخفاء القائم على بناء الجملة مع توفر عدد كافٍ من دورات التدريب.

Mingliang Liang, Martha Larson2026-01-15
💻 computer science

MedicalNarratives: Connecting Medical Vision and Language with Localized Narratives

تقدم هذه الورقة MedicalNarratives، وهي مجموعة بيانات واسعة النطاق تضم 4.7 مليون زوج من الصور والنصوص الطبية المستمدة من فيديوهات تعليمية على يوتيوب تتميز بآثار مؤشر الفأرة الموضعية للتمركز الزمكاني، والتي تُستخدم لتدريب نموذج GenMedClip الذي يحقق أداءً هو الأفضل في حالته عبر 12 مجالاً طبياً.

Wisdom O. Ikezogwo, Kevin Zhang, Mehmet Saygin Seyfioglu, Fatemeh Ghezloo, Linda Shapiro, Ranjay Krishna2026-01-15
💻 computer science

Fair Foundation Models for Medical Image Analysis: Challenges and Perspectives

تجادل هذه الورقة بأن تحقيق نماذج طبية تأسيسية عادلة يتطلب نهجاً شاملاً للتخفيف من حدة التحيز يمتد عبر كامل مراحل خط الإنتاج — بدءاً من توثيق البيانات، ومروراً بتطوير النماذج، وصولاً إلى بروتوكولات النشر — بدلاً من الاعتماد فقط على الإصلاحات على مستوى النموذج، مما يجسّر الفجوة بين الابتكار التقني والمبادئ الأخلاقية لتعميم الرعاية الصحية للفئات السكانية المحرومة.

Dilermando Queiroz, Anderson Carlos, André Anjos, Lilian Berton2026-01-15
💻 computer science

An Attention Infused Deep Learning System with Grad-CAM Visualization for Early Screening of Glaucoma

تقترح هذه الورقة نظاماً جديداً للتعلم العميق يدمج بين شبكة عصبية تلافيفية مخصصة ومحول رؤية عبر وحدة انتباه متقاطع لتعزيز الكشف المبكر عن الجلوكوما على مجموعتي بيانات ACRIMA وDrishti، محققاً أداءً فائقاً مقارنة بالنماذج المستقلة مع استخدام تقنية Grad-CAM لضمان القابلية للتفسير السريري.

Ramanathan Swaminathan2026-01-15
💻 computer science

Privacy-Preserving in Connected and Autonomous Vehicles Through Vision to Text Transformation

تقترح هذه الورقة إطار عمل مبتكرًا للحفاظ على الخصوصية للمركبات المتصلة والمستقلة يستخدم التعلم التعزيزي الهرمي ونماذج الرؤية واللغة لتحويل البيانات المرئية الحساسة إلى أوصاف نصية دقيقة، مما يحمي الخصوصية الفردية مع الحفاظ على دلالات المشهد والتفوق على الأساليب الحالية في كل من الدقة الدلالية ومقاييس الخصوصية.

Abdolazim Rezaei, Mehdi Sookhak, Ahmad Patooghy, Shahab S. Band, Amir Mosavi2026-01-15
💻 computer science

SlumpGuard: An AI-Powered Real-Time System for Automated Concrete Slump Prediction via Video Analysis

تقدم هذه الورقة نظام SlumpGuard، وهو نظام رؤية مدعوم بالذكاء الاصطناعي يعمل على أتمتة التنبؤ بهبوط الخرسانة في الوقت الفعلي من خلال تحليل فيديوهات تفريغ شاحنات الخلاطات، متجاوزاً بذلك قيود الاختبار اليدوي المعتمد على المشغل عبر نهج خالٍ من المستشعرات تم التحقق من صحته بواسطة مجموعة بيانات واسعة النطاق وتقييم الخبراء.

Youngmin Kim, Giyeong Oh, Kwangsoo Youm, Youngjae Yu2026-01-15
⚛️ quantum physics

Analysis of Quantum Image Representations for Supervised Classification

تقارن هذه الورقة بين أربعة تمثيلات للصور الكمومية، حيث وجدت أن تمثيلي FRQI وQPIE يقدمان ضغطاً فائقاً، وتوضح أن النوى الكمومية القائمة على هذه التمثيلات تحقق دقة تصنيف مماثلة للطرق الكلاسيكية مع تطلب موارد تخزين أقل بشكل أسي.

Marco Parigi, Mehran Khosrojerdi, Filippo Caruso, Leonardo Banchi2026-01-15
💻 computer science

Universal Few-Shot Spatial Control for Diffusion Models

تقترح الورقة البحثية التحكم العالمي قليل العينات (UFC)، وهو مُكيِّف متعدد الاستخدامات يُمكِّن نماذج الانتشار سابقة التدريب من التعميم على مهام التكييف المكاني الجديدة بأداء عالٍ باستخدام أمثلة معدلة قليلة فقط، مما يتغلب على قيود القدرة على التكيف وتكلفة التدريب للمنهجيات الحالية.

Kiet T. Nguyen, Chanhyuk Lee, Donggyun Kim, Dong Hoon Lee, Seunghoon Hong2026-01-15
💻 computer science

BARL: Bilateral Alignment in Representation and Label Spaces for Semi-Supervised Volumetric Medical Image Segmentation

تقدم هذه الورقة BARL، وهو إطار عمل موحد شبه مُشرف لتجزئة الصور الطبية الحجمية يعمل على تعزيز الأداء من خلال فرض محاذاة ثنائية في كل من فضاءات التمثيل والملصقات عبر مكونات مبتكرة مثل التنظيم ثنائي المسار وتصحيح الانحياز المعرفي التدريجي.

Shujian Gao, Yuan Wang, Zekuan Yu2026-01-15
💻 computer science

Head Pursuit: Probing Attention Specialization in Multimodal Transformers

تقدم هذه الورقة طريقة استقصاء قائمة على معالجة الإشارات لتحديد وتصنيف رؤوس الانتباه المتخصصة في نماذج المحولات متعددة الوسائط، مما يثبت أن تعديل ما لا يزيد عن 1% من هذه الرؤوس يمكن أن يتحكم بفعالية في مفاهيم دلالية أو بصرية محددة في مخرجات النموذج.

Lorenzo Basile, Valentino Maiorca, Diego Doimo, Francesco Locatello, Alberto Cazzaniga2026-01-15