💻 computer science

CardioSAM: Topology-Aware Decoder Design for High-Precision Cardiac MRI Segmentation

تُعد CardioSAM بنية هجينة تعزز تقسيم صور الرنين المغناطيسي للقلب من خلال الجمع بين مشفر SAM مجمد وفك تشفير جديد مدرك للطوبولوجيا، مما يحقق دقة فائقة وموثوقية سريرية على معيار ACDC مقارنة بالنماذج المرجعية الحالية ومستويات اتفاق الخبراء.

Ujjwal Jain2026-04-07
💬 NLP

CoLA: Cross-Modal Low-rank Adaptation for Multimodal Downstream Tasks

تقدم هذه الورقة البحثية CoLA، وهو إطار عمل جديد للضبط الدقيق بكفاءة المعلمات يعزز التكيف متعدد الوسائط في البنيات ثنائية المسار عن طريق إضافة مسار مخصص بين الوسائط إلى تقنية LoRA القياسية، مما يتفوق على الأساليب الحالية في معايير الرؤية واللغة والسمع والبصر، مع تمكين أول ضبط دقيق بكفاءة المعلمات متعدد المهام لعمليات التأسيس البصري.

Wish Suharitdamrong, Tony Alex, Muhammad Awais, Sara Ahmed2026-04-07
💻 computer science

Robust Multi-Source Covid-19 Detection in CT Images

تقترح هذه الورقة إطار عمل متين للتعلم متعدد المهام يتنبأ بشكل مشترك بتشخيص كوفيد-19 ومصدر البيانات باستخدام هيكل EfficientNet-B7 وفقدان معدل اللوغيت (logit-adjusted loss) للتخفيف من الانحيازات الخاصة بالمراكز، محققاً أداءً عالياً (F1: 0.9098، AUC-ROC: 0.9647) في اكتشاف المرض عبر مؤسسات متعددة ذات بروتوكولات تصوير مقطعي (CT) متنوعة.

Asmita Yuki Pritha, Jason Xu, Daniel Ding, Justin Li, Aryana Hou, Xin Wang, Shu Hu2026-04-07
🤖 AI

CoLoRSMamba: Conditional LoRA-Steered Mamba for Supervised Multimodal Violence Detection

تقدم الورقة البحثية CoLoRSMamba، وهي بنية متعددة الوسائط من نوع (فيديو إلى صوت) اتجاهية تستفيد من تقنية (CLS-guided conditional LoRA) لتكييف معاملات فضاء الحالة لنموذج AudioMamba ديناميكيًا بناءً على السياق البصري، محققةً دقة وكفاءة رائدة في اكتشاف العنف على مجموعات بيانات NTU-CCTV وDVD المنسقة والمفلترة صوتيًا.

Damith Chamalke Senadeera, Dimitrios Kollias, Gregory Slabaugh2026-04-07
💻 computer science

Bridging the Dimensionality Gap: A Taxonomy and Survey of 2D Vision Model Adaptation for 3D Analysis

تقدم هذه الورقة مسحاً شاملاً وتصنيفاً موحداً لاستراتيجيات تكييف نماذج الرؤية ثنائية الأبعاد الناجحة مع التحليل ثلاثي الأبعاد، حيث تصنف النهج إلى أساليب تركز على البيانات، وأساليب تركز على البنية الهيكلية، وأساليب هجينة، مع تحليل مقايضاتها وتحديد الاتجاهات البحثية المستقبلية.

Akshat Pandya, Bhavuk Jain2026-04-07
💻 computer science

YOLOv11 Demystified: A Practical Guide to High-Performance Object Detection

تقدم هذه الورقة تحليلاً شاملاً لـ YOLOv11، حيث تفصل ابتكاراته المعمارية الجديدة مثل وحدات C3K2 وC2PSA التي تعزز استخراج الميزات وكشف الأجسام الصغيرة، بينما تثبت دقته الفائقة وأداءه في الوقت الفعلي مقارنة بالإصدارات السابقة لتطبيقات مثل القيادة الذاتية والمراقبة.

Nikhileswara Rao Sulake2026-04-07
💻 computer science

ViBA: Implicit Bundle Adjustment with Geometric and Temporal Consistency for Robust Visual Matching

إن ViBA هو إطار تعلم مستدام يدمج الضبط المتعدد لعمليات التعديل التفاضلي الضمني مع تعلم الميزات لتمكين التدريب المستمر عبر الإنترنت على تدفقات الفيديو غير المقيدة، مما يحسن دقة المطابقة البصرية والتعميم بشكل كبير مع الحفاظ على الأداء في الوقت الفعلي.

Xiaoji Niu, Yuqing Wang, Yan Wang, Hailiang Tang, Tisheng Zhang2026-04-07
🤖 machine learning

Banana100: Breaking NR-IQA Metrics by 100 Iterative Image Replications with Nano Banana Pro

تقدم الورقة البحثية Banana100، وهي مجموعة بيانات تضم 28,000 صورة تعرضت للتدهور عبر 100 خطوة تحرير تكرارية، لتكشف أن تحرير الصور متعدد الجولات يسبب تراكمًا شديدًا في تدني الجودة وأن مقاييس تقييم جودة الصور الحالية التي لا تعتمد على مرجع تفشل في اكتشاف هذا التدهور، مما يشكل مخاطر جسيمة على استقرار أنظمة الذكاء الاصطناني الوكيلية.

Kenan Tang, Praveen Arunshankar, Andong Hua, Anthony Yang, Yao Qin2026-04-07
🤖 AI

Can LLMs Reason About Attention? Towards Zero-Shot Analysis of Multimodal Classroom Behavior

تقدم هذه الورقة البحثية مسار معالجة يعتمد على وحدة معالجة رسوميات واحدة ويحافظ على الخصوصية، يستخدم بيانات الهيكل العظمي ونظرات العين التي تتم معالجتها بواسطة نموذج لغوي كبير استدلالي لإجراء تحليل صفري للمشاركة الطلابية في فيديوهات الفصول الدراسية، مما يبرز إمكانات النماذج اللغوية الكبيرة في فهم السلوك متعدد الوسائط مع تسليط الضوء على قيودها الحالية في الاستدلال المكاني.

Nolan Platt, Sehrish Nizamani, Alp Tural, Elif Tural, Saad Nizamani, Andrew Katz, Yoonje Lee, Nada Basit2026-04-07
🤖 machine learning

Zero-Shot Quantization via Weight-Space Arithmetic

تقدم هذه الورقة طريقة تكميم بأسلوب التعلم الصفري (zero-shot) تستخلص "متجه تكميم" قابلاً للنقل من نموذج مانح عبر عمليات حسابية في فضاء الأوزان، وذلك لتعزيز متانة نموذج مستقبِل تجاه التكميم ما بعد التدريب بشكل كبير دون الحاجة إلى أي بيانات تدريب من جانب النموذج المستقبِل.

Daniele Solombrino, Antonio Andrea Gargiulo, Adrian Robert Minut, Luca Zhou, Alessandro Zirilli, Emanuele Rodolà2026-04-07