💻 computer science

QEVA: A Reference-Free Evaluation Metric for Narrative Video Summarization with Multimodal Question Answering

تقدم هذه الورقة QEVA، وهو مقياس تقييم غير مرجعي لتلخيص الفيديو السردي يقيم التغطية والواقعية والتسلسل الزمني عبر الإجابة على الأسئلة متعددة الوسائط، إلى جانب معيار MLVU(VS)-Eval، مما يظهر ارتباطاً فائقاً بالأحكام البشرية مقارنة بالطرق الحالية.

Woojun Jung, Junyeong Kim2026-04-28
💻 computer science

Light 'em Up: Enabling Few-Shot Low-Light 3D Gaussian Splatting with Multi-Scale Explicit Retinex Illumination Decoupling

تقدم الورقة البحثية MERID-GS، وهو إطار عمل لفك الارتباط بين الإضاءة والانعكاس يعتمد على تقنية ريتيكس (Retinex) صريح متعدد المقاييس يستفيد من تقنية Gaussian Splatting ثلاثية الأبعاد لتحقيق حالة متطورة في تخليق المشاهد الجديدة بزاوية 360 درجة في ظروف الإضاءة المنخفضة وبعدد قليل من الصور، وذلك عبر الفصل الفعال بين الإضاءة والانعكاس مع كبح الضجيض وضمان اتساق الرؤية.

YuHao Yin, Zongji Wang, Yuanben Zhang, Biqing Li, Jiesong Bai, Junyi Liu2026-04-28
💻 computer science

FDIM: A Feature-distance-based Generic Video Quality Metric for Versatile Codecs

تقترح الورقة البحثية FDIM، وهو مقياس هجين لجودة الفيديو يعتمد على الميزات العميقة والمصممة يدويًا، تم تدريبه على مجموعة بيانات واسعة النطاق ليحقق تعميمًا قويًا وارتباطًا عاليًا بالتقييمات الذاتية عبر مختلف برامج الترميز التقليدية والعصبية لكل من محتوى النطاق الديناميكي القياسي (SDR) والنطاق الديناميكي العالي (HDR).

Jiayi Wang, Lichun Zhang, Xiaoqi Zhuang, Jiaqi Zhang, Lu Yu, Yin Zhao2026-04-28
💻 computer science

Open-Vocabulary Semantic Segmentation Network Integrating Object-Level Label and Scene-Level Semantic Features for Multimodal Remote Sensing Images

تقترح هذه الورقة البحثية شبكة TSMNet، وهي شبكة جديدة للتجزئة الدلالية متعددة الوسائط ذات مفردات مفتوحة وخاضعة لإشراف نصي، تدمج الميزات النصية على مستوى المشهد والمستوى الكائني مع البيانات المرئية لتعزيز التعميم والقابلية للتفسير في تحليل صور الاستشعار عن بعد.

Jinkun Dai, Yuanxin Ye, Peng Tang, Tengfeng Tang, Xianping Ma, Jing Xiao, Mi Wang2026-04-28
💻 computer science

PointTransformerX:Portable and Efficient 3D Point Cloud Processing without Sparse Algorithms

يُعدّ PointTransformerX (PTX) نموذج محول رؤية للسحب النقطية ثلاثية الأبعاد، وهو مصمم بالكامل بلغة PyTorch الأصلية وقابل للنقل، حيث يلغي العمليات المخصصة لـ CUDA والخوارزميات المتفرقة مع تحقيق دقة تنافسية، وكفاءة فائقة، ودعم عبر المنصات على أجهزة NVIDIA وAMD والمعالجات المركزية (CPU).

Laurenz Reichardt, Nikolas Ebert, Oliver Wasenmüller2026-04-28
💻 computer science

POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation

تقدم هذه الورقة إطار عمل POCA، الذي يعالج المقايضة بين دقة النص وتماسك الصورة في توليد النصوص المرئية من خلال تحديد الحلول المثلى لباريتو واستخدام استراتيجية محاذاة منهجية تكيفية لتدريب النماذج بكفاءة على مجموعات البيانات متعددة المكافآت دون الاعتماد على تحسين المجموع الموزون غير المستقر.

Yaohou Fan, Qingzhong Wang, Yongsong Huang, Junyi Liu, Tomo Miyazaki, Shinichiro Omachi2026-04-28
💻 computer science

Multivariate Gaussian NeRF for Wide Field-of-View Ultrasound Reconstruction

تقدم الورقة البحثية Ultra-Wide-NeRF، وهي طريقة مبتكرة تستفيد من غاوسيات ثلاثية الأبعاد متعددة المتغيرات وأخذ العينات الحجمي المعتمد على المسافة لإعادة بناء صور الموجات فوق الصوتية ذات مجال الرؤية العريض مع تقليل العيوب والتمثيلات العصبية المستمرة لتركيب مشاهد زوايا رؤية جديدة عالية الدقة.

Patris Valera, Magdalena Wysocki, Felix Duelmer, Mohammad Farid Azampour, Sebastian Herz, Stefan Wörz, Nassir Navab2026-04-28
💻 computer science

Computer Vision-Based Early Detection of Container Loss at Sea

تقدم هذه الورقة نظام رؤية حاسوبية منخفض التكلفة وقابلاً للتعديل، يستخدم الكاميرات الموجودة على متن السفن للكشف عن الحاويات غير المستقرة في عرض البحر من خلال تقسيم الأجسام وتحليل الحركة، مما يتيح التدخل المبكر لتعزيز سلامة الشحن والامتثال التنظيمي.

Vishakha Lall, Capt. Stanley S Pinto, Capt. Chu Xing Peng, Wu Kaiwen2026-04-28
⚡ electrical engineering

Deep Learning-Enabled Dissolved Oxygen Sensing in Biofouling Environments for Ocean Monitoring

تقدم هذه الورقة نموذج استشعار يجمع بين المستشعرات الكهروضوئية القائمة على الكاميرا ومحول رؤية مدعوم بالفيزياء (ViT-PINN) لتحقيق مراقبة عالية الدقة وذاتية التشخيص للأكسجين المذاب، حتى في البيئات المتأثرة بشدة بالتعفن الحيوي البحري.

Nikolaos Salaris, Adrien Desjardins, Manish K. Tiwari2026-04-28
💻 computer science

Instance Awareness of Multi-class Semantic Segmentation Loss Functions

تقترح هذه الورقة توسيع نطاق خسائر الحالات الحساسة للمثيلات مثل خسارة "blob" وخسارة "CC" لتشمل التجزئة الدلالية متعددة الفئات عبر تفكيك "واحد مقابل الكل" والوزن العكسي لكل مكون حسب الحجم، مما يثبت أن هذه التعديلات تعالج بفعالية كلاً من عدم التوازن في المثيلات وعدم التوازن في الفئات لتحسين درجات "Dice" وجودة البانوبتيك (Panoptic Quality) على مجموعة بيانات BraTS-METS 2025.

Soumya Snigdha Kundu, Florian Kofler, Marina Ivory, Hendrik Moller, Jonathan Shapey, Tom Vercauteren2026-04-28