💻 computer science

VDFP: Video Deflickering with Flicker-banding Priors

تتناول هذه الورقة تحدي التخطيط الرقمي للشاشة (digital screen banding) في فيديوهات الهواتف الذكية من خلال تقديم مجموعة بيانات DeViD الواقعية واقتراح إطار عمل VDFP، وهو إطار توليد مبتكر موجه بالإدراك يستخدم نمذجة حقل التدهور والأسس المستمرة المكانية-الزمانية للقضاء بفعالية على الوميض مع الحفاظ على التفاصيل عالية الدقة والاتساق الزمني.

Zhiyi Zhou, Libo Zhu, Zihan Zhou, Yulun Zhang, Xiaokang Yang2026-05-21
💻 computer science

R2AoP: Reliable and Robust Angle of Progression Estimation from Intrapartum Ultrasound

تقترح الورقة البحثية إطار عمل R2AoP، وهو إطار موثوق ومتين لتقدير زاوية التقدم من التصوير بالموجات فوق الصوتية أثناء الولة، والذي يدمج التجزئة القائمة على البنية، والنمذجة الهندسية الموجهة بالثقة، والتكيف في وقت الاختبار للتغلب على ضجيج التصوير وغموض الحدود، محققاً دقة وقابلية تكرار فائقتين عبر معايير متعددة المراكز.

Yuanhan Wang, Yifei Chen, Beining Wu, Mingxuan Liu, Xiaotian Hu, Chunbo Jiang, Yijin Li, Changmiao Wang, Feiwei Qin, Qiy (…)2026-05-21
🤖 machine learning

Linear-DPO: Linear Direct Preference Optimization for Diffusion and Flow-Matching Generative Models

تقترح هذه الورقة البحثية Linear-DPO، وهو إطار عمل موحد لتحسين التفضيلات يشتق هدفاً عاماً لكل من نماذج الانتشار (diffusion) ونماذج مطابقة التدفق (flow-matching) عن طريق استبدال المنفعة القياسية القائمة على دالة السيجمويد (sigmoid) بمنفعة خطية ونموذج مرجعي يتم تحديثه عبر المتوسط المتحرك الأسي (EMA) للتغلب على عدم توافق الأهداف وتحسين محاذاة توليد الصور من النصوص.

Kesong Li, Yixuan Xu, Kuo-kun Tseng, Weiyi Lu, Kan Liu, Tao Lan2026-05-21
💻 computer science

SurgOnAir: Hierarchy-Aware Real-Time Surgical Video Commentary

تقدم الورقة البحثية SurgOnAir، وهو نموذج رؤية-لغة للبث المباشر في الوقت الفعلي تم تدريبه على مجموعة بيانات هرمية لتوليد سرد جراحي فوري متعدد المستويات وكشف انتقالات سير العمل دون الوصول إلى الإطارات المستقبلية، مما يتيح مساعدة فورية بالذكاء الاصطناعي في غرفة العمليات.

Jingyi He, Yue Zhou, Long Bai, Kun Yuan, Nassir Navab, Yuan Bi2026-05-21
🤖 machine learning

Comparative Analysis of Military Detection Using Drone Imagery Across Multiple Visual Spectrums

تقدم هذه الورقة أربع مجموعات بيانات متخصصة للطيف المرئي (التدرج الرمادي، والحراري، والليلي، ورؤية أوبسكورا) مشتقة من مجموعة بيانات KIIT-MiTA لتدريب وتقييم نموذج YOLOv11-small من أجل الكشف القوي عن الأجسام العسكرية بواسطة الطائرات بدون طيار في ظروف واقعية متنوعة وصعبة.

Sourov Roy Shuvo, Prajwal Panth, Rajesh Chowdhury, Sorup Chakraborty, Sudip Chakrabarty, Prasant Kumar Pattnaik2026-05-21
💻 computer science

FTerViT: Fully Ternary Vision Transformer

تقدم هذه الورقة FTerViT، وهو نموذج Vision Transformer ثلاثي القيم بالكامل (fully ternarized) يقوم بتكميم جميع الأوزان ومعلمات التقييس (normalization parameters) لتحقيق ضغط كبير في الذاكرة وتمكين النشر الفعال على الأجهزة في المتحكمات الدقيقة مع الحفاظ على دقة تنافسية في مجموعة بيانات ImageNet-1K.

Szymon Ruciński, Pietro Bonazzi, Engin Türetken, Simon Narduzzi, Michele Magno, Nadim Maamari2026-05-21
💻 computer science

PGC: Peak-Guided Calibration for Generalizable AI-Generated Image Detection

تقترح الورقة البحثية إطار عمل "المعايرة الموجهة بالقمة" (PGC)، وهو إطار عمل مبتكر يعزز الكشف عن الصور المُنشأة بواسطة الذكاء الاصطناعي من خلال استخدام آلية تركيز على القمة لتسليط الضوء على الأدلة التمييزية المحلية الدقيقة ومعايرة القرارات العالمية، محققاً أداءً هو الأفضل في فئته على معيار تجاري جديد مكون من 15 نموذجاً وعلى مجموعات البيانات الحالية.

Xiaoyu Zhou, Jianwei Fei, Peipeng Yu, Jingchang Xie, Chong Cheng, Zhihua Xia2026-05-21
💻 computer science

Vision Transformers and Convolutional Neural Networks for Land Use Scene Classification

تقدم هذه الورقة تقييماً مقارناً بين الشبكات العصبية الالتفافية (CNNs) ومحولات الرؤية (ViTs) لتصنيف مشاهد استخدام الأراضي، كاشفةً أنه في حين تتفوق الشبكات العصبية الالتفافية مع البيانات المحدودة والأنماط النسيجية المحلية، توفر محولات الرؤية فهماً فائقاً للسياق العالمي عندما تتوفر بيانات تدريب وموارد حوسبة كافية.

Arun D. Kulkarni2026-05-21
💻 computer science

Hyper-V2X: Hypernetworks for Estimating Epistemic and Aleatoric Uncertainty in Cooperative Bird's-Eye-View Semantic Segmentation

تقدم هذه الورقة Hyper-V2X، وهو إطار عمل قائم على الشبكة الفائقة (hypernetwork) يقوم بتقدير كل من اليقين المعرفي (epistemic) واليقين العشوائي (aleatoric) بكفاءة في عملية التجزئة الدلالية لمنظور عين الطائر (Bird's-Eye-View) التعاوني لتقنية مركبة-إلى-كل شيء (V2X)، وذلك عبر توليد توزيعات أوزان عشوائية مشروطة بميزات متعددة الوكلاء مدمجة، مما يعزز موثوقية الإدراك بأقل قدر من العبء الحسابي.

Abhishek Dinkar Jagtap, Sanath Tiptur Sadashivaiah, Andreas Festag2026-05-21
💻 computer science

iTryOn: Mastering Interactive Video Virtual Try-On with Spatial-Semantic Guidance

تقدم الورقة البحثية iTryOn، وهو إطار عمل مبتكر يستفيد من نموذج انتشار فيديو محول (Transformer) واسع النطاق مع توجيه مكاني-دلالي لمعالجة مهمة تجربة الملابس الافتراضية التفاعلية المحددة حديثاً، والتي تتيح استبدال الملابس بشكل واقعي في مقاطع الفيديو التي تتضمن تفاعلات نشطة بين الإنسان والملابس.

Jun Zheng, Zhengze Xu, Mengting Chen, Jing Wang, Jinsong Lan, Xiaoyong Zhu, Kaifu Zhang, Bo Zheng, Xiaodan Liang2026-05-21