🤖 AI

AutoAWG: Adverse Weather Generation with Adaptive Multi-Controls for Automotive Videos

يُعد AutoAWG إطار عمل للتحكم في توليد فيديوهات الطقس القاسي للقيادة الذاتية، وهو يستخدم دمجاً تكيفياً موجهاً بالدلالات، وتوليفاً زمنياً مرتكزاً على نقطة التلاشي، وتدريباً مقنعاً لإنتاج فيديوهات عالية الدقة ومتسقة زمنياً متأثرة بالطقس، تتفوق بشكل كبير على الأساليب الحديثة في الجودة البصرية وإعادة استخدام التوسيم.

Jiagao Hu, Daiguo Zhou, Danzhen Fu, Fuhao Li, Zepeng Wang, Fei Wang, Wenhua Liao, Jiayi Xie, Haiyang Sun2026-04-22
🤖 machine learning

Guiding Distribution Matching Distillation with Gradient-Based Reinforcement Learning

تقدم هذه الورقة البحثية إطار عمل GDMD، وهو إطار مبتكر يعزز تقنية "تقطير مطابقة التوزيع" (Distribution Matching Distillation) عبر دمج التعلم المعزز القائم على التدرج لاستبدال المكافآت القائمة على العينات المشوشة بتدرجات التقطير كإشارة تحسين أساسية، مما يحقق جودة رائدة في توليد الصور خلال خطوات معدودة مع حل النزاعات بين أهداف التقطير وأهداف التعلم المعزز.

Linwei Dong, Ruoyu Guo, Ge Bai, Zehuan Yuan, Yawei Luo, Changqing Zou2026-04-22
💻 computer science

Evaluation of Winning Solutions of 2025 Low Power Computer Vision Challenge

تستعرض هذه الورقة التصميم، وإطار التقييم باستخدام منصة Qualcomm AI Hub، والحلول الفائزة في تحدي IEEE لعام 2025 للرؤية الحاسوبية منخفضة استهلاك الطاقة عبر مسارات تصنيف الصور، والتجزئة ذات المفردات المفتوحة، وتقدير العمق أحادي العين، مع تسليط الضوء على الاتجاهات الرئيسية والتوجهات المستقبلية لنماذج الرؤية الفعالة عند الحافة.

Zihao Ye, Yung Hsiang Lu, Xiao Hu, Shuai Zhang, Taotao Jing, Xin Li, Zhen Yao, Bo Lang, Zhihao Zheng, Seungmin Oh, Hanky (…)2026-04-22
💻 computer science

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

تقترح الورقة البحثية "EgoMotion"، وهو إطار عمل هرمي يفصل بين الاستدلال المعرفي والتحكم الحركي عبر استخدام نموذج رؤية ولغة لتوليد بدائيات حركة منفصلة ونموذج انتشار لتخليق حركة منظور الشخص الأول ثلاثية الأبعاد عالية الدقة، مما يعالج بفعالية تحدي تشابك الاستدال والتوليد في مهام الرؤية واللغة من منظور الشخص الأول.

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen2026-04-22
💻 computer science

PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment

يُعد PortraitDirector إطار عمل جديدًا لإعادة تجسيد الوجه في الوقت الفعلي، يحقق دقة عالية وتحكمًا دقيق التفاصيل من خلال تفكيك حركة الوجه إلى طبقات مكانية ودلالية هرمية لغرض الفصل وإعادة التكوين، مع استخدام تقنيات التحسين لتقديم أداء بسرعة 20 إطارًا في الثانية على وحدة معالجة رسومات واحدة.

Chaonan Ji, Jinwei Qi, Sheng Xu, Peng Zhang, Bang Zhang2026-04-22
💻 computer science

BALTIC: A Benchmark and Cross-Domain Strategy for 3D Reconstruction Across Air and Underwater Domains Under Varying Illumination

تقدم هذه الورقة BALTIC، وهو معيار شامل واستراتيجية عابرة للمجالات تقيم طرق إعادة البناء ثلاثي الأبعاد عبر البيئات الجوية وتحت الماء تحت ظروف إضاءة متفاوتة، مما يثبت أن تقنية Gaussian Splatting مع معالجة مسبقة بسيطة يمكن أن تحقق أداءً مقارباً للطرق المتخصصة في البيئات المائية في الإعدادات المنضبطة.

Michele Grimaldi, David Nakath, Oscar Pizarro, Jonatan Scharff Willners, Ignacio Carlucho, Yvan R. Petillot2026-04-22
💻 computer science

Denoising, Fast and Slow: Difficulty-Aware Adaptive Sampling for Image Generation

تقدم هذه الورقة البحثية "Patch Forcing" (PF)، وهو إطار عمل يستخدم أخذ عينات تكيفي مدرك للصعوبة مع مقاييس ضوضاء وجداول زمنية على مستوى الرقعة لتخصيص الموارد الحسابية ديناميكيًا أثناء توليد الصور، مما يؤدي إلى دفع المناطق الأسهل لتوفير سياق للمناطق الأكثر صعوبة وتحقيق أداء متفوق عبر مهام تركيب متنوعة.

Johannes Schusterbauer, Ming Gui, Yusong Li, Pingchuan Ma, Felix Krause, Björn Ommer2026-04-22
🤖 AI

Improved Anomaly Detection in Medical Images via Mean Shift Density Enhancement

تقترح هذه الورقة إطار عمل هجين للكشف عن الشذوذ يجمع بين تعلم التمثيل ذاتي الإشراف وتعزيز كثافة إزاحة المتوسط (MSDE) لتحقيق أداء رائد في تحديد الحالات المرضية الطبية النادرة باستخدام العينات الطبيعية فقط عبر سبعة مجموعات بيانات تصويرية متنوعة.

Pritam Kar, Gouri Lakshmi S, Saptarshi Bej2026-04-22
💻 computer science

How Far Are Video Models from True Multimodal Reasoning?

تقدم هذه الورقة CLVG-Bench، وهو إطار تقييم شامل يتميز بمقيم فيديو تكيفي، لتقييم قدرات الاستدلال متعدد الوسائط من نوع "الصفري" لنماذج الفيديو بصرامة، كاشفةً أنه على الرغم من التقدم المحرز، لا تزال النماذج الرائدة الحالية تعاني بشكل كبير في مهام التوليد المنطقي والتفاعلي.

Xiaotian Zhang, Jianhui Wei, Yuan Wang, Jie Tan, Yichen Li, Yan Zhang, Ziyi Chen, Daoan Zhang, Dezhi YU, Wei Xu, Songtao (…)2026-04-22
💻 computer science

When Can We Trust Deep Neural Networks? Towards Reliable Industrial Deployment with an Interpretability Guide

تقترح هذه الورقة طريقة مبتكرة قائمة على التفسير البعدي (post-hoc) تستفيد من التفاوت بين الخرائط الحرارية التمييزية الخاصة بالفئات وغير المرتبطة بالفئات، والمعززة بتقنيات تنافسية، للكشف الاستباقي عن الحالات السلبية الكاذبة في شبكات كشف العيوب الصناعية، مما يؤسس لنموذج نشر أكثر موثوقية يرتكز على "البيانات-النموذج-التفسير-المخرجات" لتطبيقات الذكاء الاصطنا_الحرجة التي تتطلب معايير سلامة عالية.

Hang-Cheng Dong, Yuhao Jiang, Yibo Jiao, Lu Zou, Kai Zheng, Bingguo Liu, Dong Ye, Guodong Liu2026-04-22