💻 computer science

Unveiling Deep Shadows: A Survey and Benchmark on Image and Video Shadow Detection, Removal, and Generation in the Deep Learning Era

تقدم هذه الورقة مسحاً ومعياراً موحداً للكشف عن الظلال وإزالتها وتوليدها في الصور والفيديو القائمة على التعلم العميق، حيث تقدم تصنيفات معيارية، ونماذج مُعاد تدريبها للمقارنة العادلة، ورؤى حول الأوليات المشتركة واتجاهات البحث المستقبلية.

Xiaowei Hu, Zhenghao Xing, Tianyu Wang, Chi-Wing Fu, Pheng-Ann Heng2026-03-16
💻 computer science

LADMIM: Logical Anomaly Detection with Masked Image Modeling in Discrete Latent Space

تقدم هذه الورقة البحثية LADMIM، وهو إطار عمل غير خاضع للإشراف للكشف عن الشذوذ، يستفيد من نمذجة الصور المقنعة في فضاء كامن منفصل لتحديد الشذوذ المنطقي بفعالية من خلال تعلم التبعيات طويلة المدى والتركيز على الأنماط الهيكلية العالمية بدلاً من الاختلافات المحلية للبكسل.

Shunsuke Sakai, Tatushito Hasegawa, Makoto Koshino2026-03-16
💻 computer science

ExCellGen: Fast, Controllable, Photorealistic 3D Scene Generation from a Single Real-World Exemplar

يُعد ExCellGen إطار عمل سريعًا وقائمًا على النماذج المثالية، يقوم بتوليد مشاهد ثلاثية الأبعاد واقعية للغاية وقابلة للتحكم من مدخل عارض واحد عبر الجمع بين إعادة بناء التشتت الغاوسي ثلاثي الأبعاد و"أوتوماتون خلوي توليدي" خاص بكل مشهد، مما يتيح الابتكار التفاعلي في ثوانٍ معدودة مع حد أدنى من وقت التدريب.

Clément Jambon, Changwoon Choi, Dongsu Zhang, Olga Sorkine-Hornung, Young Min Kim2026-03-16
🤖 machine learning

Understanding Dataset Distillation via Spectral Filtering

تقدم هذه الورقة UniDD، وهو إطار عمل للترشيح الطيفي يوحد طرق تقطير مجموعات البيانات المتنوعة من خلال تحليل تأثيراتها على المكونات الترددية، ويقترح مطابقة التردد المنهجي (CFM) لموازنة المعلومات ذات التردد المنخفض والعالي ديناميكيًا، مما يحقق أداءً فائقًا عبر مختلف مجموعات البيانات.

Deyu Bo, Songhua Liu, Xinchao Wang2026-03-16
💻 computer science

HyDA: Hypernetworks for Test Time Domain Adaptation in Medical Imaging Analysis

تقدم هذه الورقة HyDA، وهو إطار عمل لشبكة فائقة (hypernetwork) جديد يتيح التكيف مع النطاق في وقت الاختبار في التصوير الطبي من خلال الاستفادة من تمثيلات النطاق الضمنية لضبط معاملات النموذج ديناميكيًا عند الاستدلال، مما يتغلب على قيود الطرق التقليدية التي تتطلب الوصول إلى بيانات النطاق المستهدف أثناء التدريب.

Doron Serebro, Tammy Riklin-Raviv2026-03-16
💻 computer science

Automatic Labelling for Low-Light Pedestrian Detection

تقترح هذه الورقة البحثية مسار عمل مؤتمت لتوسيم البيانات من الأشعة تحت الحمراء إلى الألوان (RGB) لتوليد بيانات تدريب للكشف عن المشاة في ظروف الإضاءة المنخفضة، مما يثبت أن النماذج المدربة على هذه الملصقات المولدة تتفوق على تلك المدربة على الملصقات الحقيقية في معظم حالات التقييم باستخدام مجموعة بيانات KAIST.

Dimitrios Bouzoulas, Eerik Alamikkotervo, Risto Ojala2026-03-16
🤖 AI

From Video to EEG: Adapting Joint Embedding Predictive Architecture to Uncover Saptiotemporal Dynamics in Brain Signal Analysis

تقدم هذه الورقة البحثية EEG-VJEPA، وهو إطار عمل جديد للتعلم الخاضع للإشراف الذاتي يعمل على تكييف بنية التضمين المشترك للفيديو التنبؤية (V-JEPA) لنمذجة إشارات تخطيط كهربائية الدماغ (EEG) كمتتاليات شبيهة بالفيديو، مما يحقق دقة تصنيف هي الأفضل في فئتها وتمثيلات مكانية زمانية قابلة للتفسير على مجموعة بيانات TUH Abnormal EEG.

Amirabbas Hojjati, Lu Li, Ibrahim Hameed, Anis Yazidi, Pedro G. Lind, Rabindra Khadka2026-03-16
🤖 AI

SegDAC: Visual Generalization in Reinforcement Learning via Dynamic Object Tokens

تُعدّ Are/is (الاسم) - وهي إطار عمل "ناقد-ممثل" (actor-critic) يعتمد على التجزئة - وسيلةً تعزز التعميم البصري في التعلم المعزز من خلال معالجة رموز الكائنات ذات الأطوال المتغيرة والمستندة إلى النصوص مع ترميز مكاني، محققةً تحسينات كبيرة في الأداء مقارنةً بأحدث الأساليب عبر مختلف الاضطرابات البصرية دون الحاجة إلى إعادة بناء الصور أو خسائر مساعدة.

Alexandre Brown, Glen Berseth2026-03-16
💻 computer science

MoVieDrive: Urban Scene Synthesis with Multi-Modal Multi-View Video Diffusion Transformer

يقدم MoVieDrive إطار عمل موحد للمحول الانتشار (diffusion transformer) يستفيد من مكونات مشتركة وخاصة لتوليد فيديوهات قيادة حضرية متعددة الأنماط (مثل RGB، والعمق، والدلالات) ومتعددة المشاهد في آن واحد وبشكل قابل للتحكم وعالي الجودة، مما يعالج أوجه القصور في النهج الحالية أحادية النمط أو متعددة النماذج في تركيب مشاهد القيادة الذاتية.

Guile Wu, David Huang, Dongfeng Bai, Bingbing Liu2026-03-16
⚡ electrical engineering

Impact of Labeling Inaccuracy and Image Noise on Tooth Segmentation in Panoramic Radiographs using Federated, Centralized and Local Learning

تُظهر هذه الدراسة أن التعلم الاتحادي، من خلال استخدام مسارات الخسارة لكل عميل للكشف عن الشذوذ، يضاهي أو يتفوق على التعلم المركزي والمحلي في تقسيم الأسنان عبر سيناريوهات مختلفة لفساد البيانات مع الحفاظ بفعالية على خصوصية المريض.

Johan Andreas Balle Rubak, Khuram Naveed, Sanyam Jain, Lukas Esterle, Alexandros Iosifidis, Ruben Pauwels2026-03-16