⚡ electrical engineering

DroneScan-YOLO: Redundancy-Aware Lightweight Detection for Tiny Objects in UAV Imagery

يُعد DroneScan-YOLO نظام كشف خفيف الوزن وواعٍ بالوفرة لصور الطائرات بدون طيار، يدمج بين المدخلات عالية الدقة، وتقليم المرشحات الديناميكي، وفرع كشف P2 مخصص، ودالة فقدان هجينة لتحسين كشف الأجسام الصغيرة بشكل كبير مع الحفاظ على سرعات الاستدلال في الوقت الفعلي.

Yann V. Bellec2026-04-16
🤖 AI

Explainable Fall Detection for Elderly Care via Temporally Stable SHAP in Skeleton-Based Human Activity Recognition

تقترح هذه الورقة إطار عمل خفيف الوزن وفي الوقت الفعلي للكشف عن السقوط القائم على الهيكل العظمي، والذي يدمج نموذج LSTM فعالاً مع استراتيجية تجميع T-SHAP مستقرة زمنياً لتوليد تفسيرات موثوقة وجديرة بالثقة سريرياً من خلال تنعيم نسب الميزات عبر الزمن، محققاً دقة بنسبة 94.3% وأمانة تفسيرية محسنة على مجموعة بيانات NTU RGB+D.

Mohammad Saleh, Azadeh Tabatabaei2026-04-16
🤖 AI

Can Cross-Layer Transcoders Replace Vision Transformer Activations? An Interpretable Perspective on Vision

تقدم هذه الورقة "المحولات عبر الطبقات" (CLTs) بوصفها نموذجاً وسيطاً متناثراً ومدركاً للعمق يعيد بناء تنشيطات "محول الرؤية" (Vision Transformer) عبر مخطط مشفر-مفكك، مما يتيح قابلية تفسير دقيقة ومحلية لكل طبقة، ويثبت أن التمثيلات النهائية تتركز في مجموعة صغيرة من المصطلحات المهيمنة لكل طبقة مع الحفاظ على أداء النموذج.

Gerasimos Chatzoudis, Konstantinos D. Polyzos, Zhuowei Li, Difei Gu, Gemma E. Moran, Hao Wang, Dimitris N. Metaxas2026-04-16
💻 computer science

Bias at the End of the Score

تقدم هذه الورقة تدقيقاً واسع النطاق يكشف أن نماذج المكافأة المستخدمة في توليد الصور من النصوص تدمج بطبيعتها تحيزات ديموغرافية، مما يتسبب في جعل عملية التحسين الموجه بالمكافأة تُضفي طابعاً جنسياً على الإناث بشكل غير متناسب، وتعزز الصور النمطية، وتُقلل من التنوع الديموغرافي.

Salma Abdel Magid, Grace Guo, Esin Tureci, Amaya Dharmasiri, Vikram V. Ramaswamy, Hanspeter Pfister, Olga Russakovsky2026-04-16
🤖 machine learning

Deep Spatially-Regularized and Superpixel-Based Diffusion Learning for Unsupervised Hyperspectral Image Clustering

تقترح هذه الورقة إطار العمل DS2DLDS^2DL، وهو إطار لتجميع الصور فائقة الطيف غير الخاضع للإشراف يدمج تعلم التمثيل العميق المقنع عبر مشفر تلقائي قائم على محول الرؤية (Vision Transformer) مع تعلم الانتشار القائم على السوبر بيكسل المنظم مكانياً لتحسين دقة التجميع من خلال التقاط الهندسة المانيفولد الجوهرية للبيانات بشكل أفضل.

Vutichart Buranasiri, James M. Murphy2026-04-16
💻 computer science

Why MLLMs Struggle to Determine Object Orientations

تُفند هذه الورقة الفرضية القائلة بأن النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) تفشل في مهام التوجيه الكائني ثنائي الأبعاد بسبب قيود المشفر البصري، مبرهنةً بدلاً من ذلك على أن معلومات التوجيه يمكن استردادها من تضمينات المشفر ولكنها موزعة بشكل منتشر عبر الميزات، مما يشير إلى أن الفشل ينبع من عدم قدرة النموذج على استخدام هذه المعلومات بفعالية بدلاً من غيابها.

Anju Gopinath, Nikhil Krishnaswamy, Bruce Draper2026-04-16
💻 computer science

Right Regions, Wrong Labels: Semantic Label Flips in Segmentation under Correlation Shift

تتقصى هذه الورقة البحثية وتحدد كمياً نمط فشل محدد في التجزئة الدلالية حيث تحدد النماذج المدربة تحت ظروف مترابطة حدود الكائنات بشكل صحيح ولكنها تبدل تسميات فئات المقدمة بشكل خاطئ، مقترحةً مقاييس تشخيصية جديدة لتقييم وتخفيف مشكلة متانة "قلب التسمية" هذه بما يتجاوز التقييم التقليدي القائم على التداخل.

Akshit Achara, Yovin Yathathugoda, Nick Byrne, Michela Antonelli, Esther Puyol Anton, Alexander Hammers, Andrew P. King2026-04-16
💻 computer science

SEDTalker: Emotion-Aware 3D Facial Animation Using Frame-Level Speech Emotion Diarization

يُعد SEDTalker إطار عمل مبتكر للرسوم المتحركة ثلاثية الأبعاد للوجه الموجهة بالحديث، والذي يستفيد من تشخيص انفعالات الكلام على مستوى الإطار للتنبؤ بإشارات عاطفية كثيفة زمنياً، مما يتيح تحكماً دقيقاً ومستمراً في حركات الوجه التعبيرية من خلال بنية هجينة تجمع بين الـ Transformer والـ Mamba.

Farzaneh Jafari, Stefano Berretti, Anup Basu2026-04-16
💻 computer science

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

تحلل هذه الورقة التعلم السياقي متعدد الوسائط (ICL) بشكل منهجي لتكشف أنه بينما يضاهي أداء النصوص فقط في إعدادات التعلم من الصفر، فإنه يتدهور بشكل كبير في سيناريوهات التعلم من أمثلة قليلة بسبب الافتقار إلى المحاذاة عبر الوسائط على مستوى الاستدلال وعدم موثوقية نقل رسم خرائط المهام، مما أدى إلى اقتراح تعزيز في مرحلة الاستدلال لمعالجة هذه الاختناقات.

Yu Wang, Sharon Li2026-04-16
🤖 AI

DF3DV-1K: A Large-Scale Dataset and Benchmark for Distractor-Free Novel View Synthesis

تقدم هذه الورقة البحثية DF3DV-1K، وهي مجموعة بيانات واقعية واسعة النطاق تضم أكثر من 1,000 مشهد تحتوي على صور نظيفة ومزدحمة لتنقيط وتطوير طرق تخليق المنظور الجديد الخالية من المشتتات، مع إثبات فائدتها أيضاً في الضبط الدقيق للمحسنات القائمة على الانتشار لتحسين جودة إعادة البناء.

Cheng-You Lu, Yi-Shan Hung, Wei-Ling Chi, Hao-Ping Wang, Charlie Li-Ting Tsai, Yu-Cheng Chang, Yu-Lun Liu, Thomas Do, Ch (…)2026-04-16