⚡ electrical engineering

Detection and Classification of Cetacean Echolocation Clicks using Image-based Object Detection Methods applied to Advanced Wavelet-based Transformations

تقترح هذه الأطروحة وتتحقق من صحة CLICK-SPOT، وهو إطار عمل للتعلم العميق يستفيد من التحويلات القائمة على المويجات بدلاً من المخططات الطيفية التقليدية لتحسين الكشف والتصنيف التلقائي لنقرات صدى الصوت لدى الحيتانيات في البيئات المائية المعقدة والمليئة بالضجيج.

Christopher Hauer2026-02-23
💻 computer science

KPM-Bench: A Kinematic Parsing Motion Benchmark for Fine-grained Motion-centric Video Understanding

تقدم هذه الورقة البحثية KPM-Bench، وهي مجموعة بيانات مفتوحة المصدر جديدة ذات تعليقات توضيحية دقيقة للحركة ومجموعة تقييم للهلوسة، إلى جانب خوارزمية MoPE وإطار تدريب قائم على GRPO، لمعالجة أوجه القصور في نماذج وصف الفيديو الحالية بشكل منهجي في وصف الحركات البشرية المعقدة بدقة والحد من الهلوسة المتعلقة بالحركة.

Boda Lin, Yongjie Zhu, Xiaocheng Gong, Wenyu Qin, Meng Wang2026-02-23
💻 computer science

Multi-Modal Monocular Endoscopic Depth and Pose Estimation with Edge-Guided Self-Supervision

تقدم هذه الورقة PRISM، وهو إطار عمل للتعلم الذاتي لتقدير العمق والوضعية في التصوير التنظيري أحادي العدسة، والذي يستفيد من كشف الحواف وتفكيك السطوع الجوهري للتغلب على تحديات مثل الأسطح الخالية من الملمس واختلافات الإضاءة، مبرهنةً على أن التدريب على بيانات من العالم الحقيقي مع تحسين أخذ عينات الإطارات يتفوق على الطرق الخاضعة للإشراف على النماذج الاصطناعية.

Xinwei Ju, Rema Daher, Danail Stoyanov, Sophia Bano, Francisco Vasconcelos2026-02-23
⚡ electrical engineering

Deep Learning for Dermatology: An Innovative Framework for Approaching Precise Skin Cancer Detection

تبحث هذه الورقة في فعالية نماذج التعلم العميق VGG16 وDenseNet201 في التمييز بين الآفات الجلدية الحميدة والخبيثة، حيث أظهرت أن نموذج DenseNet201 حقق دقة متفوقة بلغت 93.79% على مجموعة بيانات مكونة من 3,297 صورة لدعم الكشف المبكر عن سرطان الجلد.

Mohammad Tahmid Noor, B. M. Shahria Alam, Tasmiah Rahman Orpa, Shaila Afroz Anika, Mahjabin Tasnim Samiha, Fahad Ahammed2026-02-23
💻 computer science

Enabling Training-Free Text-Based Remote Sensing Segmentation

تقترح هذه الورقة إطار عمل لا يتطلب تدريباً يدمج نماذج الرؤية واللغة مع نموذج "Segment Anything" لتحقيق أداء فائق في تقسيم الاستشعار عن بعد القائم على النصوص بنمط الصفر (zero-shot) عبر مهام متنوعة من المفردات المفتوحة، والمهام المرجعية، ومهام الاستدلال.

Jose Sosa, Danila Rukhovich, Anis Kacem, Djamila Aouada2026-02-23
💻 computer science

On the Evaluation Protocol of Gesture Recognition for UAV-based Rescue Operation based on Deep Learning: A Subject-Independence Perspective

تنتقد هذه الورقة بروتوكول التقييم لدراسة تعتمد على التعلم العميق للتعرف على الإيماءات في عمليات الإنقاذ بواسطة الطائرات بدون طيار، موضحةً أن دقة النتائج شبه المثالية المبلغ عنها تنبع من تسرب البيانات الناتج عن التقسيم العشوائي على مستوى الإطارات بدلاً من التعميم الحقيقي المستقل عن الأشخاص.

Domonkos Varga2026-02-23
💻 computer science

Learning Compact Video Representations for Efficient Long-form Video Understanding in Large Multimodal Models

تقترح هذه الورقة إطار عمل متكاملًا لفهم الفيديو طويل التنسيق بكفاءة في النماذج متعددة الوسائط الكبيرة، يجمع بين عينة فيديو تكيفية قائمة على كثافة المعلومات وضواغط مكانية-زمانية قائمة على المشفّر التلقائي للتغلب على قيود الذاكرة واستخراج المعلومات التمييزية من تسلسلات الفيديو الزائدة.

Yuxiao Chen, Jue Wang, Zhikang Zhang, Jingru Yi, Xu Zhang, Yang Zou, Zhaowei Cai, Jianbo Yuan, Xinyu Li, Hao Yang, David (…)2026-02-23
🤖 AI

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

تتقصى هذه الورقة الفجوة بين الأداء القوي لنماذج الرؤية واللغة في الاختبارات المعيارية العامة وأدائها الأضعف في المعرفة البصرية دقيقة التفاصيل، كاشفةً من خلال دراسات الاستئصال أن المشفرات البصرية المتفوقة واستراتيجيات التدريب المسبق المحددة تعد أمراً حاسماً لتعزيز قدرات التصنيف دقيقة التفاصيل.

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt2026-02-23
💻 computer science

Towards LLM-centric Affective Visual Customization via Efficient and Precise Emotion Manipulating

تقترح هذه الورقة مهمة التخصيص البصري العاطفي المتمحور حول النماذج اللغوية الكبيرة (L-AVC)، وتقدم نهجاً فعالاً ودقيقاً للتلاعب بالعواطف (EPEM)، والذي يتميز بوحدات التحويل الفعال بين العواطف والاحتفاظ الدقيق بالعواطف الخارجية، لتوليد صور تعدل المشاعر الذاتية مع الحفاظ على المحتوى غير المرتبط بالعاطفة بشكل فعال.

Jiamin Luo, Xuqian Gu, Jingjing Wang, Jiahong Lu2026-02-23
🤖 AI

DeepSVU: Towards In-depth Security-oriented Video Understanding via Unified Physical-world Regularized MoE

تقدم هذه الورقة DeepSVU، وهي مهمة جديدة لفهم الفيديو المتعمق الموجه نحو الأمن يتجاوز مجرد اكتشاف التهديدات إلى عزو الأسباب، وتقترح إطار عمل Unified Physical-world Regularized MoE (UPRM) لنمذجة وموازنة المعلومات الفيزيائية من الكلي إلى الجزئي بفعالية لتحسين الأداء.

Yujie Jin, Wenxin Zhang, Jingjing Wang, Guodong Zhou2026-02-23