💻 computer science

Zero-Shot Traffic Accident Detection via a Coarse-to-Fine VLM-Tracking Pipeline

تقدم هذه الورقة البحثية مسار عمل من الخشن إلى الناعم لا يتطلب تدريباً، يجمع بين نموذج لغوي بصري من نوع Qwen3-VL-32B مجمد مع تقنيات كشف وتتبع الأجسام لتحقيق أداء رائد في الكشف عن حوادث المرور بنمط الصفر (zero-shot) على لقطات كاميرات المراقبة الحقيقية، متفوقةً على النماذج المرجعية الحالية بنسبة 22% دون الحاجة إلى أي بيانات تدريب حقيقية مصنفة.

Dipit Saha, Shah Mohammad Abdul Mannan, Mohammad Raihan Rashid, Ruwad Naswan, Ahnaf Tahmid2026-08-11
🤖 machine learning

Sparse Attention to Emotion: Efficient Facial Emotion Recognition via Token Reduction

تقترح هذه الورقة البحثية "الانتباه المتناثر للعاطفة" (SAE)، وهو نموذج فعال للتعرف على تعبيرات الوجه العاطفية يقوم بالتخلص من ما يصل إلى 90% من رموز الصورة لتحقيق دقة تضاهي أحدث المعايير في مجموعة بيانات (RAF-DB) مع تقليل التعقيد الحسابي بشكل كبير من أجل النشر على الأجهزة الطرفية.

Aya Manel Zitouni, Aicha Zenakhri, Karim Haroun, Larbi Boubchir2026-08-11
💻 computer science

From Noise to Meaning: Meaningful Secret Sharing with Tamper Detection for Facial Recognition

تقترح هذه الورقة إطار عمل مبتكر يعزز المشاركة السرية البصرية للتعرف على الوجوه من خلال دمج حصص تشبه الضجيج في صور غطاء شفافة إدراكياً عبر إخفاء المعلومات التكيفي، وتطبيق آلية مصادقة ثنائية الطبقات لضمان خصوصية البيانات، والتستر، وكشف التلاعب ضد الهجمات المختلفة.

Ajnas Muhammed, Iurii Medvedev, Nuno Gonçalves2026-08-11
💻 computer science

Zero-shot 2D Grounding with Novel Affordance Types

تقدم هذه الورقة مهمة التوطين ثنائي الأبعاد (2D grounding) بنمط الصفر (zero-shot) لأنواع القدرة الإتاحة (affordance) الجديدة، مقترحةً الطريقة غير القابلة للتدريب AffordAnything ومتغيرها القابل للتدريب +AffordAnything اللذين يستفيدان من إشارات التجزئة (segmentation cues) لتحقيق تحسينات كبيرة في الأداء على معيار NAT الجديد.

Haomeng Zhang, Raymond A. Yeh2026-08-11
🤖 machine learning

Can Webcam Gaze Constrain Mesa-Objectives in Driving Models? An Instrument Precision Analysis

تُظهر هذه الدراسة أن تتبع حركة العين القائم على كاميرا الويب يفشل في تقييد الأهداف الميزية (mesa-objectives) في نماذج القيادة الذاتية لأن الخطأ المكاني للجهاز يتجاوز بشكل كبير حجم معظم المخاطر المكتشفة، مما يجعل الإسناد الدقيق للنظر إلى الكائن مستحيلاً من الناحية الفيزيائية.

Lennox Anderson, Ahmed Boutar, Jonah Mulcrone, Tal Erez2026-08-11
💻 computer science

Topology-Aware Global-Local Mamba Networks for Palm Vein Biometrics

تقترح الورقة شبكة "مامبا" (Mamba) عالمية-محلية مدركة للطوبولوجيا تدمج الميزات المحلية متعددة المقاييس، والبديهيات الحافية الموجهة بالهيكل، والمسح عبر فضاء الحالة في أربعة اتجاهات لتحقيق دقة رائدة في التعرف على عروق راحة اليد ومعدلات خطأ منخفضة بأقل عدد من المعلمات على مجموعات البيانات العامة.

Zhengxi Wu, Felix Marattukalam, Waleed H. Abdulla2026-08-11
🤖 AI

Detecting Clear Contact Lenses for Iris Recognition: A Two-Stage Mask-Guided Attention Approach

تتناول هذه الورقة التحدي المهمل المتمثل في اكتشاف العدسات اللاصقة الشفافة في التعرف على قزحية العين من خلال إثبات تأثيرها السلبي على دقة التحقق، واقتراح إطار عمل ثنائي المراحل يجمع بين كشف العدسات المنقوشة ونموذج انتباه مكاني موجه بالقناع مبتكر لتحديد العدسات الشفافة، مما يؤدي في النهاية إلى تحسين أداء النظام من خلال معايرة الدرجات.

Parisa Farmanifard, Arun Ross2026-08-11
🤖 AI

Triple Expert Learning from Noisy Labels for Semi-Supervised Vision Foundation Model Adaptation

تقترح هذه الورقة TriNoL، وهو إطار عمل للتكيف شبه المُشرف لنماذج الرؤية التأسيسية يعزز المتانة تجاه الملصقات الزائفة المشوشة عن طريق توجيه العينات غير المصنفة إلى ثلاث مناطق قائمة على الثقة وتدريب خبراء LoRA متخصصين للإشارات الإيجابية، والمحاذاة، والسلبية مع إبقاء النموذج الأساسي مجمدًا.

Xuanyu Liu, Zheng Fang, Hongyang He, Yundi Hong, Daizong Liu2026-08-11
⚡ electrical engineering

Diagnosing as Cardiologists Do: ECG Agents with Doctor-Grounded Priors for Clinical Reasoning Across Diseases and Populations

تقدم الورقة البحثية LuminaECG، وهو إطار عمل ذو بنية سريرية يعزز تشخيص تخطيط كهربائية القلب عن طريق تصوير الإشارات كبدائيات بصرية قائمة على الشبكات مع حدود موجية صريحة، مما يمكّن نموذج رؤية ولغة خفيف الوزن من تحقيق استدلال بمستوى الخبراء وتعميم عبر المجموعات السكانية من خلال مواءمة الأدلة الموجية القابلة للقياس مع الأولويات المستندة إلى معرفة الأطباء.

Hongxiang Gao, He-yang Xu, Yuwen Li, Minghui Zhao, Zhipeng Cai, Xingyao Wang, Chenxi Yang, Jianqing Li, Chengyu Liu2026-08-11
💻 computer science

Model the Edit, Not the Image: Visual Autoregressive Editing from a Source-Centric Perspective

تقدم هذه الورقة البحثية EditMod، وهو إطار عمل للتحرير المرئي ذاتي التراجع متمحور حول المصدر، يحقق تحريراً للصور عالي الدقة ومتوافقاً مع النص في ثوانٍ معدودة من خلال نمذجة التعديلات كتحديثات متبقية على مستوى المقياس مشتقة من الفرق بين التنبؤات المشروطة بالمصدر والمستهدفة، مما يلغي الحاجة إلى العكس أو الأمثلة أو الأقنعة.

Hongyi Fang, Chuwen Xie, Benjia Zhou, Yu-Xuan Qiu, Chenggong Hu, Zhibin Wang, Chao Chen, Jianbin Qin, Rui Mao2026-08-11