💻 computer science

In-the-Wild Camouflage Attack on Vehicle Detectors through Controllable Image Editing

تقترح هذه الورقة إطار عمل مبتكر يصيغ هجمات تمويه المركبات كمسألة تحرير صور مشروطة عبر ضبط نموذج ControlNet لإنتاج أمثلة خادعة عدائية، تتسم بالخفاء والأمانة الهيكلية، وتؤدي إلى تدهور كبير في أداء الكواشف مع القدرة على التعميم على النماذج والبيئات الفيزيائية غير المرئية.

Xiao Fang, Yiming Gong, Stanislav Panev, Celso de Melo, Shuowen Hu, Shayok Chakraborty, Fernando De la Torre2026-03-23
💻 computer science

Narrative Aligned Long Form Video Question Answering

تقدم هذه الورقة البحثية NA-VQA، وهو معيار جديد يتكون من 88 فيلمًا كامل الطول و4,400 زوج من الأسئلة والأجوبة المصممة لتقييم الاستدلال السردي في الفيديوهات طويلة المدى، إلى جانب Video-NaRA، وهو إطار عمل يحسن الاستدلال طويل المدى من خلال بناء واسترجاع سلاسل هيكلية على مستوى الأحداث.

Rahul Jain, Keval Doshi, Burak Uzkent, Garin Kessler2026-03-23
💻 computer science

VeloxNet: Efficient Spatial Gating for Lightweight Embedded Image Classification

تقدم هذه الورقة VeloxNet، وهي بنية شبكة عصبية تلافيفية (CNN) خفيفة الوزن تستبدل وحدات "fire" الخاصة بـ SqueezeNet بوحدات بوابات مكانية لتحقيق نمذجة مكانية عالمية بعدد أقل من المعلمات، مما يؤدي إلى تحسينات كبيرة في كل من دقة التصنيف وكفاءة المعلمات عبر ثلاث مجموعات بيانات للصور الجوية المخصصة لمراقبة الكوارث المدمجة وفحص البنية التحتية.

Md Meftahul Ferdaus, Elias Ioup, Mahdi Abdelguerfi, Anton Netchaev, Steven Sloan, Ken Pathak, Kendall N. Niles2026-03-23
🤖 AI

Teaching an Agent to Sketch One Part at a Time

تقدم هذه الورقة طريقة لتوليد رسومات تخطيطية (sketches) من نص إلى متجه (text-to-vector) قابلة للتحكم والتعديل، وذلك عبر تدريب وكيل نموذج لغوي متعدد الوسائط على مجموعة بيانات جديدة موسومة على مستوى الأجزاء تسمى ControlSketch-Part باستخدام نهج التعلم التعزيزي بمكافأة العملية متعدد الدورات.

Xiaodan Du, Ruize Xu, David Yunis, Yael Vinker, Greg Shakhnarovich2026-03-23
🤖 AI

FedAgain: A Trust-Based and Robust Federated Learning Strategy for an Automated Kidney Stone Identification in Ureteroscopy

تقدم هذه الورقة FedAgain، وهو إطار عمل للتعلم الاتحادي القائم على الثقة، والذي يعزز متانة وتعميم التحديد الآلي لحصوات الكلى في تنظير الحالب من خلال موازنة مساهمات العملاء ديناميكيًا للتخفيف من التحديثات الضوضائية مع الحفاظ على خصوصية البيانات عبر المؤسسات الطبية المتنوعة.

Ivan Reyes-Amezcua, Francisco Lopez-Tiro, Clément Larose, Christian Daul, Andres Mendez-Vazquez, Gilberto Ochoa-Ruiz2026-03-23
🤖 machine learning

SurfaceXR: Fusing Smartwatch IMUs and Egocentric Hand Pose for Seamless Surface Interactions

إن SurfaceXR هو نظام لدمج المستشعرات يجمع بين تتبع اليد المعتمد على سماعة الرأس وبيانات وحدة القياس بالقصور الذاتي (IMU) من الساعة الذكية للتغلب على قيود الإيماءات في الهواء والرؤية من منظور الشخص الأول، مما يتيح تتبعاً دقيقاً وقوياً للمس والتعرف على الإيماءات على الأسطح اليومية.

Vasco Xu, Brian Chen, Eric J. Gonzalez, Andrea Colaço, Henry Hoffmann, Mar Gonzalez-Franco, Karan Ahuja2026-03-23
🤖 AI

dinov3.seg: Open-Vocabulary Semantic Segmentation with DINOv3

تقدم الورقة البحثية dinov3.seg، وهو إطار عمل جديد للتجزئة الدلالية مفتوحة المفردات يوسع هيكل DINOv3 عبر بنية متخصصة، ومحاذاة ميزات ثنائية المستوى، واستراتيجية تحسين ثنائية المرحلة لتحقيق أداء رائد ومتانة في المشاهد المعقدة.

Saikat Dutta, Biplab Banerjee, Hamid Rezatofighi2026-03-23
💻 computer science

Behavioral Engagement in VR-Based Sign Language Learning: Visual Attention as a Predictor of Performance and Temporal Dynamics

تُظهر هذه الدراسة أنه في تطبيق لتعلم لغة الإشارة قائم على الواقع الافتراضي، يُعد الانتباه البصري المستدام ووقت المشاهدة بعد التشغيل من المتنبئات الهامة لأداء التعلم، بينما يكشف التحليل الزمني عن أنماط تفاعل متميزة تتماشى مع كثافة المعلومات ومراحل التعلم.

Davide Traini, José Manuel Alcalde-Llergo, Mariana Buenestado-Fernández, Domenico Ursino, Enrique Yeguas-Bolívar2026-03-23
💻 computer science

SeeClear: Reliable Transparent Object Depth Estimation via Generative Opacification

تعالج TooClear تحدي تقدير العمق أحادي العدسة للأجسام الشفافة من خلال تقديم إطار عمل تعتيم توليدي يحول المظاهر الانكسارية إلى صور معتمة متسقة هندسياً، مما يمكّن مُقدِّرات العمق الجاهزة من إنتاج تنبؤات مستقرة ودقيقة دون الحاجة إلى إعادة التدريب.

Xiaoying Wang, Yumeng He, Jingkai Shi, Jiayin Lu, Yin Yang, Ying Jiang, Chenfanfu Jiang2026-03-23
💻 computer science

StreetForward: Perceiving Dynamic Street with Feedforward Causal Attention

يُعد StreetForward إطار عمل أمامي (feedforward) لا يتطلب وضعية محددة أو متتبعات، حيث يستفيد من آلية انتباه قناع زمني وتقنية التلعثم الغاوسي ثلاثي الأبعاد (3D Gaussian Splatting) لإعادة بناء المشاهد الشارعية الثابتة والديناميكية معاً، مما يتيح تخليق مناظر من زوايا رؤية جديدة وعالية الدقة وتقدير السرعة لكل بكسل دون الحاجة إلى تحسين لكل مشهد على حدة.

Zhongrui Yu, Zhao Wang, Yijia Xie, Yida Wang, Xueyang Zhang, Yifei Zhan, Kun Zhan2026-03-23