💻 computer science

Towards Driver Behavior Understanding: Weakly-Supervised Risk Perception in Driving Scenes

تقدم هذه الورقة RAID، وهو مجموعة بيانات واسعة النطاق لأبحاث إدراك مخاطر السائق، وتقترح إطار عمل تحت إشراف ضعيف يستفيد من مناورات السائق واستجاباته لتحديد مصادر الخطر، محققةً تحسينات كبيرة في الأداء مقارنة بالأسال_التي تمثل أحدث ما توصلت إليه التقنيات الحالية.

Nakul Agarwal, Yi-Ting Chen, Behzad Dariush2026-03-09
💻 computer science

OD-RASE: Ontology-Driven Risk Assessment and Safety Enhancement for Autonomous Driving

تقترح الورقة البحثية إطار عمل OD-RASE، وهو إطار عمل قائم على الأنطولوجيا يستفيد من النماذج اللغوية البصرية واسعة النطاق ونماذج الانتشار لتحديد هياكل الطرق المعرضة للحوادث بشكل استباقي وتوليد مقترحات موثوقة لتحسين البنية التحتية، مما يعزز سلامة أنظمة القيادة الذاتية.

Kota Shimomura, Masaki Nambata, Atsuya Ishikawa, Ryota Mimura, Takayuki Kawabuchi, Takayoshi Yamashita, Koki Inoue2026-03-09
🤖 AI

Facial Expression Recognition Using Residual Masking Network

تقترح هذه الورقة شبكة قناع متبقي (Residual Masking Network) مبتكرة تدمج شبكة متبقية عميقة مع بنية تجزئة شبيهة بـ Unet لتنقية خرائط الميزات عبر آلية انتباه، محققةً دقة هي الأفضل في فئتها على مجموعتي بيانات FER2013 وVEMO للتعرف على تعبيرات الوجه.

Luan Pham, The Huynh Vu, Tuan Anh Tran2026-03-09
💻 computer science

Adaptive Radial Projection on Fourier Magnitude Spectrum for Document Image Skew Estimation

تقترح هذه الورقة طريقة قوية لتقدير الانحراف لصور المستندات باستخدام الإسقاط الشعاعي التكيفي على طيف مقدار فوريه المتقطع ثنائي الأبعاد، وتقدم مجموعة بيانات DISE-2021 للتقييم، وتثبت أن هذا النهج يتفوق على الطرق الحالية.

Luan Pham, Phu Hao Hoang, Xuan Toan Mai, Tuan Anh Tran2026-03-09
💻 computer science

Unify the Views: View-Consistent Prototype Learning for Few-Shot Segmentation

تقدم هذه الورقة VINE، وهو إطار عمل موحد لتجزئة الصور بلقطات قليلة يستفيد من الرسوم البيانية للمنظور المكاني والبديهيات التمييزية لتحسين النماذج الأولية الخاصة بكل فئة، مما يعالج بفعالية عدم المحاذاة الهيكلية وعدم الاتساق بين المنظورات لتوليد أقنعة دقيقة حتى في ظل تغيرات وجهات النظر الصعبة.

Hongli Liu, Yu Wang, Shengjie Zhao2026-03-09
💻 computer science

Exploring Open-Vocabulary Object Recognition in Images using CLIP

تقترح هذه الورقة إطار عمل مبسطاً ومكوناً من مرحلتين للتعرف على الأشياء ذات المفردات المفتوحة دون الحاجة إلى تدريب، يجمع بين تجزئة الأشياء ومحاذاة الميزات القائمة على CLIP وCNN/MLP، مما يثبت أن نهج CLIP المنفرد بدون تحليل القيم المفردة (SVD) يحقق أداءً يضاهي أحدث المعايير في الاختبارات القياسية.

Wei Yu Chen, Ying Dai2026-03-09
🤖 AI

Technical Report: Automated Optical Inspection of Surgical Instruments

يفصل هذا التقرير الفني تعاوناً مع قادة الصناعة في تكتل سيالكوت للجراحة في باكستان لتطوير نظام فحص بصري مؤتمت باستخدام نماذج التعلم العميق (YOLOv8 وResNet-152 وEfficientNet-b4) على مجموعة بيانات جديدة مكونة من 4,414 صورة للكشف عن عيوب التصنيع في الأدوات الجراحية، مما يعزز سلامة المرضى وجودة التصنيع.

Zunaira Shafqat, Atif Aftab Ahmed Jilani, Qurrat Ul Ain2026-03-09
💻 computer science

EffectMaker: Unifying Reasoning and Generation for Customized Visual Effect Creation

إن EffectMaker هو إطار عمل موحد للاستنتاج والتوليد يستفيد من نموذج لغوي كبير متعدد الوسائط ومحول انتشار، مدعوماً بمجموعة بيانات اصطناعية واسعة النطاق تسمى EffectData، لتمكين إنشاء تأثيرات بصرية مخصصة، عالية الجودة، وقابلة للتحكم، وقابلة للتوسع دون الحاجة إلى ضبط دقيق لكل تأثير على حدة.

Shiyuan Yang, Ruihuang Li, Jiale Tao, Shuai Shao, Qinglin Lu, Jing Liao2026-03-09
💻 computer science

Ensemble Learning with Sparse Hypercolumns

تتناول هذه الورقة التحديات الحسابية لاستخدام الأعمدة الفائقة الكثيفة (dense hypercolumns) لتقسيم الصور من خلال تقديم أخذ العينات الطبقي والتعلم التجميعي، مما يثبت أن هذه الأساليب تتفوق بشكل كبير على نماذج UNet الأساسية، لا سيما في سيناريوهات التعلم من عينات قليلة حيث يحقق مصنف الانحدار اللوجستي البسيط أفضل النتائج.

Julia Dietlmeier, Vayangi Ganepola, Oluwabukola G. Adegboro, Mayug Maniparambil, Claudia Mazo, Noel E. O'Connor2026-03-09
🤖 AI

Probing Visual Concepts in Lightweight Vision-Language Models for Automated Driving

تتقصى هذه الورقة أنماط الفشل في نماذج الرؤية واللغة خفيفة الوزن للقيادة الذاتية من خلال تحليل التنشيطات البينية للكشف عن أنه بينما يتم ترميز بعض المفاهيم البصرية مثل وجود الأجسام خطياً، فإن مفاهيم أخرى مثل الاتجاه لا تُرمز كذلك، مما يؤدي إلى إخفاقات إدراكية أو معرفية تتفاقم بفعل مسافة الجسم.

Nikos Theodoridis, Reenu Mohandas, Ganesh Sistu, Anthony Scanlan, Ciarán Eising, Tim Brophy2026-03-09