⚡ electrical engineering

Classification of Driver Behaviour Using External Observation Techniques for Autonomous Vehicles

تقدم هذه الدراسة إطار عمل مبتكر للرؤية الحاسوبية يستخدم تقنيات المراقبة الخارجية، بما في ذلك كشف الأشياء القائم على نموذج YOLO ومراقبة المسارات، لتصنيف سلوكيات السائقين المشتتين والمختلين في المركبات غير المتصلة دون الاعتماد على الاتصال بين المركبات.

Ian Nell, Shane Gilroy2026-03-10
💻 computer science

UltraUPConvNet: A UPerNet- and ConvNeXt-Based Multi-Task Network for Ultrasound Tissue Segmentation and Disease Prediction

تُعد UltraUPConvNet إطار عمل متعدد المهام وفعال حاسوبياً، يعتمد على UPerNet وConvNeXt، ويقوم في آن واحد بمهام تقسيم أنسجة الموجات فوق الصوتية والتنبؤ بالأمراض، محققاً أداءً هو الأفضل في فئته على مجموعة بيانات واسعة النطاق مع تقليل العبء الحسابي.

Zhi Chen, Le Zhang2026-03-10
💻 computer science

Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning

يُعد Traffic-MLLM إطار عمل عصبيًا لا يعتمد على الاسترجاع، يعمل على تعزيز اتخاذ القرار في القيادة الذاتية من خلال دمج بيانات مرورية متعددة المصادر مع آلية صقل مدفوعة بالفضول لتعلم فضاء حالات مهيكل وقابل للتعميم من أجل استدلال قوي في سيناريوهات الحالات النادرة.

Waikit Xiu, Qiang Lu, Bingchen Liu, Chen Sun, Xiying Li2026-03-10
💻 computer science

WHU-STree: A Multi-modal Benchmark Dataset for Street Tree Inventory

تقدم هذه الورقة WHU-STree، وهي مجموعة بيانات مرجعية شاملة ومتعددة الوسائط تتميز بسحب نقطية متزامنة وصور عالية الدقة لأكثر من 21,000 شجرة شارع عبر مدينتين، صُممت للتغلب على القيود في مجموعات البيانات الحالية من خلال تمكين مهام جرد متنوعة وتعزيز البحث في دمج الوسائط المتعددة والتعميم عبر المجالات لإدارة أشجار المناطق الحضرية.

Ruifei Ding, Zhe Chen, Wen Fan, Chen Long, Huijuan Xiao, Yelu Zeng, Zhen Dong, Bisheng Yang2026-03-10
🤖 machine learning

ORIC: Benchmarking Object Recognition under Contextual Incongruity in Large Vision-Language Models

تقدم هذه الورقة إطار عمل ومعيار ORIC لتقييم وتحسين قدرات نماذج الرؤية واللغة الكبيرة في التعرف على الأشياء في ظل عدم الاتساق السياقي، مما يثبت أن مثل هذه السيناريوهات تضعف الأداء بشكل كبير وأن الضبط الدقيق للتعزيز البصري المستهدف يمكن أن يخفف من هذه الإخفاقات بفعالية.

Zhaoyang Li, Zhan Ling, Yuchen Zhou, Litian Gong, Erdem Bıyık, Hao Su2026-03-10
💻 computer science

Efficient Construction of Implicit Surface Models From a Single Image for Motion Generation

تقدم هذه الورقة البحثية إطار عمل "Fast Image-to-Neural Surface" (FINS)، وهو إطار عمل خفيف الوزن يعيد بناء الأسطح الضمنية عالية الدقة وحقول وظائف المسافة الموقعة (SDF) بكفاءة من صورة واحدة خلال ثوانٍ معدودة عبر الاستفادة من شبكات الهاش متعددة الدقة والنماذج التأسيسية المدربة مسبقاً، متفوقاً بذلك على الطرق الحالية في السرعة والدقة لتطبيقات الروبوتات.

Wei-Teng Chu, Tianyi Zhang, Matthew Johnson-Roberson, Weiming Zhi2026-03-10
💻 computer science

Quantized Visual Geometry Grounded Transformer

تقدم هذه الورقة QuantVGGT، وهو أول إطار عمل للكمية (quantization) لـ محولات الهندسة البصرية المرتكزة (VGGTs) ذات المليارات من المعلمات، والذي يتغلب على تحديات المعايرة والتوزيع الفريدة من خلال التكميم دقيق التفاصيل مزدوج التنعيم والنمذجة المتنوعة منقاة الضجيج لتحقيق مكاسب كبيرة في الذاكرة والسرعة مع الحفاظ على دقة إعادة بناء عالية.

Weilun Feng, Haotong Qin, Mingqiang Wu, Chuanguang Yang, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michel (…)2026-03-10
💻 computer science

QuantSparse: Comprehensively Compressing Video Diffusion Transformer with Model Quantization and Attention Sparsification

يُعد QuantSparse إطار عمل موحداً يجمع بفعالية بين تكميم النماذج وتخفيف كثافة الانتباه لنماذج محولات الانتشار للفيديو من خلال تقديم تقنيتي "تقطير الانتباه البارز متعدد المقاييس" و"إعادة تمثيل الانتباه المتناثر من الدرجة الثانية" للتخفيف من فقدان المعلومات، مما يحقق تقليلاً كبيراً في التخزين وتسريعاً في الاستدلال مع التفوق بشكل جوهري على النماذج المرجعية الحالية في جودة التوليد.

Weilun Feng, Chuanguang Yang, Haotong Qin, Mingqiang Wu, Yuqi Li, Xiangqi Li, Zhulin An, Libo Huang, Yulun Zhang, Michel (…)2026-03-10
💻 computer science

FVO: Fast Visual Odometry with Transformers

تقدم الورقة البحثية طريقة "تقدير المسار البصري السريع" (FVO)، وهي طريقة تعتمد على المحولات (Transformer) تستبدل خطوط معالجة التحسين الهجين البطيئة بتراجع مباشر للوضعية النسبية وتجميع مدرك للثقة لتحقيق سرعة فائقة ودقة تنافسية في تقدير المسار البصري أحادي الكاميرا.

Vlardimir Yugay, Duy-Kien Nguyen, Theo Gevers, Cees G. M. Snoek, Martin R. Oswald2026-03-10
💻 computer science

Bee: A High-Quality Corpus and Full-Stack Suite to Unlock Advanced Fully Open MLLMs

تقدم هذه الورقة البحثية Honey-Data-15M، وهي مجموعة بيانات عالية الجودة مكونة من 15 مليون زوج مع إثراء بمستوى مزدوج من تسلسل الأفكار (Chain-of-Thought)، إلى جانب خط معالجة البيانات HoneyPipe ونموذج Bee-8B، مما يثبت مجتمعاً أن التحسينات المنهجية في جودة البيانات يمكن أن تمكّن النماذج اللغوية الكبيرة متعددة الوسائط مفتوحة المصدر بالكامل من تحقيق أداء رائد ينافس النظراء شبه المفتوحين.

Yi Zhang, Bolin Ni, Xin-Sheng Chen, Heng-Rui Zhang, Yongming Rao, Houwen Peng, Qinglin Lu, Han Hu, Meng-Hao Guo, Shi-Min (…)2026-03-10