🤖 AI

Dynamic LIBRAS Gesture Recognition via CNN over Spatiotemporal Matrix Representation

تقدم هذه الورقة نظاماً للتعرف على إيماءات لغة الإشارة البرازيلية (LIBRAS) في الوقت الفعلي لأتمتة المنازل، يجمع بين استخراج معالم اليد باستخدام MediaPipe ومصنف شبكة عصبية تلافيفية (CNN) يعمل على مصفوفة زمانية-مكانية، محققاً دقة تصل إلى 95% عبر 11 فئة من الإيماءات دون الاعتماد على الشبكات العصبية المتكررة.

Jasmine Moreira2026-03-30
🤖 AI

GUIDE: A Benchmark for Understanding and Assisting Users in Open-Ended GUI Tasks

تقدم هذه الورقة البحثية GUIDE، وهو معيار مرجعي شامل يتكون من 67.5 ساعة من تسجيلات الشاشة لـ 120 مستخدماً مبتدئاً عبر 10 تطبيقات برمجية، صُمم لتقييم وتحسين قدرة نماذج الذكاء الاصطناعي على اكتشاف سلوك المستخدم، واستنتاج القصد، وتقديم المساعدة في الوقت المناسب في مهام واجهة المستخدم الرسومية (GUI) مفتوحة النهايات، وذلك عبر نقل التركيز من مجرد الأتمتة إلى الفهم التعاوني.

Saelyne Yang, Jaesang Yu, Yi-Hao Peng, Kevin Qinghong Lin, Jae Won Cho, Yale Song, Juho Kim2026-03-30
💻 computer science

Seeing Through Smoke: Surgical Desmoking for Improved Visual Perception

تقدم هذه الورقة نموذجاً يعتمد على تقنية "ترانسفورمر" (Transformer) لإزالة الدخان الجراحي، تم تدريبه على مجموعة بيانات اصطناعية ضخمة ومعيار مرجعي واقعي جرى تنسيقه حديثاً لإزالة الدخان الجراحي من صور التنظير الداخلي بفعالية، مما يعزز الإدراك البصري والمهام اللاحقة مثل تقدير العمق وتجزئة الأدوات.

Jingpei Lu, Fengyi Jiang, Xiaorui Zhang, Lingbo Jin, Omid Mohareri2026-03-30
💻 computer science

Automated Quality Assessment of Blind Sweep Obstetric Ultrasound for Improved Diagnosis

تُثبت هذه الورقة أن التقييم الآلي لجودة فيديوهات مسح التصوير بالموجات فوق الصوتية لولادة الأجنة بطريقة المسح الأعمى (BSOU) أمر بالغ الأهمية لضمان موثوقية التشخيص قبل الولادة المدفوع بالذكاء الاصطناني في المناطق ذات الموارد المحدودة، حيث يكتشف بفعالية انحرافات عملية الاستحواذ ويحسن أداء المهام اللاحقة من خلال حلقات التغذية الراجعة في الوقت الفعلي.

Prasiddha Bhandari, Kanchan Poudel, Nishant Luitel, Bishram Acharya, Angelina Ghimire, Tyler Wellman, Kilian Koepsell, P (…)2026-03-30
💻 computer science

World Reasoning Arena

تقدم هذه الورقة WR-Arena، وهو معيار شامل مصمم لتقييم نماذج العالم بما يتجاوز مجرد التنبؤ البصري البسيط من خلال تقييم قدراتها في دقة محاكاة الأفعال، والتنبؤ طويل المدى، والاستدلال المحاكاتي عبر تصنيف جديد للمهام وتجارب واسعة النطاق تكشف عن فجوات كبيرة بين النماذج الحالية والقدرة البشرية على الاستدلال.

PAN Team, Qiyue Gao, Kun Zhou, Jiannan Xiang, Zihan Liu, Dequan Yang, Junrong Chen, Arif Ahmad, Cong Zeng, Ganesh Bannur (…)2026-03-30
💻 computer science

Few Shots Text to Image Retrieval: New Benchmarking Dataset and Optimization Methods

تقدم هذه الورقة مهمة استرجاع النص إلى الصورة بلقطات قليلة (FSIR) ومجموعة بيانات الاختبار الخاصة بها، FSIR-BD، لمعالجة أوجه القصور في نماذج الرؤية واللغة المدربة مسبقاً في التعامل مع الاستعلامات التركيبية والاستعلامات خارج التوزيع، مع اقتراح طريقتين جديدتين للتحسين تستفيدان من أمثلة مرجعية قليلة اللقطات لتحسين أداء الاسترجاع بشكل كبير.

Ofer Idan, Vladi Vexler, Gil Lederman, Dima Sivov, Aviad Cohen Zada, Shir Niego Komforti2026-03-30
💻 computer science

Shared Representation for 3D Pose Estimation, Action Classification, and Progress Prediction from Tactile Signals

تقدم هذه الورقة SCOTTI، وهو إطار عمل محول تلافيفي مشترك مبتكر يستفيد من التعلم متعدد المهام على مجموعة بيانات لمسية جديدة لتحسين تقدير وضعية الجسم ثلاثية الأبعاد، وتصنيف الحركة، والتنبؤ بتقدم الحركة من إشارات نعل القدم في آن واحد، متفوقاً بذلك على النهج الحالية أحادية المهمة مع معالجة قيود الرؤية الحاسوبية مثل الاحتجاب والخصوصية.

Isaac Han, Seoyoung Lee, Sangyeon Park, Ecehan Akan, Yiyue Luo, Joseph DelPreto, Kyung-Joong Kim2026-03-30
🤖 AI

DiReCT: Disentangled Regularization of Contrastive Trajectories for Physics-Refined Video Generation

تقدم الورقة البحثية DiReCT، وهو إطار عمل لما بعد التدريب يحل مشكلة التشابك بين الدلالات والفيزياء في توليد الفيديو المشروط بالنصوص من خلال تفكيك التعلم التبايني إلى مقاييس كبرى وصغرى لتحسين المنطق الفيزيائي العام دون المساس بالدقة البصرية أو زيادة وقت التدريب.

Abolfazl Meyarian, Amin Karimi Monsefi, Rajiv Ramnath, Ser-Nam Lim2026-03-30
🤖 AI

Collision-Aware Vision-Language Learning for End-to-End Driving with Multimodal Infraction Datasets

تعالج هذه الورقة البحثية مشكلة الاختناق المتمثلة في المخالفات المتعلقة بالاصطدام في القيادة الذاتية من الطرف إلى الطرف عبر تقديم كاشف الشذوذ المعزز بالفيديو واللغة (VLAAD) ومجموعتي بيانات متعدد الوسائط جديدتين، CARLA-Collide وReal-Collide، اللتين تتيحان معاً وحدة برمجية خفيفة الوزن وقابلة للإضافة تعمل على تحسين درجات القيادة بشكل كبير في المحاكاة وتتفوق على النماذج الأكبر في التنبؤ بالاصطدامات في العالم الحقيقي.

Alex Koran, Dimitrios Sinodinos, Hadi Hojjati, Takuya Nanri, Fangge Chen, Narges Armanfard2026-03-30
💻 computer science

BEVMAPMATCH: Multimodal BEV Neural Map Matching for Robust Re-Localization of Autonomous Vehicles

يُعد BEVMapMatch إطار عمل متعدد الوسائط يحقق إعادة تحديد موقع قوية للمركبات ذاتية القيادة بدون نظام تحديد المواقع العالمي (GNSS) في البيئات الصعبة من خلال دمج بيانات الليدار والكاميرا لإنشاء تقسيمات لمنظور عين الطائر (Bird's Eye View) لمطابقة الخرائط، متفوقاً بشكل كبير على النماذج المرجعية الحالية بنسبة استدعاء تبلغ 39.8% عند مسافة 1 متر (Recall@1m).

Shounak Sural, Ragunathan Rajkumar2026-03-30