💻 computer science

Addressing the Waypoint-Action Gap in End-to-End Autonomous Driving via Vehicle Motion Models

تقترح هذه الورقة إطار عمل تفاضلي لحركة المركبات يسد الفجوة بين القيادة الذاتية من طرف إلى طرف القائمة على نقاط المسار وتلك القائمة على الأفعال، وذلك من خلال تمكين السياسات القائمة على الأفعال من التدريب والتقييم ضمن معايير القياس القياسية القائمة على نقاط المسار، محققةً أداءً هو الأفضل في فئته على منصة NAVSIM.

Jorge Daniel Rodríguez-Vidal, Gabriel Villalonga, Diego Porres, Antonio M. López Peña2026-02-10
💻 computer science

Learning to Anchor Visual Odometry: KAN-Based Pose Regression for Planetary Landing

يُعد KANLoc إطار عمل لتحديد الموقع أحادي الرؤية للهبوط على الكواكب، يعمل على تخفيف حدة انزياح قياس المسافات البصرية من خلال دمجها مع مُقدِّر وضعية مطلق يعتمد على شبكة كولموغوروف-أرنولد (KAN) ذات الكفاءة في المعلمات، وذلك لتوفير مسارات سداسية درجات الحرية (6-DoF) متسقة عالمياً وفي الوقت الفعلي.

Xubo Luo, Zhaojin Li, Xue Wan, Wei Zhang, Leizheng Shu2026-02-10
⚡ electrical engineering

LangGS-SLAM: Real-Time Language-Feature Gaussian Splatting SLAM

يُعد LangGS-SLAM نظاماً لتقدير الموقع ورسم الخرائط المتزامن (SLAM) للصور من نوع RGB-D في الوقت الفعلي، والذي يحقق إعادة بناء هندسي عالي الدقة ورسم خرائط للميزات كثيفة متوافقة لغوياً عبر استخدام خط معالجة رندرة (rendering) عالي الإنتاجية من نوع Top-K، واستراتيجية إدارة خرائط متعددة المعايير، وإطار تحسين هجين مفكك.

Seongbo Ha, Sibaek Lee, Kyungsu Kang, Joonyeol Choi, Seungjun Tak, Hyeonwoo Yu2026-02-10
🤖 AI

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

تقترح هذه الورقة إطار عمل **CR-VLM**، وهو إطار عمل مبتكر يستخدم توجيه التنشيط لتمكين الرفض القابل للضبط في نماذج الرؤية واللغة، مما يسمح بمحاذاة سلامة تكيفية تخفف من كل من نقص الرفض والإفراط في الرفض من خلال متجه رفض، وآلية بوابية، ووحدة تعزيز رؤية مضادة للواقع.

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee2026-02-10
🤖 AI

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

تقدم هذه الورقة البحثية "Vectra"، وهو أول إطار عمل يعتمد على النماذج اللغوية الكبيرة متعددة الوسائط (MLLM) وغير معتمد على المراجع لتقييم الجودة البصرية للترجمة الآلية داخل الصور في التجارة الإلكترونية، والذي يتميز بمقياس تسجيل متعدد الأبعاد، ومجموعة بيانات ضخمة ومتنوعة، ونموذج بـ 4 مليارات معلمة يتفوق على النماذج اللغوية الكبيرة متعددة الوسائط العامة الرائدة في قدرات الاستنتاج التشخيصي ودقة التسجيل.

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo2026-02-10
💻 computer science

Gaussian-Constrained LeJEPA Representations for Unsupervised Scene Discovery and Pose Consistency

تبحث هذه الورقة في كيفية تطبيق قيود غاوسية متناحية (isotropic Gaussian constraints) على تضمينات الصور المستوحاة من نموذج LeJEPA لتحسين دقة اكتشاف المشاهد غير الخاضعة للإشراف وتقدير وضعية الكاميرا في مجموعات الصور غير المهيكلة، كما هو موضح في تحدي IMC2025.

Mohsen Mostafa2026-02-10
🤖 AI

XAI-CLIP: ROI-Guided Perturbation Framework for Explainable Medical Image Segmentation in Multimodal Vision-Language Models

إن XAI-CLIP هو إطار عمل للاضطراب الموجه بمنطقة الاهتمام (ROI) يستفيد من تضمينات نماذج الرؤية واللغة متعددة الوسائط لتوليد تفسيرات أكثر دقة واتساقاً من الناحية التشريحية وكفاءة من الناحية الحسابية لنماذج تقسيم الصور الطبية.

Thuraya Alzubaidi, Sana Ammar, Maryam Alsharqi, Islem Rekik, Muzammil Behzad2026-02-10
💻 computer science

A Distributed Multi-Modal Sensing Approach for Human Activity Recognition in Real-Time Human-Robot Collaboration

تقترح هذه الورقة نظاماً للتعرف على الأنشطة البشرية متعدد الوسائط يجمع بين قفاز بيانات معياري ومستشعر لمسي قائم على الرؤية لتمكين التكيف عالي الدقة في الوقت الفعلي في سيناريوهات التعاون بين الإنسان والروبوت.

Valerio Belcamino, Nhat Minh Dinh Le, Quan Khanh Luu, Alessandro Carfì, Van Anh Ho, Fulvio Mastrogiovanni2026-02-10
🤖 AI

A Comparative Study of Adversarial Robustness in CNN and CNN-ANFIS Architectures

تقارن هذه الدراسة بين المتانة التنافسية للشبكات العصبية الالتفافية (CNN) القياسية ونظيراتها المعززة بالأنظمة العصبية الضبابية (ANFIS) عبر مجموعات بيانات وأنواع هجمات مختلفة، وتجد أنه في حين يمكن لدمج نظام (ANFIS) أن يحسن المتانة في بنيات محددة مثل (ResNet18)، إلا أن فوائده غير متسقة وتعتمد على البنية المستخدمة.

Kaaustaaub Shankar, Bharadwaj Dogga, Kelly Cohen2026-02-10
🤖 machine learning

OMNI-Dent: Towards an Accessible and Explainable AI Framework for Automated Dental Diagnosis

يُعد OMNI-Dent إطاراً تشخيصياً فعالاً من حيث كفاءة البيانات وقابلاً للتفسير، حيث يستفيد من نموذج الرؤية واللغة (VLM) لتقديم تقييمات على مستوى الأسنان من خلال صور الهواتف الذكية عبر دمج الاستنتاج السريري الخبير دون الحاجة إلى ضبط دقيق خاص بطب الأسنان.

Leeje Jang, Yao-Yi Chiang, Angela M. Hastings, Patimaporn Pungchanchaikul, Martha B. Lucas, Emily C. Schultz, Jeffrey P. (…)2026-02-10