💻 computer science

An End-to-End Decision-Aware Multi-Scale Attention-Based Model for Explainable Autonomous Driving

تقترح هذه الورقة نموذجاً يعتمد على الانتباه متعدد المقاييس ومتكامل الطرفين، يدمج قرارات القيادة في مكون استنتاجي لتوليد تفسيرات خاصة بكل حالة للقيادة الذاتية، تم التحقق من صحته من خلال مقياس درجة F1 المشتركة الجديد وتجارب على مجموعتي بيانات BDD-OIA وnu-AR لإثبات الأداء المتفوق على النماذج الحالية الرائدة.

Maryam Sadat Hosseini Azad, Shahriar Baradaran Shokouhi, Amir Abbas Hamidi Imani, Shahin Atakishiyev, Randy Goebel2026-05-04
💻 computer science

MiniVLA-Nav v1: A Multi-Scene Simulation Dataset for Language-Conditioned Robot Navigation

تقدم الورقة البحثية MiniVLA-Nav v1، وهو عبارة عن مجموعة بيانات محاكاة متاحة للجمهور تضم 1,174 حلقة عبر أربع بيئات Isaac Sim واقعية، والتي تجمع بين التعليمات اللغوية الطبيعية والبيانات المرئية وبيانات الإجراءات الخبيرة المتزامنة لتقييم الملاحة نحو الأجسام المشروطة باللغة لروبوت NVIDIA Nova Carter.

Ali Al-Bustami, Jaerock Kwon2026-05-04
🤖 AI

Physically Native World Models: A Hamiltonian Perspective on Generative World Modeling

تقترح هذه الورقة نماذج العالم الهاميلتونية (Hamiltonian World Models)، وهو إطار عمل مبتكر يقوم بترميز الملاحظات في فضاءات طور كامنة مهيكلة ويطورها باستخدام ديناميكيات مستوحاة من ميكانيكا هاميلتون لتوليد تنبؤات ذات معنى فيزيائي، وقابلة للتحكم عبر الأفعال، ومستقرة على المدى الطويل لاتخاذ القرارات المتجسدة.

Sen Cui, Jingheng Ma2026-05-04
🤖 AI

Thinking in Text and Images: Interleaved Vision--Language Reasoning Traces for Long-Horizon Robot Manipulation

تقدم هذه الورقة البحثية إطار عمل "الاستنتاج البصري اللغوي المتداخل" (IVLR)، وهو إطار سياسات يولد مسارات صريحة تتناوب بين الأهداف الفرعية النصية والإطارات الرئيسية البصرية لتمكين التلاعب الروبوتي طويل المدى والقوي من خلال الجمع بين التماسك المنطقي والتجذر الهندسي، محققاً معدلات نجاح هي الأفضل في فئتها على معايير الاختبار الصعبة.

Jinkun Liu, Haohan Chi, Lingfeng Zhang, Yifan Xie, YuAn Wang, Long Chen, Hangjun Ye, Xiaoshuai Hao, Wenbo Ding2026-05-04
💻 computer science

High-Speed Vision Improves Zero-Shot Semantic Understanding of Human Actions

تُثبت هذه الورقة أن استخدام الفيديو عالي السرعة يعزز بشكل كبير الفهم الدلالي لصفر-الخطوة (zero-shot) للأفعال البشرية السريعة، مثل الكيندو، من خلال تحسين قابلية الفصل والاستقرار في تمثيلات الأفعال في مسارات العمل الخالية من التدريب التي تدمج نماذج الفيديو واللغة مع استدلال النماذج اللغوية الكبيرة.

Yongpeng Cao, Yuji Yamakawa2026-05-04
🤖 AI

Linking Behaviour and Perception to Evaluate Meaningful Human Control over Partially Automated Driving

تقيم هذه الدراسة التحكم البشري ذي المعنى في القيادة شبه الآلية من خلال تجربة محاكاة تقارن بين أوضاع التحكم التشاركي اللمسي والتحكم المتبادل، كاشفةً أن الإدراك بالتحكم يتأثر سلباً بالصراعات بين الأتمتة والسائق وعدم التطابق في النوايا، بينما يتعزز من خلال التوجيه اللمسي الدقيق والمتوافق.

Ashwin George, Lucas Elbert Suryana, Lorenzo Flipse, Bart van Arem, David A. Abbink, Simeon Craig Calvert, Luciano Caval (…)2026-05-04
💻 computer science

Recovering Hidden Reward in Diffusion-Based Policies

تقدم الورقة البحثية EnergyFlow، وهو إطار عمل يوحد بين النمذجة التوليدية للأفعال والتعلم التعزيزي العكسي من خلال تمثيل دالة طاقة قياسية لاستعادة مكافآت الخبراء وتحسين تعميم السياسة دون تدريب تنافسي.

Yanbiao Ji, Qiuchang Li, Yuting Hu, Shaokai Wu, Wenyuan Xie, Guodong Zhang, Qicheng He, Deyi Ji, Yue Ding, Hongtao Lu2026-05-04
🤖 AI

Joint Action is a Framework for Understanding Partnerships Between Humans and Upper Limb Prostheses

تقترح هذه الورقة إعادة صياغة واجهة الأطراف الاصطناعية للطرف العلوي البشري باعتبارها نظام عمل مشترك تعاوني بدلاً من مجرد علاقة تحكم بأداة، مما يوضح كيف يمكن لهذا المنظور أن يقيم المتحكمات الحالية بشكل أفضل ويوجه التحسينات المستقبلية في التواصل التعاوني.

Michael R. Dawson, Adam S. R. Parker, Heather E. Williams, Ahmed W. Shehata, Jacqueline S. Hebert, Craig S. Chapman, Pat (…)2026-05-01
💻 computer science

From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback

تقدم هذه الورقة CLIC، وهو إطار عمل للتعلم بالتقليد يعتمد على وجود الإنسان في الحلقة، يستبدل الإشراف على الأفعال النقطية الهش بأهداف ذات قيم مجموعات مستمدة من التغذية الراجعة التصحيحية، مما يتيح تعلم سياسات قوية تستوعب التوجيه البشري الضوضائي والنسبي ومتعدد الأنماط.

Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober2026-05-01
💻 computer science

BOW: Bayesian Optimization over Windows for Motion Planning in Complex Environments

يُعد مخطط BOW خوارزمية مفتوحة المصدر وقابلة للتوسع لتخطيط الحركة، تستفيد من التحسين البايزي المقيد ضمن نافذة سرعة قابلة للوصول لتوليد مسارات آمنة وشبه مثالية للروبوتات في البيئات المعقدة بكفاءة، مع تحسين وقت الحوسبة وكفاءة العينات بشكل كبير مقارنة بالطرق الحالية.

Sourav Raxit, Abdullah Al Redwan Newaz, Paulo Padrao, Jose Fuentes, Leonardo Bobadilla2026-05-01