💻 computer science

Hybrid TD3: Overestimation Bias Analysis and Stable Policy Optimization for Hybrid Action Space

تقترح هذه الورقة خوارزمية Hybrid TD3، وهي خوارزمية تعلم تعزيزي جديدة تتعامل أصلياً مع فضاءات الأفعال الهجينة ذات المعلمات من خلال تقديم تحليل نظري دقيق لانحياز المبالغة في التقدير وهدف تعلم Q المقطوع والموزون لتحقيق استقرار أداء وتدريب فائق في مهام المناولة الروبوتية.

Thanh-Tuan Tran, Thanh Nguyen Canh, Nak Young Chong, Xiem HoangVan2026-03-03
⚡ electrical engineering

Align and Filter: Improving Performance in Asynchronous On-Policy RL

تقدم هذه الورقة طريقة تحسين السياسة المقيدة المتوافقة مع الميزة القائمة على التباين الكلي (TV-ACPO) للتخفيف من آثار تدهور الأداء الناتجة عن تأخر السياسة في التعلم المعزز متزامن السياسة غير المتزامن، وذلك من خلال معالجة مصادرها في التدريب الموزع وترددات التحديث العالية.

Homayoun Honari, Roger Creus Castanyer, Michael Przystupa, Michael Noukhovitch, Pablo Samuel Castro, Glen Berseth2026-03-03
⚡ electrical engineering

Event-Only Drone Trajectory Forecasting with RPM-Modulated Kalman Filtering

تقترح هذه الورقة طريقة جديدة للتنبؤ بمسار الطائرات بدون طيار تعتمد على الأحداث فقط، حيث تستخرج سرعة دوران المروحة مباشرة من بيانات الأحداث الخام وتدمجها في مرشح كالمان مدرك لسرعة الدوران في الدقيقة (RPM)، مما يحقق دقة تنبؤ فائقة للمدى القصير والمتوسط مقارنة بالنهج القائمة على التعلم دون الاعتماد على صور RGB أو بيانات تدريبية.

Hari Prasanth S. M., Pejman Habibiroudkenar, Eerik Alamikkotervo, Dimitrios Bouzoulas, Risto Ojala2026-03-03
⚡ electrical engineering

Development of a Deep Learning-Driven Control Framework for Exoskeleton Robots

تقترح هذه الدراسة إطار تحكم هجين يعتمد على التعلم العميق وفعال حاسوبياً لروبوت هيكل خارجي بسبع درجات حرية، يستخدم شبكة عصبية مدربة للتنبؤ بعزم الدوران ومتحكم تناسبي تفاضلي (PD) لتعويض الخطأ، مما يحقق تتبعاً دقيقاً للمسار مع تقليل العبء الحسابي مقارنة بطرق التحكم غير الخطي التقليدية.

Sk Hasan2026-03-02
💻 computer science

Distributed Lloyd-Based algorithm for uncertainty-aware multi-robot under-canopy flocking

تقدم هذه الورقة خوارزمية موزعة ومدركة لعدم اليقين تتيح التوافق الجماعي لعدة روبوتات عند ارتفاع ثابت في بيئات معقدة تحت مظلة الأشجار باستخدام الاستشعار على متن الروبوت فقط، مع ضمان تجنب الاصطدام والحفاظ على التقارب دون معرفة مسبقة بالبيئة أو اتصالات صريحة.

Manuel Boldrer, Vit Kratky, Viktor Walter, Martin Saska2026-03-02
🤖 machine learning

Apple: Toward General Active Perception via Reinforcement Learning

تقدم هذه الورقة APPLE، وهو إطار عمل جديد للتعلم التعزيزي يقوم بتدريب وحدة إدراك قائمة على المحولات (transformer-based) وسياسة اتخاذ قرار بشكل مشترك لإنشاء حل متعدد الاستخدامات وعام الأغراض للإدراك النشط عبر مهام روبوتية متنوعة، بما في ذلك الاستكشاف اللمسي.

Tim Schneider, Cristiana de Farias, Roberto Calandra, Liming Chen, Jan Peters2026-03-02
💻 computer science

Robot Excavation and Manipulation of Geometrically Cohesive Granular Media

تقدم هذه الورقة نموذجاً روبو-فيزيائياً وإطار عمل تجريبياً يوضح كيف يمكن للأسراب الروبوتية بناء هياكل عشوائية ذاتياً من وسائط حبيبية متماسكة هندسياً، كاشفةً أن دك الركيزة الأولي يؤثر بشكل كبير على أداء الحفر وقوة المادة من خلال التشابك.

Laura Treers, Daniel Soto, Joonha Hwang, Michael A. D. Goodisman, Daniel I. Goldman2026-03-02
💻 computer science

Attentive Feature Aggregation or: How Policies Learn to Stop Worrying about Robustness and Attend to Task-Relevant Visual Cues

تقدم هذه الورقة آلية تجميع الميزات الانتباهية (AFA)، وهي آلية تجميع خفيفة الوزن تعزز متانة السياسات البصرية الحركية المدربة باستخدام تمثيلات بصرية مسبقة التدريب من خلال التعلم كيفية الانتباه انتقائياً للإشارات ذات الصله بالمهمة مع تجاهل المشتتات البصرية، مما يؤدي إلى تفوقها على النهج القياسية في البيئات المضطربة دون الحاجة إلى تعزيز بيانات مكلف أو ضبط دقيق للنموذج.

Nikolaos Tsagkas, Andreas Sochopoulos, Duolikun Danier, Sethu Vijayakumar, Alexandros Kouris, Oisin Mac Aodha, Chris Xia (…)2026-03-02
🤖 AI

SocialNav: Training Human-Inspired Foundation Model for Socially-Aware Embodied Navigation

يقدم SocialNav نموذجاً تأسيسياً هرمياً للملاحة المتجسدة الواعية اجتماعياً، تم تدريبه على مجموعة بيانات ضخمة تضم 7 ملايين عينة وعلى إطار عمل مبتكر لاستكشاف التدفق الواعي اجتماعياً (Socially-Aware Flow Exploration) باستخدام تعزيز سياسة المجموعات من الدرجة الأولى (GRPO) لتحقيق أداء رائد في كل من نجاح الملاحة والامتثال الاجتماعي.

Ziyi Chen, Yingnan Guo, Zedong Chu, Minghua Luo, Yanfen Shen, Mingchao Sun, Junjun Hu, Shichao Xie, Kuan Yang, Pei Shi (…)2026-03-02
🤖 AI

Automating the Refinement of Reinforcement Learning Specifications

تقدم هذه الورقة AutoSpec، وهو إطار عمل يعمل تلقائياً على تحسين المواصفات المنطقية خشنة الحبيبات لتعلم التعزيز من خلال استكشاف وتعديل رسوم SpectRL البيانية لتوفير توجيه إضافي مع الحفاظ على السلامة، مما يمكن الوكلاء من حل مهام تحكم أكثر تعقيداً.

Tanmay Ambadkar, Đorđe Žikelić, Abhinav Verma2026-03-02