⚡ electrical engineering

Cost-Matching Model Predictive Control for Efficient Reinforcement Learning in Humanoid Locomotion

تقترح هذه الورقة إطار عمل للتحكم التنبئي بالنماذج القائم على مطابقة التكلفة، والذي يقوم بتدريب نموذج ديناميكيات مركزي مُعامل لتقريب دوال قيمة الفعل من بيانات عالية الدقة، مما يتيح التعلم الفعال القائم على التدرج من أجل حركة بشرية قوية وعالية الأداء دون العبء الحسابي المتمثل في حل مسائل التحكم التنبئي بالنماذج بشكل متكرر أثناء التدريب.

Wenqi Cai, Kyriakos G. Vamvoudakis, Sébastien Gros, Anthony Tzes2026-03-31
🤖 machine learning

Critic-Free Deep Reinforcement Learning for Maritime Coverage Path Planning on Irregular Hexagonal Grids

تقترح هذه الورقة إطار عمل للتعلم التعزيزي العميق خالٍ من الناقد باستخدام تحسين السياسة النسبية للمجموعة وسياسة مؤشر تعتمد على المحولات لحل مسأًلة تخطيط مسار التغطية البحرية على شبكات سداسية غير منتظمة، محققة كفاءة مسار فائقة ومعدلات نجاح تقارب الكمال مقارنة بالخوارزميات الاستدلالية التقليدية مع تمكين النشر الفوري على متن السفن.

Carlos S. Sepúlveda, Gonzalo A. Ruz2026-03-31
⚡ electrical engineering

Dynamic Lookahead Distance via Reinforcement Learning-Based Pure Pursuit for Autonomous Racing

تقترح هذه الورقة متحكم "المطاردة النقية" (Pure Pursuit) يعتمد على التعلم التعزيزي، يقوم بتعديل مسافة التطلع ديناميكيًا باستخدام وكيل "سياسة التدرج البروي" (PPO) تم تدريبه في المحاكاة، مما أظهر أزمنة لفات متفوقة ونقلًا قويًا من المحاكاة إلى الواقع على منصات السباق ذاتية القيادة مقارنة بالنماذج المرجعية الثابتة والتكيفية.

Mohamed Elgouhary, Amr S. El-Wakeel2026-03-31
💬 NLP

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

يقدم SOLE-R1 نموذج استدلال لغوي-بصري يعمل كإشارة مكافأة وحيدة للتعلم التعزيزي على الروبوتات من خلال توليد تقديرات تقدم كثيفة لكل خطوة زمنية عبر استدلال تسلسلي مكاني-زماني، مما يمكن الروبوتات من إتقان مهام التلاعب غير المرئية دون الحاجة إلى مكافآت حقيقية أو عروض توضيحية، مع التفوق على المقيمات اللغوية-البصرية الحالية في المتانة ومعدلات النجاح.

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza2026-03-31
🤖 machine learning

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

تقدم هذه الورقة "رموز المهام" (Task Tokens)، وهي طريقة تعتمد على التعلم التعزيزي تعمل على تكييف نماذج السلوك التأسيسية المجمدة مع مهام محددة عبر تعلم مشفرات خاصة بالمهمة لتعيين الملاحظات إلى رموز، مما يؤدي إلى تحسين الأداء مع الحفاظ على قدرات النماذج على التعميم والمرونة.

Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler2026-03-30
⚡ electrical engineering

Control of a commercially available vehicle by a tetraplegic human using a brain-computer interface

تُظهر هذه الدراسة طفرة في التطبيق الواقعي من خلال تمكين شخص مصاب بشلل رباعي من قيادة سيارة فورد موستانج ماتش-إي عن بُعد والتنقل في بيئات حضرية معقدة بسرعة ودقة تضاهي المشاركين الذين يتمتعون بسلامة حركية، وذلك باستخدام واجهة دماغية حاسوبية مزروعة.

Xinyun Zou, Jorge Gamez, Meghna Menon, Phillip Ring, Chadwick Boulay, Likhith Chitneni, Jackson Brennecke, Shana R. Melb (…)2026-03-30
💻 computer science

VG-Mapping: Variation-aware Density Control for Online 3D Gaussian Mapping in Semi-static Scenes

يُعد VG-Mapping نظامًا عبر الإنترنت لتقنية Gaussian Splatting ثلاثية الأبعاد للمشاهد شبه الثابتة، حيث يقدم استراتيجية للتحكم في الكثافة واعية بالتباين لفصل تنظيم الكثافة عن عملية التحسين، مما يؤدي إلى تحسين كفاءة تحديث الخرائط وجودة التصوير مع معالجة نقص المعايير المرجعية العامة من خلال مجموعة بيانات RGB-D جديدة اصطناعية وواقعية.

Yicheng He, Jingwen Yu, Guangcheng Chen, Hong Zhang2026-03-30
💻 computer science

An Efficient Closed-Form Solution to Full Visual-Inertial State Initialization

تقدم هذه الورقة طريقة تهيئة ذات صيغة مغلقة ومستقرة عددياً لحالات الرؤية والقصور الذاتي الكاملة، والتي تستفيد من تقريبات الدوران الصغير والسرعة الثابتة لتحقيق دقة أعلى بتكلفة حوسبية وزمن انتقال أقل بكثير مقارنة بالنهج التقليدية القائمة على الأمثلة.

Samuel Cerezo, Seong Hun Lee, Javier Civera2026-03-30
💻 computer science

ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

تقترح الورقة البحثية ETA-VLA، وهو إطار عمل فعال لنماذج الرؤية واللغة والعمل (Vision-Language-Action) يستخدم مجمّعًا متفرقًا مبتكرًا داخل النماذج اللغوية الكبيرة (Intra-LLM Sparse Aggregator) لتقليم الرموز المرئية الزائدة ديناميكيًا بناءً على التوجيه النصي والاتساق الزمني، مما يقلل تكاليف الحوسبة بشكل كبير مع الحفاظ على أداء قيادة عالٍ في اختبار NAVSIM v2.

Yiru Wang, Anqing Jiang, Shuo Wang, Yuwen Heng, Zichong Gu, Hao Sun2026-03-30
💻 computer science

Massive Parallel Deep Reinforcement Learning for Active SLAM

تقدم هذه الورقة إطار عمل مفتوح المصدر وقابل للتوسع للتعلم التعزيزي العميق من طرف إلى طرف، يستفيد من التدريب المتوازي الضخم للتغلب على القيود الحالية في نظام تحديد الموقع ورسم الخرائط النشط (Active SLAM)، مما يقلل وقت التدريب بشكل كبير مع دعم فضاءات العمل المستمرة والسيناريوهات الواقعية.

Martín Arce Llobera, Julio A. Placed, Mariano De Paula, Pablo De Cristóforis2026-03-30