🤖 machine learning

Kernel Dynamics under Path Entropy Maximization

تقترح هذه الورقة إطاراً تباينياً يعامل دالة النواة كمتغير ديناميكي يتم تحسينه عبر مبدأ "القدر الأقصى" (Maximum Caliber)، مما يضع حداً أدنى للعمل الثيرموديناميكي المطلوب للتغيير التمثيلي، ويقترح تطبيقات تتراوح من تدريب الشبكات العصبية إلى تطور النماذج البيولوجية والعلمية.

Jnaneshwar Das2026-03-31
💻 computer science

SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting

تقترح الورقة البحثية إطار عمل SHARP، وهو إطار عمل مبتكر للتنبؤ بالحركة يعتمد على التدفق (streaming)، يستخدم تدفق سياقاً مدركاً للنماذج (instance-aware context streaming) وهدف تدريب مزدوج لتحقيق تنبؤات مسار رصينة، ومنخفضة زمن الاستجابة، وذات أداء فائق في مختلف أطوال الملاحظات غير المتجانسة عبر بيئات المرور الديناميكية.

Alexander Prutsch, Christian Fruhwirth-Reisinger, David Schinagl, Horst Possegger2026-03-31
💻 computer science

AutoDrive-P3AutoDrive\text{-}P^3: Unified Chain of Perception-Prediction-Planning Thought via Reinforcement Fine-Tuning

تقدم هذه الورقة البحثية **AutoDrive-P³**، وهو إطار عمل مبتكر يوحد الإدراك والتنبؤ والتخطيط في عملية سلسلة واحدة من تسلسل الأفكوابالاعتماد على مجموعة بيانات متخصصة وتعلم تعزيزي هرمي، محققاً أداءً هو الأفضل في فئته في مجال القيادة الذاتية من خلال ضمان اتخاذ قرارات تآزرية والموازنة بين كفاءة الاستنتاج وأنماط التفكير المزدوجة.

Yuqi Ye, Zijian Zhang, Junhong Lin, Shangkun Sun, Changhao Peng, Wei Gao2026-03-31
💻 computer science

A Position Statement on Endovascular Models and Effectiveness Metrics for Mechanical Thrombectomy Navigation, on behalf of the Stakeholder Taskforce for AI-assisted Robotic Thrombectomy (START)

عقدت فرقة عمل أصحاب المصلحة في مبادرة (START) خبراء لوضع إطار توافقي لتطوير والتحقق من صحة الأنظمة الروبوتية المساعدة بالذكاء الاصطناعي لعمليات استئصال الخثرة الميكانيكي، مع تحديد مقاييس فعالية معيارية وهيكل هرمي متعدد المستويات لبيئات الاختبار يتراوح من النماذج التشريحية المبسطة إلى المحاكاة الفسيولوجية المعقدة لضمان سلامة المرضى والفعالية السريرية.

Harry Robertshaw, Anna Barnes, Phil Blakelock, Raphael Blanc, Robert Crossley, Rebecca Fahrig, Ameer E. Hassan, Benjamin (…)2026-03-31
💻 computer science

Off-Axis Compliant RCM Joint with Near-Isotropic Stiffness and Minimal Parasitic Error

تقدم هذه الورقة مفصلاً متوافقاً أحادياً، خارج المحور، لمركز الحركة عن بعد (RCM) مصمماً لجراحة التنظير العصبي، يحقق صلابة شبه متماثلة وحركة طفيلية دنيا من خلال عملية تصميم ثنائية المراحل، تم التحقق من صحتها عبر تحليل العناصر المحدودة والاختبار التجريبي لنموذج أولي مطبوع ثلاثي الأبعاد من مادة البولي أميد 12 (PA12).

Federico Mariano, Elena De Momi, Giovanni Berselli, Jovana Jovanova, Just L. Herder, Leonardo S. Mattos2026-03-31
⚡ electrical engineering

Cost-Matching Model Predictive Control for Efficient Reinforcement Learning in Humanoid Locomotion

تقترح هذه الورقة إطار عمل للتحكم التنبئي بالنماذج القائم على مطابقة التكلفة، والذي يقوم بتدريب نموذج ديناميكيات مركزي مُعامل لتقريب دوال قيمة الفعل من بيانات عالية الدقة، مما يتيح التعلم الفعال القائم على التدرج من أجل حركة بشرية قوية وعالية الأداء دون العبء الحسابي المتمثل في حل مسائل التحكم التنبئي بالنماذج بشكل متكرر أثناء التدريب.

Wenqi Cai, Kyriakos G. Vamvoudakis, Sébastien Gros, Anthony Tzes2026-03-31
🤖 machine learning

Critic-Free Deep Reinforcement Learning for Maritime Coverage Path Planning on Irregular Hexagonal Grids

تقترح هذه الورقة إطار عمل للتعلم التعزيزي العميق خالٍ من الناقد باستخدام تحسين السياسة النسبية للمجموعة وسياسة مؤشر تعتمد على المحولات لحل مسأًلة تخطيط مسار التغطية البحرية على شبكات سداسية غير منتظمة، محققة كفاءة مسار فائقة ومعدلات نجاح تقارب الكمال مقارنة بالخوارزميات الاستدلالية التقليدية مع تمكين النشر الفوري على متن السفن.

Carlos S. Sepúlveda, Gonzalo A. Ruz2026-03-31
⚡ electrical engineering

Dynamic Lookahead Distance via Reinforcement Learning-Based Pure Pursuit for Autonomous Racing

تقترح هذه الورقة متحكم "المطاردة النقية" (Pure Pursuit) يعتمد على التعلم التعزيزي، يقوم بتعديل مسافة التطلع ديناميكيًا باستخدام وكيل "سياسة التدرج البروي" (PPO) تم تدريبه في المحاكاة، مما أظهر أزمنة لفات متفوقة ونقلًا قويًا من المحاكاة إلى الواقع على منصات السباق ذاتية القيادة مقارنة بالنماذج المرجعية الثابتة والتكيفية.

Mohamed Elgouhary, Amr S. El-Wakeel2026-03-31
💬 NLP

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning

يقدم SOLE-R1 نموذج استدلال لغوي-بصري يعمل كإشارة مكافأة وحيدة للتعلم التعزيزي على الروبوتات من خلال توليد تقديرات تقدم كثيفة لكل خطوة زمنية عبر استدلال تسلسلي مكاني-زماني، مما يمكن الروبوتات من إتقان مهام التلاعب غير المرئية دون الحاجة إلى مكافآت حقيقية أو عروض توضيحية، مع التفوق على المقيمات اللغوية-البصرية الحالية في المتانة ومعدلات النجاح.

Philip Schroeder, Thomas Weng, Karl Schmeckpeper, Eric Rosen, Stephen Hart, Ondrej Biza2026-03-31
🤖 machine learning

Task Tokens: A Flexible Approach to Adapting Behavior Foundation Models

تقدم هذه الورقة "رموز المهام" (Task Tokens)، وهي طريقة تعتمد على التعلم التعزيزي تعمل على تكييف نماذج السلوك التأسيسية المجمدة مع مهام محددة عبر تعلم مشفرات خاصة بالمهمة لتعيين الملاحظات إلى رموز، مما يؤدي إلى تحسين الأداء مع الحفاظ على قدرات النماذج على التعميم والمرونة.

Ron Vainshtein, Zohar Rimon, Shie Mannor, Chen Tessler2026-03-30