🤖 machine learning

Positive-Only Drifting Policy Optimization

تقدم هذه الورقة البحثية "تحسين سياسة الانجراف الإيجابي فقط" (PODPO)، وهو نهج توليدي يعتمد على التعلم التعزيزي عبر الإنترنت، وهو نهج خالٍ من الاحتمالية وخالٍ من تقليم التدرج، يستفيد من التباين المحلي المرجح بالميزة على عينات الميزة الإيجابية لتوجيه الأفعال نحو مناطق العائد المرتفع مع منع الأخطاء بشكل استباقي.

Qi Zhang2026-04-21
🤖 AI

ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control

يُعد ReconVLA إطار عمل يعزز موثوقية نماذج الرؤية واللغة والعمل (VLA) سابقة التدريب من خلال تطبيق التنبؤ المطابق لتوليد تقديرات معايرة لعدم اليقين وكشف الحالات غير الآمنة، مما يتيح التحكم الروبوتي المدرك للفشل دون الحاجة إلى إعادة تدريب النموذج.

Lingling Chen, Zongyao Lyu, William J. Beksi2026-04-21
🤖 AI

Rewind-IL: Online Failure Detection and State Respawning for Imitation Learning

يُعد Rewind-IL إطار عمل عبر الإنترنت لا يتطلب تدريباً، يعمل على تعزيز موثوقية سياسات تعلم التقليد طويلة المدى من خلال الجمع بين كاشف فشل صفري القدرة وآلية إعادة إحياء الحالة التي تقوم تلقائياً بإعادة تشغيل التنفيذ إلى نقاط تفتيش آمنة تم التحقق منها عند اكتشاف الانحراف.

Gehan Zheng, Sanjay Seenivasan, Matthew Johnson-Roberson, Weiming Zhi2026-04-21
💻 computer science

LiDAR-based Crowd Navigation with Visible Edge Group Representation

تقترح هذه الورقة إطار عمل للملاحة في الحشود يعتمد على تقنية ليدار (LiDAR) باستخدام تمثيل مبسط لمجموعات الحواف المرئية يحقق مستويات مماثلة من السلامة والبعد الاجتماعي لطرق التتبع المعقدة في الحشود الكثيفة، مع توفير سرعة أكبر في الحوسبة ومتانة تجاه حالات الاحتجاب.

Allan Wang, Aaron Steinfeld2026-04-21
💻 computer science

Greedy Kalman-Swarm: Improving State Estimation in Robot Swarms in Harsh Environments

تقدم هذه الورقة البحثية "Greedy Kalman-Swarm"، وهو إطار عمل لتقدير الحالة بشكل لامركزي يُمكّن أسراب الروبوتات من تحقيق تنسيق جماعي عالي الدقة في البيئات القاسية والمقيدة بالاتصالات، وذلك عبر الاستفادة من التكامل الجشع (greedy integration) لبيانات الجيران محلياً بدلاً من الاعتماد على المعالجة المركزية أو الإجماع العالمي.

Phunyapa Suksomboon, Paulo Garcia2026-04-21
💻 computer science

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

تقدم هذه الورقة COIN، وهو معيار مرجعي شامل يتكون من 50 مهمة تفاعلية، ومجموعة بيانات واسعة النطاق يتم التحكم فيها عن بُعد، ومقاييس تقييم منهجية للكشف عن القيود الحرجة للوكلاء المجسدين الحاليين في أداء الاستنتاج طويل الأمد المعتمد على السببية بسبب الفجوات بين الفهم البصري والتنفيذ الحركي.

Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li2026-04-21
💻 computer science

Leveraging VR Robot Games to Facilitate Data Collection for Embodied Intelligence Tasks

تقدم هذه الورقة إطار عمل للواقع الافتراضي القائم على التلعيب والمبني على محرك "يونيتي"، والذي يتيح جمع البيانات بشكل قابل للتوسع وفعال من حيث التكلفة للذكاء المتجسد عبر الجمع بين التوليد الإجرائي للمشاهد، والتحكم في الروبوت، والتقييم التلقائي، كما تم التحقق من ذلك من خلال نموذج أولي لالتقاط ووضع النفايات أظهر تغطية واسعة للحالات والأفعال.

Yihan Zhang, Ziyun Huang, Linqi Ye2026-04-21
💻 computer science

Web-Gewu: A Browser-Based Interactive Playground for Robot Reinforcement Learning

تقدم الورقة البحثية Web-Gewu، وهي منصة تفاعلية قائمة على المتصفح تستخدم بنية WebRTC (سحابة-حافة-عميل) لنقل عمليات محاكاة الفيزياء وتدريب التعلم المعزز إلى عقد الحافة، مما يتيح تعليماً في مجال الروبوتات منخفض التكلفة، وقابلاً للتوسع، وخالياً من الحاجة للتثبيت مع عرض مرئي في الوقت الفعلي.

Kaixuan Chen, Linqi Ye2026-04-21
🤖 machine learning

BOIL: Learning Environment Personalized Information

تقدم هذه الورقة طريقة BOIL، وهي طريقة قابلة للتوسع تستفيد من خوارزمية PageRank وتعظيم المعلومات المشتركة لاستخراج رؤى بيئية لتوجيه الأنظمة متعددة الوكلاء نحو أداء فائق طويل الأمد في المهام المعقدة مثل التغطية والدورية، متفوقة بذلك على النهج الاستدلالي التقليدي.

Rohan Patil, Henrik I. Christensen2026-04-21
💻 computer science

Shepherding UAV Swarm with Action Prediction Based on Movement Constraints

تقترح هذه الورقة طريقة تحكم مبتكرة مستوحاة من كلاب الرعي لأسراب الطائرات بدون طيار، تعزز كفاءة التوجيه والسلامة من خلال التنبؤ بسلوك السرب المستقبلي تحت قيود الحركة واختيار إجراءات الملاح المثلى باستخدام إطار عمل قائم على نهج النافذة الديناميكية.

Yusuke Tsunoda, Yusuke Goto, Takao Sato2026-04-21