🤖 machine learning

OGPO: Sample Efficient Full-Finetuning of Generative Control Policies

تقدم هذه الورقة البحثية خوارزمية OGPO، وهي خوارزمية خارج السياسة (off-policy) ذات كفاءة في العينات تتيح الضبط الدقيق الكامل لسياسات التحكم التوليدية لتحقيق أداء رائد في مهام روبوتية متنوعة، بما في ذلك الضبط الدقيق للسياسات ضعيفة التهيئة دون بيانات خبير، وذلك من خلال الاستفادة من أهداف PPO المعدلة والمثبتات العملية للتخفيف من حدة الاستغلال المفرط للمنتقد (critic over-exploitation).

Sarvesh Patil, Mitsuhiko Nakamoto, Manan Agarwal, Shashwat Saxena, Jesse Zhang, Giri Anantharaman, Cleah Winston, Chaoyi (…)2026-05-06
💻 computer science

Refining Compositional Diffusion for Reliable Long-Horizon Planning

تقدم هذه الورقة طريقة "تكرير الانتشار التركيبي" (RCD)، وهي طريقة توجيه خالية من التدريب تعمل على التخفيف من حدة متوسط الأنماط في التخطيط طويل الأمد عبر الاستفيد من خطأ إعادة البناء الذاتي واتساق التداخل لتوجيه الانتشار التركيبي نحو مسارات عالية الكثافة ومتماسكة عالميًا.

Kyowoon Lee, Yunhao Luo, Anh Tong, Jaesik Choi2026-05-06
💻 computer science

Robust Path Tracking for Vehicles via Continuous-Time Residual Learning: An ICODE-MPPI Approach

تقدم هذه الورقة البحثية إطار عمل ICODE-MPPI، وهو إطار عمل قوي لتتبع المسار يدمج المعادلات التفاضلية العادية العصبية المتزامنة مع المدخلات لتعلم وتعويض الديناميكيات المتبقية غير المنمذجة في الوقت المستمر، محققاً انخفاضاً كبيراً في أخطاء تتبع المسار وتحكماً أكثر سلاسة مقارنة بطرق "تكامل المسار التنبؤي بالنماذج" القياسية.

Shugen Song, Wenjie Mei, Chengyan Zhao2026-05-06
🤖 machine learning

RLDX-1 Technical Report

تقدم هذه الورقة البحثية RLDX-1، وهو سياسة روبوتية عامة تعتمد على بنية محول الإجراءات متعدد التدفقات (MSAT) التي تدمج الأنماط غير المتجانسة وتصاميم الأنظمة المتخصصة لتتفوق بشكل كبير على نماذج الرؤية واللغة والإجراء الحالية في مهام التلاعب البشري المعقدة والغنية بالتلامس والديناميكية في العالم الحقيقي.

Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon (…)2026-05-06
💻 computer science

TACO: Trajectory Aligning Cross-view Optimisation

إنَّ TACO هو مسار معالجة مترابط وثيقًا بين وحدة قياس القصور الذاتي (IMU) وتحديد الموقع الجغرافي دقيق التفاصيل عبر الرؤية المتقاطعة، مما يتيح تحديد موقع مطلق قوي ومستقل عن نظام تحديد المواقع العالمي (GNSS) من خلال تفعيل مطابقة صور الأقمار الصناعية ديناميكيًا لتصحيح الانجراف العطالي، محققًا بذلك تقليلًا في خطأ المسار يصل إلى ستة أضعاف تقريبًا في مجموعة بيانات KITTI.

Tavis Shore, Oscar Mendez, Simon Hadfield2026-05-06
⚡ electrical engineering

Learning Reactive Dexterous Grasping via Hierarchical Task-Space RL Planning and Joint-Space QP Control

تقترح هذه الورقة إطار تحكم هرمي هجين يجمع بين التعلم المعزز متعدد الوكلاء لتخطيط فضاء المهام عالي المستوى، والبرمجة التربيعية المتوازية عبر وحدة معالجة الرسومات للتنفيذ في فضاء المفاصل منخفض المستوى، مما يتيح إمساكاً بارعاً وتفاعلياً، قوياً، وقابلاً للنقل دون تدريب مسبق (zero-shot)، وآمناً على ذراع بـ 7 درجات حرية ويد بـ 20 درجة حرية في بيئات غير منظمة.

Ho Jae Lee, Yonghyeon Lee, Alexander Alexiev, Tzu-Yuan Lin, Se Hwan Jeon, Sangbae Kim2026-05-06
💻 computer science

Bridging the Embodiment Gap: Disentangled Cross-Embodiment Video Editing

تقترح هذه الورقة إطار عمل توليدي يعمل على فصل تمثيلات المهمة والجسد عبر هدف تبايني مزدوج لتخليق فيديوهات تنفيذ روبوتية متماسكة من عروض بشرية فردية، مما يسد فجوة التوزيع بفعالية دون الحاجة إلى بيانات متزاوجة عبر الأجساد المختلفة.

Zhiyuan Li, Wenyan Yang, Wenshuai Zhao, Yue Ma, Yuanpeng Tu, Pekka Marttinen, Joni Pajarinen2026-05-06
💻 computer science

Jiao: Bridging Isolation and Customization in Mixed Criticality Robotics

تقدم هذه الورقة "جياو" (Jiao)، وهي بنية هندسية للروبوتات الاستهلاكية ذات الأهمية الحرجة التي تسد الفجوة بين مطوري المنصات والمستخدمين النهائيين من خلال دمج عمليات التجاوز على مستوى الأجهزة، ومزامنة المعلمات، والاتصال المتوافق مع معايير السلامة لتحقيق تخفيضات كبيرة في تذبذب التوقيت والعزل على المنصات متعددة الأنوية المشتركة.

James Yen, Zhibai Huang, Zhixiang Wei, Tinghao Yi, Shupeng Zeng, Liang Pang, Songtao Xue, Zhengwei Qi2026-05-06
💻 computer science

Say the Mission, Execute the Swarm: Agent-Enhanced LLM Reasoning in the Web-of-Drones

تقترح هذه الورقة إطار عمل لنموذج لغوي كبير معزز بالوكلاء يستفيد من معايير "شبكة الأشياء" (W3C Web of Things) وبروتوكول سياق النموذج (Model Context Protocol) لتمكين التحكم عبر اللغة الطبيعية في أسراب الطائرات بدون طيار، مبرهنةً على أنه بينما تعاني النماذج اللغوية الكبيرة الحالية من صعوبة التنفيذ الموثوق دون تجسيد، فإن الأدوات المتخصصة في المهام وحواجز الحماية أثناء التشغيل تزيد من المتانة بشكل كبير.

Andrea Iannoli, Lorenzo Gigli, Luca Sciullo, Angelo Trotta, Marco Di Felice2026-05-06
💻 computer science

RoboAlign-R1: Distilled Multimodal Reward Alignment for Robot Video World Models

يقدم البحث إطار عمل RoboAlign-R1، الذي يعزز نماذج عالم الفيديو للروبوتات من خلال تقطير حكم معلم متعدد الوسائط إلى نموذج مكافأة لتدريب ما بعد المعالجة واستخدام استراتيجية إعادة الترميز بالنافذة المنزلقة، مما يؤدي بشكل كبير إلى تحسين اتباع التعليمات، ودقة التلاعب، والمعقولية الفيزيائية، واستقرار التنبؤ طويل المدى.

Hao Wu, Yuqi Li, Yuan Gao, Fan Xu, Fan Zhang, Kun Wang, Penghao Zhao, Qiufeng Wang, Yizhou Zhao, Weiyan Wang, Yingli Tia (…)2026-05-06