💻 computer science

How to Instruct Your Robot: Dense Language Annotations Power Robot Policy Learning

يقدم البحث إطار عمل DeMiAn، وهو إطار عمل ثنائي المراحل يستفيد من التعليقات اللغوية الكثيفة ومتعددة الجوانب التي تولدها نماذج الرؤية واللغة (VLM) لتحسين تعلم سياسة الروبوت والتعميم عبر مهام متنوعة بشكل كبير دون الحاجة إلى بيانات عرض جديدة.

Bosung Kim, Ruiyi Wang, David Acuna, Jaehun Jung, Alexander Trevithick, Brandon Cui, Yejin Choi, Prithviraj Ammanabrolu2026-05-19
💻 computer science

Contrastive Conceptor Activation Steering (COAST): Unlocking Vision-Language-Action Models through Hidden States

تقترح الورقة البحثية طريقة "توجيه تنشيط المفهوم التبايني" (COAST)، وهي طريقة خفيفة الوزن ولا تتطلب تدريباً، تستخدم المفهومات (conceptors) لتحديد وتوجيه الكوامن في نماذج الرؤية واللغة والعمل (VLA) نحو فضاءات فرعية حرجة للنجاح مستمدة من أمثلة قليلة، مما يحسن معدلات نجاح المهام بشكل كبير عبر بنيات متنوعة دون الحاجة لإعادة التدريب.

Miranda Muqing Miao, Subin Kim, Brandon Yang, Lyle Ungar2026-05-19
⚡ electrical engineering

Generating Realistic Safety-Critical Scenarios for Vehicle-Pedestrian Interactions

تقترح هذه الورقة إطار عمل مكوناً من ثلاث مراحل يجمع بين التدريب المسبق على بيانات من العالم الحقيقي والمحاكاة التكيفية لإنشاء مجموعة بيانات VPSCI، وهي مجموعة واسعة النطاق من تفاعلات المركبات والمشاة الحرجة من حيث السلامة والواقعية سلوكياً، والتي تتفوق على الطرق المرجعية في دقة المسار وعدم القدرة على التمييز عن التفاعلات الواقعية.

Qingwen Pu, Kun Xie, Yuan Zhu, Guocong Zhai2026-05-19
💻 computer science

Stretch-ICP: A Continuous-Trajectory Registration and Deskewing Algorithm in Scenarios of Aggressive Motions

تقدم هذه الورقة مجموعة بيانات TIGS التي تتميز بحركات التقلب الشديدة، وتقترح طريقتين متكاملتين، SAAVE وStretch-ICP، لتعزيز قوة ودقة تقدير حالة الليدار والقصور الذاتي وإعادة بناء المسار بشكل كبير في السيناريوهات التي تنطوي على حركات روبوتية عدوانية.

Simon-Pierre Deschênes, Veronica Vannini, Philippe Giguère, François Pomerleau2026-05-19
💻 computer science

CLAP: Contrastive Latent-space Prompt Optimization for End-to-end Autonomous Driving

تقدم هذه الورقة CLAP، وهو إطار عمل مدرك للموقع يعمل على تحسين المطالبات الناعمة (soft prompts) لكل حاجز طريق في الفضاء الكامن لنماذج الرؤية واللغة والعمل (Vision-Language-Action) المجمدة، وذلك لتقليل أخطاء التخطيط بشكل كبير في سيناريوهات القيادة النادرة والحرجة على السلامة في حالات الذيل الطويل دون المساس بالأداء في الإطارات العادية.

Ruiyang Zhu, Yuehan He, Boyuan Zheng, Zesen Zhao, Ahmad Chalhoub, Qingzhao Zhang, Z. Morley Mao2026-05-19
💻 computer science

HCLM: A Hierarchical Framework for Cooperative Loco-Manipulation with Dual Quadrupeds

تقدم هذه الورقة البحثية إطار عمل هرمي يُدعى HCLM، يجمع بين سياسة انتشار مشتركة مركزية للتنسيق المكاني عالي المستوى وبين متحكم هجين شامل للجسم متمحور حول المهام للتنفيذ القوي منخفض المستوى، مما يمكّن الروبوتات رباعية الأرجل المزدوجة من أداء مهام المناولة والتحريك التعاونية المعقدة بنجاح في كل من بيئات المحاكاة والبيئات الواقعية.

Qixuan Li, Chen Le, Jincheng Yu, Xinlei Chen2026-05-19
💻 computer science

Efficient Feature-Free Initialization for Monocular Visual-Inertial Systems Using a Feed-Forward 3D Model

تقترح هذه الورقة إطار عمل للتهيئة الخالية من الميزات للأنظمة البصرية-القصورية أحادية الكاميرا، والذي يستفيد من نماذج ثلاثية الأبعاد ذات تغذية أمامية للتنبؤ بسحب نقاط نقطية ضمن نطاق المقياس، محققاً معدل نجاح يتجاوز 90% وتقليص وقت التهيئة إلى أقل من 1.2 ثانية مع إظهار المتانة في البيئات المتدهورة بصرياً.

Yuantai Zhang, Jiaqi Yang, Huajian Zeng, Changhao Chen, Haoang Li, Liang Li, Dezhen Song, Xingxing Zuo2026-05-19
💻 computer science

MUSE: Multimodal Uncertainty Quantification of State Estimation

تقدم هذه الورقة MUSE، وهو إطار عمل جديد للتعلم في الوقت الفعلي يعتمد على بنية Mamba لتقدير عدم اليقين متعدد الوسائط بفعالية في تقدير الحالة البصرية-القصورية، مما يظهر موثوقية ومتانة فائقتين مقارنة بالطرق الحالية.

Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Ho (…)2026-05-19
💻 computer science

Rapid Vibration Suppression and Trajectory Tracking of a Serial Manipulator with Multi-Flexible Links

تقترح هذه الورقة إطار عمل للتغذية الراجعة للمخرجات باستخدام طريقة الارتداد للخلف معزز بـ DeepONet، والذي يحقق كبحاً سريعاً للاهتزازات وتتبعاً دقيقاً للمسار للمناورات المرنة متعددة الوصلات من خلال تقريب نوى التحكم الحدودي المعقدة لتمكين التنفيذ في الوقت الفعلي.

Chengyi Wang, Yilong Huang, Ji Wang2026-05-19
💻 computer science

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization

تقدم هذه الورقة DyGRO-VLA، وهو إطار تحسين ثنائي المراحل يعزز قدرة نماذج الرؤية واللغة والعمل (Vision-Language-Action) على التعميم عبر المهام من خلال التقاط التمثيلات الكامنة العابرة للمهام، وتحسين تحسين السياسة ديناميكيًا عبر مزيج من بقايا التعلم المعزز (mixture-of-RL-residuals)، مما يقلل من التداخل ويحسن الأداء في ظل تغيرات التوزيع.

Sixu Lin, Yunpeng Qing, Litao Liu, Ming Zhou, Ruixing Jin, Xiaoyi Fan, Guiliang Liu2026-05-19