💻 computer science

ReasonBreak: Probing Vulnerabilities in Reasoning-Enabled Vision-Language-Action Models for Autonomous Driving

تقدم هذه الورقة أول دراسة منهجية بنظام "الصندوق الأسود" تثبت أن نماذج الرؤية واللغة والعمل (Vision-Language-Action) القائمة على الاستنتاج والمستخدمة في القيادة الذاتية معرضة بشدة للاضطرابات النصية الواقعية، والتي تؤدي بشكل كبير إلى تدهور قدرات الاستنتاج وسلامة القيادة، مما يسلط الضوء على الحاجة الملحة لأطر تقييم قوية ودفاعات محسنة.

Mohammadreza Teymoorianfard, Jean-Philippe Monteuuis, Jonathan Petit, Amir Houmansadr2026-05-29
💻 computer science

ElegantVLA: Learning When to Think for Efficient Vision-Language-Action Models

تُعد ElegantVLA إطار استدلال مدمج ومتكيف مع المراحل، يعمل على تسريع نماذج الرؤية واللغة والعمل (Vision-Language-Action) عبر الجدولة الديناميكية للموارد الحوسبية عبر وحدات الإدراك والعمل بناءً على الاستقرار الزمني وتقدم المهمة، مما يؤدي إلى زيادة تردد التحكم بشكل كبير دون الحاجة إلى إعادة تدريب النموذج الأساسي.

Ye Li, Huanan Liu, Kangye Ji, Yuan Meng, Jiajun Fan, Yuansong Wang, Shiyu Qin, Chenglei Wu, Shu-Tao Xia, Zhi Wang2026-05-29
🤖 AI

Planning with the Views via Scene Self-Exploration

تقدم هذه الورقة ViewSuite، وهو معيار ثلاثي الأبعاد يكشف أن نماذج الرؤية واللغة تواجه صعوبة في تركيب تحويلات (الرؤية-الإجراء) للتخطيط متعدد الخطوات، وتقترح إطار عمل للاستكشاف الذاتي التكراري مع تقطير الرسم البياني للرؤية، مما يعزز أداء التخطيط بشكل كبير من خلال التغلب على المكافآت الشحيحة وتجاوز النماذج الرائدة مثل GPT-4o.

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Ma (…)2026-05-29
💻 computer science

VE2VF: Vision-Enabled to Vision-Free Distillation via Real-world Reinforcement Learning for Robust Contact-Rich Manipulation

تقدم هذه الورقة VE2VF، وهو إطار عمل للتعلم المعزز القائم على تدخل العنصر البشري يقوم بتقطير المعرفة من معلم مدعوم بالرؤية إلى سياسة طالب قوية خالية من الرؤية يتم تدريبها بالكامل في العالم الحقيقي، محققةً معدلات نجاح عالية وتعميماً قوياً في مهام المناولة الغنية بالتلامس دون الاعتماد على تنويع النطاق أو تعزيز البيانات.

Victor Kowalski, Chengxi Li, Dongheui Lee2026-05-29
💻 computer science

FLIP: Real-Time and Resilient Formation Planning for Large-Scale DIstributed Swarms via Point Cloud Registration

تقدم هذه الورقة FLIP، وهي طريقة تخطيط تشكيل موزعة مرنة وفعالة للأسراب واسعة النطاق، تقوم بتحويل حساب تسلسل المواقع الأمثل إلى مشكلة تسجيل سحابة نقاط لتمكين تحسين المسار السريع والمقاوم للقيم المتطرفة دون حمل حوسبي مفرط.

Yuan Zhou, Guangtong Xu, Zhenyu Hou, Jialiang Hou, Fei Gao2026-05-29
💻 computer science

LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation

تقدم هذه الورقة البحثية "تكييف خبرة المستقبل" (FEC)، وهو إطار عمل يستفيد من تنبؤات الفيديو المستقبلية قصيرة المدى والموجهة بواسطة النماذج اللغوية الكبيرة كمعلومات مسبقة مهيكلة لتعزيز الاستكشاف وتكيف السياسات بشكل كبير في مهام التلاعب الروبوتية متعددة الخطوات، مما يثبت أن حتى الفرضيات المستقبلية غير المثالية تحسن الأداء بينما تؤدي الفرضيات غير المتوافقة إلى تدهوره.

Mohammad Khoshnazar, Andrew Melnik, Michael Beetz2026-05-29
💻 computer science

Gaze2Act: Gaze-Conditioned Vision-Language-Action Policies for Interactive Robot Manipulation

يُعد Gaze2Act إطار عمل جديداً للرؤية واللغة والعمل يعزز التلاعب الروبوتي من خلال دمج نظرة الإنسان كإشارة قصد ديناميكية، مما يسد الفجوات بين منظور الأنا والمنظور الخارجي لتحقيق أداء رائد في تمييز الأشياء، والتفاعل دقيق التفاصيل، وتوجيه القصد الديناميكي على روبوت Unitree G1 البشري.

Kuangji Zuo, Gen Li, Bofan Lyu, Yanshuo Lu, Boyu Ma, Shijia Han, Xinyu Zhou, Xichen Yuan, Chuhao Zhou, Jiaqi Bai, Geng L (…)2026-05-29
💻 computer science

A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms

تقدم هذه الورقة UniLab، وهي بنية هجينة لمحاكاة وحدة المعالجة المركزية (CPU) وتعلم وحدة معالجة الرسومات (GPU) تعمل على فصل الفيزياء عن تحديثات السياسة لتحقيق كفاءة تدريب أسرع بمقدار 3 إلى 10 أضعاف في العمليات من البداية إلى النهاية، مع تقليل الاعتماد على NVIDIA CUDA وتمكين تدريب التعلم المعزز للروبوتات عبر المنصات المختلفة.

Yufei Jia, Zhanxiang Cao, Mingrui Yu, Heng Zhang, Shenyu Chen, Dixuan Jiang, Meng Li, Xiaofan Li, Yiyang Liu, Junzhe Wu (…)2026-05-29
🤖 machine learning

DynaFLIP: Rethinking Robotics Perception via Tri-Modal-Dynamics Guided Representation

تُعد DynaFLIP إطار عمل للتدريب المسبق موجه بالديناميكيات ثلاثي الأنماط يعزز التلاعب الروبوتي من خلال ترميز الحركة ذات الصلة بالفعل في تمثيلات بصرية عبر هدف جديد لتقليل حجم السيمبلكس (simplex-volume minimization)، مما يؤدي إلى تعميم فائق عبر مختلف السياسات اللاحقة وسيناريوهات خارج التوزيع.

Jusuk Lee, Seungjae Lee, Jonghun Shin, Hoseong Jung, Sungha Kim, Daesol Cho, H. Jin Kim, Jia-Bin Huang, Furong Huang2026-05-29
⚡ electrical engineering

DSSE: a drone swarm search environment

تُعد DSSE بيئة بحث لسرب من الطائرات بدون طيار قائمة على PettingZoo، صُممت لتسهيل دراسة خوارزميات التعلم المعزز متعدد الوكلاء التي تستخدم خرائط احتمالية ديناميكية لتحديد موقع الهدف دون مكافآت مباشرة تعتمد على المسافة.

Manuel Castanares, Luis F. S. Carrete, Enrico F. Damiani, Leonardo D. M. de Abreu, José Fernando B. Brancalion, Fabrício (…)2026-05-28