💻 computer science

EgoExo++: Integrating On-demand Exocentric Visuals with 2.5D Ground Surface Estimation for Interactive Teleoperation of Underwater ROVs

تقدم هذه الورقة البحثية إطار عمل EgoExo++، وهو إطار عمل قائم على الهندسة يعزز التحكم عن بُعد في مركبات التشغيل الآلي تحت الماء (ROV) من خلال تخليق مشاهد خارجية (exocentric) عند الطلب وتقدير أسطح أرضية ثنائية ونصف الأبعاد (2.5D) من التغذية البصرية الذاتية (egocentric)، مما يؤدي إلى تحسين الوعي بالموقف لدى المشغل بشكل كبير، وتقليل عبء العمل، وتعزيز كفاءة المهمة في البيئات المعقدة.

Adnan Abdullah, Ruo Chen, Ioannis Rekleitis, Md Jahidul Islam2026-05-26
🤖 AI

Generalizable Vision-Language Few-Shot Adaptation with Predictive Prompts and Negative Learning

تقدم الورقة البحثية SCAN، وهو إطار عمل خالٍ من المعلمات للتكيف القليل العينات بين الرؤية واللغة، والذي يعزز الأداء من خلال توظيف التوجيه السلبي الخاص بالاستعلام، والمطالبات التباينية المولدة بواسطة النماذج اللغوية الكبيرة، وأوزان الدمج التكيفية لمعالجة الارتباك في الفئات الخاص بالاستعلام وتحولات التوزيع بفعالية.

Sriram Mandalika2026-05-26
💻 computer science

Kilometer-Scale GNSS-Denied UAV Navigation via Heightmap Gradients: A Winning System from the SPRIN-D Challenge

تقدم هذه الورقة نظاماً للطائرات بدون طيار يعمل بالكامل على متنها، حقق ملاحة موثوقة لمسافة 9 كيلومترات في بيئة محرومة من نظام تحديد المواقع العالمي (GNSS) عبر تضاريس متنوعة، وذلك من خلال دمج قياس المسافات مع مرشح جسيمات خفيف الوزن يطابق تدرجات خرائط الارتفاع المحلية المستمدة من ليدار (LiDAR) مع البيانات الجغرافية المسبقة، مما أدى بنجاح إلى الفوز بتحدي الطيران المستقل بالكامل (SPRIN-D Funke) باستخدام أجهزة تعتمد على وحدة المعالجة المركزية فقط.

Michal Werner, David Čapek, Tomáš Musil, Ondřej Franěk, Tomáš Báča, Martin Saska2026-05-26
💻 computer science

LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization

تقدم الورقة البحثية LIBERO-PRO، وهو معيار مرجعي قوي يكشف عن الاعتماد الشديد لنماذج الرؤية واللغة والعمل الحالية على الحفظ الآلي من خلال إظهار انهيار أدائها الكامل عند تقييمها تحت تأثير اضطرابات معممة في الكائنات، والحالات، والتعليمات، والبيئات، مما يحث المجتمع على اعتماد معايير تقييم أكثر عدلاً.

Xueyang Zhou, Yangming Xu, Guiyao Tie, Yongchao Chen, Guowen Zhang, Duanfeng Chu, Pan Zhou, Lichao Sun2026-05-26
💻 computer science

A Formal gatekeeper Framework for Safe Dual Control with Active Exploration

تقترح هذه الورقة إطار عمل رسمي لحارس البوابة من أجل التحكم المزدوج الآمن، والذي يدمج التخطيط القوي مع الاستكشاف النشط، مما يضمن السعي لتقليل عدم اليقين فقط عندما يؤدي ذلك إلى تحسينات ملموسة في المهمة دون المساس بالسلامة.

Kaleb Ben Naveed, Devansh R. Agrawal, Dimitra Panagou2026-05-26
💬 NLP

What Questions Should Robots Be Able to Answer? A Dataset of User Questions for Explainable Robotics

تقدم هذه الورقة مجموعة بيانات مكونة من 1,893 سؤالاً من المستخدمين موجهة للروبوتات المنزلية، جُمعت من 100 مشارك عبر 12 فئة، لتوجيه تطوير الروبوتات القابلة للتفسير من خلال الكشف عن أن المستخدمين يسألون بشكل متكرر عن تنفيذ المهام، لكنهم يعطون الأولوية لفهم كيفية تعامل الروبوتات مع السيناريوهات الصعبة، مع تباين أنماط الأسئلة بشكل كبير بين المستخدمين المبتدئين والمتمرسين.

Lennart Wachowiak, Andrew Coles, Gerard Canal, Oya Celiktutan2026-05-26
🤖 machine learning

Approximating Safety Feedback Without a Safety Oracle via Model Predictive Control

تقترح هذه الورقة خوارزمية قائمة على التحكم التنبئي بالنموذج تعمل على تقريب "أوراكل" (oracle) للسلامة من خلال الاستفادة من افتراضات القابلية للانعكاس المدفوعة بالمحاكي واللثبات الإيجابي للتحقق من سلامة الإجراء دون الحاجة إلى صياغات قيود صريحة أو بيانات مصنفة يدوياً.

Jeff Pflueger, Michael Everett2026-05-26
💻 computer science

Efficient Long-Horizon Vision-Language-Action Models via Static-Dynamic Disentanglement

تقترح الورقة البحثية إطار عمل DySta، وهو إطار عمل فعال لنماذج الرؤية واللغة والعمل (Vision-Language-Action) يقوم بفصل الرموز البصرية الثابتة عن الديناميكية لتقليل طول السياق وتمكين إعادة استخدام ذاكرة التخزين المؤقت لمفاتيح والقيم (KV cache)، مما يؤدي إلى تحسين أداء دمج الإطارات المتعددة وسرعة الاستنتاج بشكل كبير في كل من المهام الروبوتية المحاكية والواقعية.

Weikang Qiu, Huashuo Lei, Tinglin Huang, Rex Ying2026-05-26
💻 computer science

World-VLA-Loop: Closed-Loop Learning of Video World Model and VLA Policy

يقدم World-VLA-Loop إطار عمل مغلق الحلقة يقوم بالتدريب المشترك التكراري لنموذج عالم فيديو مدرك للحالة وسياسة رؤية-لغة-فعل (VLA) باستخدام مجموعة بيانات منسقة من مسارات النجاح والمسارات القريبة من النجاح، مما يتيح تعزيز التعلم بكفاءة في البيئات الافتراضية مع تقليل الاعتماد على التفاعلات الواقعية المكلفة.

Xiaokang Liu, Zechen Bai, Hai Ci, Kevin Yuchen Ma, Mike Zheng Shou2026-05-26