💻 computer science

Vision-Language-Action in Robotics: A Survey of Datasets, Benchmarks, and Data Engines

تجادل هذه الدراسة المسحية بأن مستقبل نماذج الرؤية واللغة والعمل (VLA) يعتمد على التعامل مع البنية التحتية للبيانات — وتحديداً مجموعات البيانات، والمعايير المرجعية، ومحركات البيانات — كأولوية بحثية أساسية للتغلب على القيود الحالية في قابلية التوسع، والتعميم، والتجذر الفيزيائي.

Ziyao Wang, Bingying Wang, Hanrong Zhang, Tingting Du, Tianyang Chen, Guoheng Sun, Yexiao He, Zheyu Shen, Wanghao Ye, An (…)2026-04-28
💻 computer science

Breaking Lock-In: Preserving Steerability under Low-Data VLA Post-Training

تقدم الورقة البحثية **DeLock**، وهي طريقة تمنع "الارتباط القسري" (lock-in)—أي فقدان القدرة على اتباع التعليمات والتعميم أثناء مرحلة ما بعد التدريب ببيانات منخفضة لسياسات الرؤية واللغة والحركة (VLA)—عن طريق الحفاظ على الربط البصري المدرب مسبقاً واستخدام توجيه المحفز التبايني في وقت الاختبار للحفاظ على القدرة على التوجيه.

Suning Huang, Jiaqi Shao, Ke Wang, Qianzhong Chen, Jiankai Sun, Yanjiang Guo, Mac Schwager, Jeannette Bohg2026-04-28
💻 computer science

An Efficient Beam Search Algorithm for Active Perception in Mobile Robotics

تقترح هذه الورقة إطار عمل فعال للإدراك النشط للروبوتات المتنقلة يجمع بين خوارزمية بحث شعاعي عبر العقد (NBS) مبتكرة، ومقياس ربح متوقع لتحسين الاستكشاف، ورسم بياني حلقي عشوائي سريع الاستكشاف (RRAG) للتفوق على الأساليب الحالية في كل من سيناريوهات المحاكاة والواقع الفعلي.

Kaixian Qu, Han Wang, Victor Klemm, Cesar Cadena, Marco Hutter2026-04-28
💻 computer science

Large Language Model based Interactive Decision-Making for Autonomous Driving

تقترح هذه الورقة إطار عمل قائماً على النماذج اللغوية الكبيرة يعزز القيادة الذاتية في سيناريوهات حركة المرور المختلطة المعقدة من خلال استخدام منهجية "الشيء-العملية" (Object-Process Methodology) لنمذجة المشهد الدلالي، والاستدلال المدرك للقصد لاتخاذ القرار، والتواصل عبر اللغة الطبيعية من خلال واجهة خارجية بين الإنسان والآلة لتحسين السلامة والكفاءة والتفاعل الشبيه بالبشر.

Xinwei Dong, Jiyang Li, Jiabin Xie, Yang Yi, Tianshang Jia, Shiyu Fang, Ye Tian, Peng Hang2026-04-28
💻 computer science

EgoLive: A Large-Scale Egocentric Dataset from Real-World Human Tasks

تُعد EgoLive مجموعة بيانات ضخمة وعالية الجودة من منظور الشخص الأول، تتميز بروتينات مهام بشرية متنوعة من واقع الحياة وتوصيفات دقيقة متعددة الوسائط، صُممت لتسريع تطوير نماذج التلاعب الروبوتية القابلة للتعميم.

Yihang Li, Xuelong Wei, Jingzhou Luo, Yingjing Xiao, Yibo Bai, Guangyuan Zhou, Teng Zou, Chenguang Gui, Jiajun Wen, He Z (…)2026-04-28
💻 computer science

PhysCodeBench: Benchmarking Physics-Aware Symbolic Simulation of 3D Scenes via Self-Corrective Multi-Agent Refinement

تقدم الورقة البحثية PhysCodeBench، وهو معيار جديد لتقييم المحاكاة الرمزية المدركة للفيزياء، وتقترح إطار عمل للتحسين متعدد الوكلاء ذاتي التصحيح (SMRF) يتفوق بشكل كبير على النماذج الحالية من خلال استخدام وكلاء متخصصين لسد الفجوة بين الأوصاف الفيزيائية باللغة الطبيعية والمحاكاة ثلاثية الأبعاد القابلة للتنفيذ.

Tianyidan Xie, Peiyu Wang, Yuyi Qian, Yuxuan Wang, Rui Ma, Ying Tai, Song Wu, Qian Wang, Lanjun Wang, Zili Yi2026-04-28
💻 computer science

Tube Diffusion Policy: Reactive Visual-Tactile Policy Learning for Contact-rich Manipulation

تُعد سياسة الانتشار الأنبوبي (TDP) إطار عمل جديد للتعلم بالتقليد يجمع بين القدرة التعبيرية لنماذج الانتشار والتحكم بالتغذية الراجعة القائم على الأنابيب لتمكين عمليات المناولة البصرية-اللمسية السريعة والتفاعلية والقوية في البيئات الغنية بالتلامس.

Teng Xue, Alberto Rigo, Bingjian Huang, Jiayi Shen, Zhengtong Xu, Nick Colonnese, Amirhossein H. Memar2026-04-28
💻 computer science

Unleashing the Agility of Wheeled-Legged Robots for High-Dynamic Reflexive Obstacle Evasion

تقدم هذه الورقة البحثية AWARE، وهو إطار عمل للتعلم التعزيزي الهرمي يُمكّن الروبوتات ذات الأرجل والعجلات من تحقيق تفادي انعكاسي قوي وعالي الديناميكية للعقبات من خلال الاستفادة الطبيعية من مورفولوجيتها الهجينة لتوليد مشيات ناشئة وسلوكيات تفادٍ متنوعة.

Yongen Zhao (School of Mechanical Engineering, Tianjin University, Tianjin, China, Beijing Zhongguancun Academy, Beijing (…)2026-04-28
💻 computer science

Vision-Language-Action Safety: Threats, Challenges, Evaluations, and Mechanisms

تقدم هذه الدراسة استعراضاً شاملاً وموحداً للسلامة في نماذج الرؤية واللغة والعمل (VLA) من خلال تنظيم التهديدات، والدفاعات، والتقييمات، وتحديات النشر عبر مراحل التدريب والاستدلال، مع تمييز المخاطر الخاصة بنماذج (VLA) عن سلامة الروبوتات والنماذج اللغوية الكبيرة التقليدية وتحديد المشكلات المفتوحة الرئيسية في هذا المجال.

Qi Li, Bo Yin, Weiqi Huang, Ruhao Liu, Bojun Zou, Runpeng Yu, Jingwen Ye, Weihao Yu, Xinchao Wang2026-04-28
⚡ electrical engineering

Cooptimizing Safety and Performance Using Safety Value-Constrained Model Predictive Control

تقترح هذه الورقة إطار عمل للتحكم التنبئي بالنماذج (MPC) يضمن السلامة طويلة الأمد للأنظمة ذاتية القيادة من خلال دمج دالة قيمة سلامة قائمة على إمكانية الوصول كقيد نهائي، مما يوفر بديلاً أقل تحفظاً وأكثر متانة للطرق التقليدية.

Hao Wang, Nam Nguyen, Armand Jordana, Ludovic Righetti, Somil Bansal2026-04-28