💻 computer science

MergeVLA: Cross-Skill Model Merging Toward a Generalist Vision-Language-Action Agent

تعد MergeVLA بنية رؤية-لغة-فعل (Vision-Language-Action) موجهة نحو الدمج، تتغلب على عدم قابلية دمج خبراء الـ VLA الحاليين من خلال إدخال محولات LoRA متفرقة مقنعة بالمهام وخبراء أفعال يعتمدون على الانتباه المتقاطع فقط، مما يمكّن عميلاً عاماً واحداً من التعامل بمتانة مع مهام وتجسيدات متنوعة دون تدهور في الأداء.

Yuxia Fu, Zhizhen Zhang, Yuqi Zhang, Zijian Wang, Zi Huang, Yadan Luo2026-03-12
🤖 AI

CostNav: A Navigation Benchmark for Real-World Economic-Cost Evaluation of Physical AI Agents

تقدم هذه الورقة CostNav، وهو أول معيار للملاحة القائم على الفيزياء والذي يقيم الوكلاء المستقلين باستخدام بيانات اقتصادية من العالم الحقيقي ليكشف أن الأساليب الحالية، رغم تباينها في الأجهزة والبنية، تفشل جميعها في تحقيق الجدوى الاقتصادية بسبب هوامش المساهمة السلبية.

Haebin Seong, Sungmin Kim, Yongjun Cho, Myunchul Joe, Geunwoo Kim, Yubeen Park, Sunhoo Kim, Yoonshik Kim, Suhwan Choi, J (…)2026-03-12
🤖 machine learning

Partially Equivariant Reinforcement Learning in Symmetry-Breaking Environments

تقدم هذه الورقة البحثية التعلم المعزز متساوي التباين جزئياً، وهو إطار عمل يخفف من انتشار الخطأ في البيئات التي تكسر التماثل من خلال التطبيق الانتقائي لعمليات التحديث (Bellman backups) إما المتوافقة مع المجموعة أو القياسية بناءً على التماثل المحلي، مما يحقق كفاءة عينة وقدرة على التعميم متفوقة مقارنة بالطرق الحالية.

Junwoo Chang, Minwoo Park, Joohwan Seo, Roberto Horowitz, Jongmin Lee, Jongeun Choi2026-03-12
🤖 machine learning

Cross-embodied Co-design for Dexterous Hands

تقدم هذه الورقة إطار عمل للتصميم المشترك يعمل على تحسين مورفولوجيا اليد الروبوتية وسياسات التحكم في آن واحد لتمكين التصميم والتصنيع والنشر النهائي للأيدي الماهرة المخصصة لمهام معينة في أقل من 24 ساعة.

Kehlani Fay, Darin Anthony Djapri, Anya Zorin, James Clinton, Ali El Lahib, Hao Su, Michael T. Tolley, Sha Yi, Xiaolong (…)2026-03-12
🤖 AI

World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty

تقترح هذه الورقة البحثية C3، وهي طريقة مبتكرة لتقدير عدم اليقين تقوم بتدريب نماذج الفيديو القابلة للتحكم لتوليد خرائط حرارية للثقة عالية الدقة ومعايرة على مستوى شبه الرقعة (subpatch) من خلال تقدير عدم اليقين في الفضاء الكامن واستخدام قواعد تسجيل ملائمة تماماً، مما يتيح الكشف الموثوق عن الهلوسة وتحديد البيانات الخارجة عن التوزيع لتطبيقات الروبوتات.

Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar2026-03-12
🤖 AI

Moving On, Even When You're Broken: Fail-Active Trajectory Generation via Diffusion Policies Conditioned on Embodiment and Task

تقدم هذه الورقة DEFT، وهو مولد مسارات قائم على الانتشار يُمكّن الروبوتات من تحقيق تشغيل نشط عند الفشل عبر إكمال المهام بنجواح تحت حالات فشل التشغيل التعسفية، متفوقاً على الطرق الكلاسيكية في كل من سيناريوهات المحاكاة والواقع مع إظهار تعميم قوي دون تدريب مسبق.

Gilberto G. Briscoe-Martinez, Yaashia Gautam, Rahul Shetty, Anuj Pasricha, Marco M. Nicotra, Alessandro Roncone2026-03-12
💻 computer science

Model-Free Co-Optimization of Manufacturable Sensor Layouts and Deformation Proprioception

تقدم هذه الورقة مسارًا حوسبيًا قائمًا على البيانات وخاليًا من النماذج، يعمل على تحسين تخطيط المستشعرات المرنة ومعلمات شبكة التنبؤ بالشكل بشكل مشترك لتعزيز دقة استشعار التشوه مع ضمان القابلية للتصنيع، مما يلغي الحاجة إلى نماذج المحاكاة الفيزيائية.

Yingjun Tian, Guoxin Fang, Aoran Lyu, Xilong Wang, Zikang Shi, Yuhu Guo, Weiming Wang, Charlie C. L. Wang2026-03-12
💻 computer science

Cross-Hand Latent Representation for Vision-Language-Action Models

تقدم الورقة البحثية XL-VLA، وهو إطار عمل للرؤية واللغة والعمل (vision-language-action) يستخدم فضاء عمل كامن موحداً وغير مرتبط بجسد محدد لتمكين التدريب القابل للتوسع عبر مختلف الأجسدان وتحسين أداء المعالجة الماهرة عبر أيدٍ روبوتية متنوعة.

Guangqi Jiang, Yutong Liang, Jianglong Ye, Jia-Yang Huang, Changwei Jing, Rocky Duan, Pieter Abbeel, Xiaolong Wang, Xuey (…)2026-03-12
💻 computer science

Dance2Hesitate: A Multi-Modal Dataset of Dancer-Taught Hesitancy for Understandable Robot Motion

تقدم هذه الورقة البحثية "Dance2Hesitate"، وهي مجموعة بيانات متعددة الوسائط مفتوحة المصدر تتكون من بيانات متزامنة لتعليم الروبوت الحركي (kinesthetic) وبيانات التقاط حركة الراقص عبر ثلاثة مستويات من التردد، صُممت لتسهيل دراسة ومعايرة التردد المفهوم والسياقي في التعاون بين الإنسان والروبوت.

Srikrishna Bangalore Raghu, Anna Soukhovei, Divya Sai Sindhuja Vankineni, Alexandra Bacula, Alessandro Roncone2026-03-12
💻 computer science

Autonomous Search for Sparsely Distributed Visual Phenomena through Environmental Context Modeling

تقترح هذه الورقة استراتيجية بحث لمركبة ذاتية القيادة تحت الماء تستفيد من الكشف بضربة واحدة للأنواع المستهدفة الموزعة بشكل متباعد إلى جانب سمات سياقها البيئي الأكثر كثافة لتوجيه التخطيط التكيفي، مما يمكّن الروبوت من تحديد ما يصل إلى 75% من الأهداف في نصف الوقت المطلوب للتغطية الشاملة.

Eric Chen, Travis Manderson, Nare Karapetyan, Peter Edmunds, Nicholas Roy, Yogesh Girdhar2026-03-12