💻 computer science

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

تقدم هذه الورقة البحثية نموذج MLA، وهو نموذج لغوي-حركي متعدد الحواس يعزز التلاعب الروبوتي في البيئات المعقدة الغنية بالتلامس عبر إعادة توظيف النماذج اللغوية الكبيرة من أجل المحاذاة متعددة الوسائط الخالية من المشفرات وتوظيف استراتيجية توليد متعددة الحواس مستقبلية لتحسين نمذجة العالم الفيزيائي، مما يؤدي إلى مكاسب كبيرة في الأداء مقارنة بطرق الفعل-اللغة-الرؤية الحديثة.

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Ku (…)2026-03-20
💻 computer science

Accelerated Multi-Modal Motion Planning Using Context-Conditioned Diffusion Models

تقدم هذه الورقة نموذج الانتشار الواعي بالسياق (CAMPD)، وهو نموذج انتشار خالٍ من المصنف يستخدم آلية الانتباه للتشريط بناءً على معلومات سياقية غير مرتبطة بمستشعرات محددة، مما يمكّن روبوتاً بسبع درجات حرية من التعميم بسرعة في بيئات غير مرئية وتوليد مسارات متعددة الأنماط وعالية الجودة دون الحاجة إلى إعادة التدريب.

Edward Sandra, Lander Vanroye, Dries Dirckx, Ruben Cartuyvels, Jan Swevers, Wilm Decré2026-03-20
🤖 AI

Manual2Skill++: Connector-Aware General Robotic Assembly from Instruction Manuals via Vision-Language Models

يُعد Manual2Skill++ إطار عمل للرؤية واللغة يعزز التجميع الروبوتي من خلال معاملة الوصلات ككيانات أساسية، حيث يستخرج تلقائياً بيانات الوصلات المهيكلة من أدلة التعليمات لبناء رسوم بيانية مهامية هرمية للتنفيذ الموثوق عبر سيناريوهات متنوعة.

Chenrui Tie, Shengxiang Sun, Yudi Lin, Yanbo Wang, Zhongrui Li, Zhouhan Zhong, Jinxuan Zhu, Yiman Pang, Haonan Chen, Jun (…)2026-03-20
💻 computer science

AdaptPNP: Integrating Prehensile and Non-Prehensile Skills for Adaptive Robotic Manipulation

إنّ AdaptPNP هو إطار عمل مدعوم بنموذج رؤية-لغة، يُمكّن من المناولة الروبوتية التكيفية عبر الدمج السلس بين مهارات القبض والمهارات غير القابضة من خلال التخطيط عالي المستوى، والتدريب الذهني القائم على التوأم الرقمي، وإعادة التخطيط المعتمد على التغذية الراجعة عبر الإنترنت للتعامل مع مهام متنوعة في بيئات معقدة.

Jinxuan Zhu, Chenrui Tie, Xinyi Cao, Yuran Wang, Jingxiang Guo, Zixuan Chen, Haonan Chen, Junting Chen, Yangyu Xiao, Rui (…)2026-03-20
💻 computer science

Fast Confidence-Aware Human Prediction via Hardware-accelerated Bayesian Inference for Safe Robot Navigation

تقدم هذه الورقة إطار عمل جديد للاستدلال البايزي معزز بمعالجات الرسوميات (GPU)، يتيح التنبؤ بمسارات متعددة للبشر بتردد عالٍ (125 هرتز)، وبوعي بالثقة، وبدقة تفصيلية، مما يعزز الملاحة الآمنة للروبوت في البيئات الديناميكية.

Michael Lu, Minh Bui, Xubo Lyu, Mo Chen2026-03-20
💻 computer science

Path Integral Particle Filtering for Hybrid Systems via Saltation Matrices

تقدم هذه الورقة خوارزمية متينة وفعالة حاسوبياً لتقدير الحالة للأنظمة الهجينة ذات الديناميكيات العشوائية والاتصال المتقطع، وذلك عبر الاستفادة من مصفوفات الملح (saltation matrices) ضمن إطار التحكم الأمثل بالتكامل المساري للتعامل بفعالية مع الضجيج غير الغاوسي وآثار القيم المتطرفة.

Karthik Shaji, Sreeranj Jayadevan, Bo Yuan, Hongzhe Yu, Yongxin Chen2026-03-20
🤖 AI

Final Report for the Workshop on Robotics & AI in Medicine

عقدت ورشة عمل "كير" (CARE) المنعقدة في ديسمبر ٢٠٢٥ في إنديانابوليس اجتماعاً لأصحاب المصلحة المتنوعين لوضع رؤية وطنية للنهوض بالروبوتات الطبية والذكاء الاصطناعي، حيث حددت الفجوات الحرجة في البيانات والتنظيم والتدريب مع التوصل إلى إجماع على الحاجة الملحة لإنشاء مركز وطني للتميز في الذكاء الاصطناعي والروبوتات لدفع عجلة النشر السريري الآمن والموثوق والعادل.

Juan P Wachs2026-03-20
🤖 machine learning

R2-Dreamer: Redundancy-Reduced World Models without Decoders or Augmentation

يُعد R2-Dreamer إطار عمل للتعلم المعزز القائم على النماذج وخالٍ من فك التشفير، حيث يستخدم هدف تقليل الفائض المستوحى من Barlow Twins كمنظم داخلي لتعلم تمثيلات قوية دون الحاجة إلى تعزيز البيانات، محققاً أداءً تنافسياً وسرعات تدريب أسرع من الخطوط المرجعية المتطورة.

Naoki Morihira, Amal Nahar, Kartik Bharadwaj, Yasuhiro Kato, Akinobu Hayashi, Tatsuya Harada2026-03-20
💻 computer science

GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System

يُعد GoalVLM إطار عمل للملاحة التعاونية متعددة الوكلاء، تعتمد على التعرف الصفري (zero-shot) والمفردات المفتوحة (open-vocabulary)، حيث يدمج نماذج الرؤية واللغة (Vision-Language Models)، وSAM3، وSpaceOM لتمكين الوكلاء من تفسير أهداف لغوية حرة الشكل والملاحة نحو أجسام جديدة دون الحاجة إلى تدريب خاص بالمهمة.

MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou2026-03-20
💻 computer science

Semantic Segmentation and Depth Estimation for Real-Time Lunar Surface Mapping Using 3D Gaussian Splatting

تقدم هذه الورقة إطار عمل لرسم خرائط سطح القمر في الوقت الفعلي يدمج التجزئة الدلالية وتقدير العمق الكثيف مع تقنية "Gaussian Splatting" ثلاثية الأبعاد لتحقيق إعادة بناء ثلاثية الأبعاد عالية الدقة وتفصيلية في البيئات الصعبة، متفوقة بذلك على النماذج المرجعية التقليدية للسحابة النقطية التي لا تعتمد على تقنية ليدار (LiDAR).

Guillem Casadesus Vila, Adam Dai, Grace Gao2026-03-20