💻 computer science

GMT: Goal-Conditioned Multimodal Transformer for 6-DOF Object Trajectory Synthesis in 3D Scenes

تقدم هذه الورقة البحثية GMT، وهو إطار عمل محول متعدد الوسائط مشروط بالهدف يقوم بتخليق مسارات تلاعب بالأجسام ذات ست درجات حرية (6-DOF) واقعية وقابلة للتحكم في مشاهد ثلاثية الأبعاد معقدة من خلال الاستفادة المشتركة من الهندسة ثلاثية الأبعاد، والسحب النقطية، والفئات الدلالية، والوضعيات المستهدفة، متفوقاً بذلك على الأساليب الحالية الرائدة في دقة المكان والتحكم في التوجيه.

Huajian Zeng, Abhishek Saroha, Daniel Cremers, Xi Wang2026-03-19
💻 computer science

UGotMe: An Embodied System for Affective Human-Robot Interaction

تقدم هذه الورقة نظام UGotMe، وهو نظام تفاعل عاطفي متجسد بين الإنسان والروبوت مصمم للمحادثات متعددة الأطراف يتغلب على تحديات الضوضاء البيئية وزمن الاستجابة في الوقت الفعلي من خلال استخراج الوجه النشط ونقل البيانات الفعال، وقد تم التحقق من صحته على الروبوت البشري Ameca.

Peizhen Li, Longbing Cao, Xiao-Ming Wu, Xiaohan Yu, Runze Yang2026-03-18
💻 computer science

GeoFIK: A Fast and Reliable Geometric Solver for the IK of the Franka Arm based on Screw Theory Enabling Multiple Redundancy Parameters

تقدم هذه الورقة GeoFIK، وهو حلل تحليلي سريع وموثوق للحركية العكسية لذراع الروبوت Franka المكون من 7 درجات حرية بناءً على نظرية البرغي، والذي يتعامل بفعالية مع إزاحات الوصلات، ويحدد النقاط المنفردة، ويمكّن من حل الفائض المرن من خلال معاملات مثل زاوية الدوران (swivel angle).

Pablo C. Lopez-Custodio, Yuhe Gong, Luis F. C. Figueredo2026-03-18
💻 computer science

Real-World Deployment of Cloud-based Autonomous Mobility Systems for Outdoor and Indoor Environments

تقدم هذه الورقة إطار عمل التنقل المستقل القائم على السحابة (CAM)، الذي يدمج مستشعرات البنية التحتية الموزعة مع التنسيق على مستوى السحابة للتغلب على قيود الاستشعار على متن المركبات وتعزيز سلامة ومتانة الأنظمة ذاتية القيادة في البيئات الخارجية والداخلية المعقدة.

Yufeng Yang, Minghao Ning, Keqi Shu, Aladdin Saleh, Ehsan Hashemi, Amir Khajepour2026-03-18
🤖 AI

No More Blind Spots: Learning Vision-Based Omnidirectional Bipedal Locomotion for Challenging Terrain

تقدم هذه الورقة إطار عمل تعلم مبتكر يتيح حركة ثنائية الأرجل شاملة الاتجاهات تعتمد على الرؤية في التضاريس الصعبة من خلال الجمع بين متحكم أعمى قوي وسياسة معلم-طالب مدربة على بيانات معززة بالضجيج، مما يتغلب بفعالية على التكاليف الحسابية العالية للتعلم التعزيزي التقليدي من المحاكاة إلى الواقع.

Mohitvishnu S. Gadde, Pranay Dugar, Ashish Malik, Alan Fern2026-03-18
💻 computer science

SHaRe-RL: Structured, Interactive Reinforcement Learning for Contact-Rich Industrial Assembly Tasks

يُعد SHaRe-RL إطار عمل تفاعلياً مهيكلاً للتعلم التعزيزي يجمع بين بدائيات المناولة، والبيانات التجريبية البشرية، والامتثال لكل محور لتمكين التعلم عبر الإنترنت الآمن وعالي الكفاءة في عدد العينات لمهام التجميع الصناعية عالية الدقة والغنية بالتلامس في بيئات الإنتاج متنوعة المنتجات ومنخفضة الحجم.

Jannick Stranghöner, Philipp Hartmann, Marco Braun, Sebastian Wrede, Klaus Neumann2026-03-18
💻 computer science

BiGraspFormer: End-to-End Bimanual Grasp Transformer

تقدم الورقة البحثية BiGraspFormer، وهو إطار عمل موحد قائم على المحولات (transformer) يعمل من طرف إلى طرف، يستخدم استراتيجية التوجيه الأحادي ثنائي اليد (SGB) لتوليد قبضات ثنائية اليد منسقة مباشرة من السحب النقطية للأجسام، مما يتغلب بفعالية على قيود الطرق الحالية ذات المراحل المنفصلة من خلال تقليل تعقيد البحث وضمان معالجة متوازنة وخالية من الاصطدامات.

Kangmin Kim, Seunghyeok Back, Geonhyup Lee, Sangbeom Lee, Sangjun Noh, Kyoobin Lee2026-03-18
🤖 AI

EfficientNav: Towards On-Device Object-Goal Navigation with Navigation Map Caching and Retrieval

يُمكِّن EfficientNav الملاحة في الأجهزة ذاتها للوصول إلى أهداف كائنية دون تدريب مسبق (zero-shot) عبر الجمع بين استرجاع الذاكرة المدرك للدلالات لتعزيز أداء النماذج اللغوية الكبيرة الصغيرة، وبين التخزين المؤقت للذاكرة المنفصلة والتجميع القائم على الانتباه لتقليل زمن تخطيط المسار بشكل كبير، محققاً بذلك معدلات نجاح فائقة واستدلالاً أسرع مقارنة بالنماذج المرجعية القائمة على سحابة GPT-4.

Zebin Yang, Sunjian Zheng, Tong Xie, Tianshi Xu, Bo Yu, Fan Wang, Jie Tang, Shaoshan Liu, Meng Li2026-03-18
💻 computer science

Dual-Agent Reinforcement Learning for Adaptive and Cost-Aware Visual-Inertial Odometry

تقترح هذه الورقة إطار عمل للتعلم التعزيزي ثنائي الوكيل لتقدير المسار البصري-القصوري، يقوم بالتحكم التكيفي في الواجهة الأمامية البصرية ودمج تقديرات الحالة لتحقيق توازن متفوق بين الدقة والكفاءة والذاكرة، متفوقاً بذلك على الأنظمة الحالية القائمة على وحدة معالجة الرسومات في السرعة واستخدام الذاكرة مع الحفاظ على دقة مسار تنافسية.

Feiyang Pan, Shenghe Zheng, Chunyan Yin, Guangbin Dou2026-03-18
💻 computer science

Vision-Language Models for Infrared Industrial Sensing in Additive Manufacturing Scene Description

تقدم هذه الورقة VLM-IRIS، وهو إطار عمل يعتمد على التعلم الصفري (zero-shot) يعمل على تطويع النماذج الرؤية-اللغوية القائمة على CLIP لتناسب الاستشعار الصناعي بالأشعة تحت الحمراء عبر تحويل الصور الحرارية إلى تمثيلات متوافقة مع نظام RGB، مما يتيح الكشف الدقيق عن قطع العمل في التصنيع الإضافي دون الحاجة إلى إعادة تدريب النموذج أو استخدام مجموعات بيانات مصنفة.

Nazanin Mahjourian, Vinh Nguyen2026-03-18