💻 computer science

LiDAR-based Crowd Navigation with Visible Edge Group Representation

تقترح هذه الورقة إطار عمل للملاحة في الحشود يعتمد على تقنية ليدار (LiDAR) باستخدام تمثيل مبسط لمجموعات الحواف المرئية يحقق مستويات مماثلة من السلامة والبعد الاجتماعي لطرق التتبع المعقدة في الحشود الكثيفة، مع توفير سرعة أكبر في الحوسبة ومتانة تجاه حالات الاحتجاب.

Allan Wang, Aaron Steinfeld2026-04-21
💻 computer science

Greedy Kalman-Swarm: Improving State Estimation in Robot Swarms in Harsh Environments

تقدم هذه الورقة البحثية "Greedy Kalman-Swarm"، وهو إطار عمل لتقدير الحالة بشكل لامركزي يُمكّن أسراب الروبوتات من تحقيق تنسيق جماعي عالي الدقة في البيئات القاسية والمقيدة بالاتصالات، وذلك عبر الاستفادة من التكامل الجشع (greedy integration) لبيانات الجيران محلياً بدلاً من الاعتماد على المعالجة المركزية أو الإجماع العالمي.

Phunyapa Suksomboon, Paulo Garcia2026-04-21
💻 computer science

Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction

تقدم هذه الورقة COIN، وهو معيار مرجعي شامل يتكون من 50 مهمة تفاعلية، ومجموعة بيانات واسعة النطاق يتم التحكم فيها عن بُعد، ومقاييس تقييم منهجية للكشف عن القيود الحرجة للوكلاء المجسدين الحاليين في أداء الاستنتاج طويل الأمد المعتمد على السببية بسبب الفجوات بين الفهم البصري والتنفيذ الحركي.

Xianhao Wang, Xiaojian Ma, Haozhe Hu, Rongpeng Su, Yutian Cheng, Zhou Ziheng, Hangxin Liu, Lei Liu, Bin Li, Qing Li2026-04-21
💻 computer science

Leveraging VR Robot Games to Facilitate Data Collection for Embodied Intelligence Tasks

تقدم هذه الورقة إطار عمل للواقع الافتراضي القائم على التلعيب والمبني على محرك "يونيتي"، والذي يتيح جمع البيانات بشكل قابل للتوسع وفعال من حيث التكلفة للذكاء المتجسد عبر الجمع بين التوليد الإجرائي للمشاهد، والتحكم في الروبوت، والتقييم التلقائي، كما تم التحقق من ذلك من خلال نموذج أولي لالتقاط ووضع النفايات أظهر تغطية واسعة للحالات والأفعال.

Yihan Zhang, Ziyun Huang, Linqi Ye2026-04-21
💻 computer science

Web-Gewu: A Browser-Based Interactive Playground for Robot Reinforcement Learning

تقدم الورقة البحثية Web-Gewu، وهي منصة تفاعلية قائمة على المتصفح تستخدم بنية WebRTC (سحابة-حافة-عميل) لنقل عمليات محاكاة الفيزياء وتدريب التعلم المعزز إلى عقد الحافة، مما يتيح تعليماً في مجال الروبوتات منخفض التكلفة، وقابلاً للتوسع، وخالياً من الحاجة للتثبيت مع عرض مرئي في الوقت الفعلي.

Kaixuan Chen, Linqi Ye2026-04-21
🤖 machine learning

BOIL: Learning Environment Personalized Information

تقدم هذه الورقة طريقة BOIL، وهي طريقة قابلة للتوسع تستفيد من خوارزمية PageRank وتعظيم المعلومات المشتركة لاستخراج رؤى بيئية لتوجيه الأنظمة متعددة الوكلاء نحو أداء فائق طويل الأمد في المهام المعقدة مثل التغطية والدورية، متفوقة بذلك على النهج الاستدلالي التقليدي.

Rohan Patil, Henrik I. Christensen2026-04-21
💻 computer science

Shepherding UAV Swarm with Action Prediction Based on Movement Constraints

تقترح هذه الورقة طريقة تحكم مبتكرة مستوحاة من كلاب الرعي لأسراب الطائرات بدون طيار، تعزز كفاءة التوجيه والسلامة من خلال التنبؤ بسلوك السرب المستقبلي تحت قيود الحركة واختيار إجراءات الملاح المثلى باستخدام إطار عمل قائم على نهج النافذة الديناميكية.

Yusuke Tsunoda, Yusuke Goto, Takao Sato2026-04-21
💻 computer science

GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning

يُعد GaLa إطار عمل جديدًا للرؤية واللغة يعزز التخطيط الإجرائي في الذكاء الاصطناعي المتجسد من خلال تقديم تمثيل قائم على الرسم البياني الفائق ومشفر "TriView HyperGraph" لالتقاط العلاقات المكانية الضمنية والبنى الدلالية العميقة بشكل صريح، مما يجعله يتفوق بشكل كبير على الأساليب الحالية في معايير ActPlan1K وALFRED.

Kun Wang, Yiming Li, Mingcheng Qu, Aqiang Zhang, Guang Yang, Tonghua Su2026-04-21
💬 NLP

Seeing Isn't Believing: Mitigating Belief Inertia via Active Intervention in Embodied Agents

تقدم هذه الورقة آلية التقدير-التحقق-التحديث (EVU)، وهي إطار عمل للتدخل النشط في المعتقدات يُمكّن الوكلاء المتجسدين من التنبؤ بالمعتقدات الداخلية والتحقق منها وتحديثها مقابل الملاحظات البيئية، مما يؤدي بفعالية إلى تخفيف قصور الذاتي في المعتقدات وتحسين معدلات نجاح المهام بشكل كبير عبر معايير قياسية متعددة.

Hanlin Wang, Chak Tou Leong, Jian Wang, Wenjie Li2026-04-21
💻 computer science

A Rapid Deployment Pipeline for Autonomous Humanoid Grasping Based on Foundation Models

تقدم هذه الورقة مساراً للنشر السريع من الطرف إلى الطرف يستفيد من النماذج التأسيسية للتعليق التوضيحي التلقائي، وإعادة البناء ثلاثي الأبعاد، وتتبع الوضعية بصفر من الأمثلة (zero-shot)، وذلك لتقليل وقت التهيئة لمهام الإمساك البشرية الجديدة من أيام إلى حوالي 30 دقيقة مع تحقيق دقة عالية وتنفيذ ناجح في العالم الحقيقي.

Yifei Yan, Yankai Liao, Linqi Ye2026-04-21