💻 computer science

Swim2Real: VLM-Guided System Identification for Sim-to-Real Transfer

يقدم Swim2Real مساراً مبتكراً يستفيد من التغذية الراجعة لنماذج الرؤية واللغة والبحث الخطي المتراجع لمعايرة محاكي سمكة روبوتية مكون من 16 معلماً تلقائياً مباشرة من فيديوهات السباحة، مما يغلق فعلياً فجوة المحاكاة إلى الواقع ويمكّن النقل لتعلم التعزيز صفري الاستباق للروبوتات المائية الفيزيائية دون تحديد يدوي للنظام.

Kevin Qiu, Kyle Walker, Mike Y. Michelis, Marek Cygan, Josie Hughes2026-03-24
💻 computer science

Glove2Hand: Synthesizing Natural Hand-Object Interaction from Multi-Modal Sensing Gloves

تقدم الورقة البحثية Glove2Hand، وهو إطار عمل يقوم بتخليق فيديوهات واقعية لليد العارية من بيانات قفاز استشعار متعدد الوسائط باستخدام نموذج يد قائم على التوزيعات الغاوسية ثلاثية الأبعاد وتقنية استعادة قائمة على الانتشار، مع تقديم مجموعة بيانات HandSense لتعزيز التطبيقات اللاحقة مثل تقدير التلامس وتتبع اليد المحجوبة.

Xinyu Zhang, Ziyi Kou, Chuan Qin, Mia Huang, Ergys Ristani, Ankit Kumar, Lele Chen, Kun He, Abdeslam Boularias, Li Guan2026-03-24
⚡ electrical engineering

OrbitStream: Training-Free Adaptive 360-degree Video Streaming via Semantic Potential Fields

يُعد OrbitStream إطار عمل خالٍ من التدريب للبث التكيفي للفيديو بزاوية 360 درجة في عمليات التحكم عن بُعد، حيث يجمع بين الفهم الدلالي للمشهد ونظرية التحكم القوية لتحقيق تجربة جودة تنافسية ودقة عالية في التنبؤ بمنطقة الرؤية دون الحاجة إلى تدريب قائم على البيانات.

Aizierjiang Aiersilan, Zhangfei Yang2026-03-24
🤖 AI

A Framework for Low-Latency, LLM-driven Multimodal Interaction on the Pepper Robot

تقدم هذه الورقة إطار عمل مفتوح المصدر لنظام أندرويد لروبوت "بيبر" (Pepper) يستخدم نماذج الكلام-إلى-الكلام (Speech-to-Speech) من طرف إلى طرف واستدعاء الوظائف الوكيل (agentic Function Calling) للتغلب على قيود زمن الاستجابة والقيود متعددة الوسائط التي تفرضها المسارات المتتالية التقليدية، مما يتيح تفاعلات تجسدية منخفضة زمن الاستجابة، تعبيرية، ومتكاملة تماماً.

Erich Studerus, Vivienne Jia Zhong, Stephan Vonschallen2026-03-24
💻 computer science

Cortical Policy: A Dual-Stream View Transformer for Robotic Manipulation

تُعد "Cortical Policy" نموذج محول رؤية ثنائي المسار مبتكر يحاكي دمج الدماغ البشري للمعالجة البصرية الثابتة والديناميكية لتعزيز الاستدلال المكاني ثلاثي الأبعاد والتحكم التكيفي في مهام المناولة الروبوتية بشكل كبير.

Xuening Zhang, Qi Lv, Xiang Deng, Miao Zhang, Xingbo Liu, Liqiang Nie2026-03-24
💻 computer science

Dynamic Control Barrier Function Regulation with Vision-Language Models for Safe, Adaptive, and Realtime Visual Navigation

تقدم الورقة البحثية AlphaAdj، وهو إطار عمل للملاحة البصرية في الوقت الفعلي يستفيد من نموذج رؤية-لغة لضبط درجة التحفظ في مرشحات دالة حاجز التحكم بناءً على مدخلات RGB من منظور الشخص الأول بشكل ديناميكي، مما يحقق توازناً فائقاً بين السلامة والكفاءة في البيئات الديناميكية مقارنة بالنهج ذات المعلمات الثابتة.

Jeffrey Chen, Rohan Chandra2026-03-24
🤖 machine learning

Architecture for Multi-Unmanned Aerial Vehicles based Autonomous Precision Agriculture Systems

تقترح هذه الورقة إطار عمل هيكلياً، مستقلاً، وشاملاً من الطرف إلى الطرف لأنظمة الزراعة الدقيقة متعددة الطائرات بدون طيار، يقوم بتنسيق مهام مثل تخطيط المسار ومعالجة الصور مع معالجة القيود الرئيسية لضمان تحمل الأخطاء، والمتانة، وسهولة النشر.

Ebasa Temesgen, Nathnael Minyelshowa, Lebsework Negash2026-03-24
🤖 AI

HyReach: Vision-Guided Hybrid Manipulator Reaching in Unseen Cluttered Environments

تقدم هذه الورقة نظام HyReach، وهو نظام مناور هجين (صلب-لين) مستمر في الوقت الفعلي يدمج بين الإدراك القائم على الرؤية، وإعادة بناء المشهد ثلاثي الأبعاد، والتحكم القائم على التعلم لتحقيق وصول قوي وقابل للتعميم إلى الأجسام في بيئات غير مرئية ومزدحمة بدقة تقل عن 2 سم.

Shivani Kamtikar, Kendall Koe, Justin Wasserman, Samhita Marri, Benjamin Walt, Naveen Kumar Uppalapati, Girish Krishnan (…)2026-03-24
🤖 machine learning

GaussianSSC: Triplane-Guided Directional Gaussian Fields for 3D Semantic Completion

يُعد GaussianSSC إطار عمل لإكمال المشهد الدلالي ثنائي المراحل ومتوافق مع الشبكات (grid-native)، يعمل على تعزيز التمثيلات القائمة على الفوكسل (voxel) من خلال تقديم عملية "الترسيخ الغاوسي" (Gaussian Anchoring) لتحسين المحاذاة بين الصورة والفوكسل، ووحدة "صقل الغاوسي-ثلاثي المستويات الاتجاهي" (directional Gaussian–Triplane Refinement) لالتقاط الخصائص السطحية متباينة الخواص، محققاً بذلك أداءً هو الأفضل في فئته على مقي-اس SemanticKITTI.

Ruiqi Xian, Jing Liang, He Yin, Xuewei Qi, Dinesh Manocha2026-03-24
🤖 machine learning

CataractSAM-2: A Domain-Adapted Model for Anterior Segment Surgery Segmentation and Scalable Ground-Truth Annotation

تقدم الورقة البحثية CataractSAM-2، وهو نموذج متكيف مع النطاق يعتمد على نموذج Segment Anything Model 2، يتيح التجزئة في الوقت الفعلي وعالية الدقة لمقاطع فيديو جراحة الساد (الماء الأبيض) ويسهل عملية ترميز الحقيقة الأرضية القابلة للتوسع من خلال إطار عمل تفاعلي، بينما يُظهر قدرة قوية على التعميم الصفري (zero-shot generalization) للإجراءات العينية الأخرى.

Mohammad Eslami, Dhanvinkumar Ganeshkumar, Saber Kazeminasab, Michael G. Morley, Michael V. Boland, Michael M. Lin, John (…)2026-03-24