🤖 machine learning

ViTaPEs: Visuotactile Position Encodings for Cross-Modal Alignment in Multimodal Transformers

تقدم الورقة البحثية ViTaPEs، وهي بنية قائمة على المحولات (transformer) تستخدم استراتيجية ترميز موضعي مبتكرة ثنائية المرحلة لدمج الوسائط البصرية واللمسية بفعالية، محققةً أداءً هو الأفضل في فئتها وقدرة على التعميم الصفري عبر مهام التعرف والإمساك الروبوتي المتنوعة دون الاعتماد على نماذج الرؤية واللغة سابقة التدريب.

Fotios Lygerakis, Ozan Özdenizci, Elmar Rückert2026-03-10
🤖 machine learning

ActivePusher: Active Learning and Planning with Residual Physics for Nonprehensile Manipulation

يُعد ActivePusher إطار عمل مبتكر يعزز كفاءة البيانات وموثوقية التخطيط في عمليات المناولة غير القابضة من خلال الجمع بين نمذجة الفيزياء المتبقية والتعلم النشط القائم على عدم اليقين لتحديد أولويات جمع البيانات المعلوماتية وتوجيه أخذ عينات التحكم نحو إجراءات أكثر موثوقية.

Zhuoyun Zhong, Seyedali Golestaneh, Constantinos Chamzas2026-03-10
💻 computer science

Unsupervised Discovery of Failure Taxonomies from Deployment Logs

تقدم هذه الورقة نهجاً غير خاضع للإشراف يستفيد من الاستدلال بين الرؤية واللغة والتجميع لاكتشاف تصنيفات متماسكة دلالياً للأعطال تلقائياً من سجلات النشر الروبوتية واسعة النطاق، مما يتيح تحليل الأعطال القابل للتوسع، وجمع البيانات المستهدف، وتحسين المراقبة أثناء التشغيل عبر مجالات متنوعة.

Aryaman Gupta, Yusuf Umut Ciftci, Somil Bansal2026-03-10
💻 computer science

Context Matters! Relaxing Goals with LLMs for Feasible 3D Scene Planning

يقدم البحث إطار عمل ContextMatters، الذي يجمع بين النماذج اللغوية الكبيرة والتخطيط الكلاسيكي لتخفيف الأهداف ديناميكياً بناءً على سياق البيئة، مما يحسن بشكل كبير معدلات نجاح التخطيط للمشاهد ثلاثية الأبعاد ويمكّن من النشر الناجح للروبوتات في العالم الحقيقي.

Emanuele Musumeci, Michele Brienza, Francesco Argenziano, Abdel Hakim Drid, Vincenzo Suriani, Daniele Nardi, Domenico D. (…)2026-03-10
🤖 machine learning

DemoDiffusion: One-Shot Human Imitation using pre-trained Diffusion Policy

تُعد DemoDiffusion طريقة تعلم تقليد من محاولة واحدة تُمكّن الروبوتات من أداء مهام مناولة متنوعة عبر الاستفادة من إعادة التوجيه الكينماتيكي لاستخلاص مسار تقريبي من عرض بشري واحد وتطويره باستخدام سياسة انتشار مدربة مسبقاً لضمان التوافق مع أفعال الروبوت المعقولة، مما يحقق معدلات نجاح أعلى بكثير من النهج المرجعية دون الحاجة إلى تدريب خاص بالمهمة أو بيانات مقترنة.

Sungjae Park, Homanga Bharadhwaj, Shubham Tulsiani2026-03-10
💻 computer science

Query-Based Adaptive Aggregation for Multi-Dataset Joint Training Toward Universal Visual Place Recognition

تقترح هذه الورقة تقنية التجميع التكيفي القائم على الاستعلام (QAA)، وهي تقنية مبتكرة لتجميع الميزات تستخدم استعلامات متعلمة ككتب رموز مرجعية لمعالجة التباينات في مجموعات البيانات بفعالية في التدريب المشترك متعدد المجموعات، مما يحقق التعرف البصري العالمي القوي على الأماكن مع توازن في التعميم وأداء يضاهي أحدث ما توصل إليه العلم.

Jiuhong Xiao, Yang Zhou, Giuseppe Loianno2026-03-10
⚡ electrical engineering

Classification of Driver Behaviour Using External Observation Techniques for Autonomous Vehicles

تقدم هذه الدراسة إطار عمل مبتكر للرؤية الحاسوبية يستخدم تقنيات المراقبة الخارجية، بما في ذلك كشف الأشياء القائم على نموذج YOLO ومراقبة المسارات، لتصنيف سلوكيات السائقين المشتتين والمختلين في المركبات غير المتصلة دون الاعتماد على الاتصال بين المركبات.

Ian Nell, Shane Gilroy2026-03-10
💻 computer science

GeoAware-VLA: Implicit Geometry Aware Vision-Language-Action Model

يعزز GeoAware-VLA من قدرة نماذج الرؤية واللغة والعمل (Vision-Language-Action) على تعميم وجهات النظر من خلال دمج ميزات من نموذج رؤية هندسي مسبق التدريب ومجمد عبر طبقة إسقاط خفيفة الوزن، محققاً تحسينات كبيرة في أداء التعلم الصفري (zero-shot) على وضعيات الكاميرا غير المرئية عبر كل من اختبارات المحاكاة ومنصات الروبوتات في العالم الحقيقي دون الحاجة إلى بيانات تدريب ثلاثية الأبعاد صريحة.

Ali Abouzeid, Malak Mansour, Qinbo Sun, Zezhou Sun, Dezhen Song2026-03-10
💻 computer science

Compose by Focus: Scene Graph-based Atomic Skills

تقدم هذه الورقة إطار عمل يعتمد على مخطط المشهد (scene graph) يعمل على تعزيز التعميم التركيبي للروبوتات العامة عبر تعلم مهارات ذرية قوية ومركزة بواسطة الشبكات العصبية الرسومية ونماذج الانتشار، والتي يتم تنسيقها لاحقاً بواسطة مخطط نموذج لغوي بصري لتحقيق أداء فائق في المهام المعقدة طويلة الأمد.

Han Qi, Changhe Chen, Heng Yang2026-03-10
🤖 machine learning

ORN-CBF: Learning Observation-conditioned Residual Neural Control Barrier Functions via Hypernetworks

تقترح هذه الورقة ORN-CBF، وهو إطار تعلم قائم على الشبكة الفائقة (hypernetwork) يستخدم تحليل الوصول لهاميلتون-جاكوبي لتوليد دوال حاجز عصبية مشروطة بالملاحظة، مما يضمن ضمانات سلامة صارمة وتحسيناً في التعميم في البيئات ذات الإدراك الجزئي من خلال تجارب المحاكاة والأجهزة.

Bojan Derajić, Sebastian Bernhard, Wolfgang Hönig2026-03-10