🤖 machine learning

Accelerating Visual Policy Learning with Sampling-Based Model Predictive Control

تقترح هذه الورقة البحثية "البحث عن السياسة الموجه بالعينات" (SGPS)، وهو إطار عمل يجمع بين التحكم التنبئي بالنموذج القائم على أخذ العينات وتحسين السياسة من الدرجة الأولى لتدريب السياسات البصرية بكفاءة لمهام الحركة والتلاعب المعقدة للروبوتات، محققاً انتقالاً صفري الاستباق إلى الأجهزة الواقعية.

Yilang Liu, Haoxiang You, Qian Wang, Daniel Rakita, Ian Abraham2026-09-18
💻 computer science

Bayesian Continuum Robot Dynamics and State Estimation

تقدم هذه الورقة إطاراً بايزياً يقرب ديناميكيات قضيب كوسيرا عبر إعادة صياغة التأثيرات العطالية والتخميدية كأحمال مكافئة، مما يتيح تقديراً دقيقاً لحالة المفاصل واستنتاج الأحمال الخارجية للروبوتات المستمرة أثناء الحركات الديناميكية حيث تفشل الطرق شبه الساكنة التقليدية.

James M. Ferguson, Tucker Hermans, Alan Kuntz2026-09-18
💻 computer science

TraceFlow: Guiding Frozen Flow-Matching Robot Policies with Success and Failure Traces

يقدم TraceFlow طريقة توجيه في وقت الاختبار تعزز سياسات الروبوت القائمة على مطابقة التدفق المجمدة من خلال الاستفادة من حقل تصحيح متوافق مع التقدم مستمد من مسارات التنفيذ الناجحة والفاشلة المخزنة في TraceBank، مما يحسن بشكل كبير معدلات نجاح المهام في اختبارات التعبئة الواقعية ومعايير محاكاة محددة دون الحاجة إلى أي تحديثات لأوزان النموذج.

Jiaxuan Zhang, Ruizhe Liu, Yu Zhang, Yanchao Yang2026-09-18
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

يقدم HIL-UMI إطار عمل يعتمد على وجود الإنسان في الحلقة (human-in-the-loop) وخالٍ من الروبوتات لتدريب نماذج الرؤية واللغة والعمل (Vision-Language-Action) ما بعد التدريب، والذي يستفيد من واجهة تلاعب عالمية محمولة يدوياً ودرجة طاقة موجهة بالسياسة لجمع بيانات مستهدفة بكفاءة وتحسين مقدِّرات الميزة، مما يتغلب على قيود الضبط الدقيق الخاضع للإشراف الثابت ويُمكِّن من التحسين التكراري القابل للتوسع دون الحاجة لنشر روبوتات فيزيائية.

Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai L (…)2026-09-18
🤖 AI

FAMOS: Feed-Forward 3D Articulation Modeling from Sparse Observations

إن FAMOS هو نموذج تغذية أمامية يتنبأ بمعلمات التمفصل ثلاثية الأبعاد وتجزئة الأجزاء المتحركة من سحب نقطية جزئية غير مرتبة وغير منتظمة، وذلك عبر التفكير المشترك في ملاحظات متعددة من خلال محول تمفصل متعدد الحالات والاستفادة من مولد بيانات إجرائي للتغلب على قيود مجموعة البيانات.

Kevin Qu, Tao Sun, Massimiliano Viola, Liyuan Zhu, Zhizhuo Zhou, Sayan Deb Sarkar, Konrad Schindler, Iro Armeni2026-09-18
🤖 AI

Workspace Models: Lightweight Robotic Memory via Saliency-Driven Supervision

تقدم هذه الورقة "رموز مساحة العمل" (workspace tokens)، وهي تمثيل ذاكرة كامنة خفيف الوزن يتم تدريبه عبر إشراف مدفوع بالأهمية النسبية (saliency-driven supervision) من نماذج الرؤية واللغة الكبيرة (VLMs)، مما يمكّن السياسات الروبوتية من حل مهام الذاكرة طويلة المدى بكفاءة عند التشغيل دون الحاجة إلى استدلال من نماذج الرؤية واللغة أثناء العمل، مع تحسين الأداء العام أيضاً.

Nitish Dashora, Douglas Chen, Idan Shenfeld, John Marangola, Pulkit Agrawal, Max Simchowitz2026-09-18
⚡ electrical engineering

Towards smart and adaptive agents for active sensing on edge devices

تقدم هذه الورقة نظاماً وكيلياً مدمجاً قائماً على الاستدلال النشط، يتيح الاستشعار النشط التكيفي في الوقت الفعلي على الأجهزة الطرفية ذات الموارد المحدودة، وذلك من خلال السماح لها بالتخطيط والتحكم الديناميكي في حركات الكاميرا للتغلب على قيود نهج تعلم الآلة الصغير (TinyML) التقليدي.

Devendra Vyas, Nikola Pižurica, Nikola Milović, Igor Jovančević, Miguel de Prado, Tim Verbelen2026-09-17
🤖 AI

SurgRAW: Multi-Agent Workflow with Chain of Thought Reasoning for Robotic Surgical Video Analysis

تقدم هذه الورقة SurgRAW، وهو سير عمل متعدد الوكلاء يستفيد من استدلال سلسلة الأفكوات (Chain-of-Thought) ومعيار جديد (SurgCoTBench) لتحقيق فهم متفوق ومتوافق سريريًا للمشاهد الجراحية الروبوتية من خلال الصفر (zero-shot)، وذلك عبر التغلب على قيود النماذج المنعزلة والنماذج اللغوية البصرية العامة من خلال التعاون الهرمي والتوليد المعزز بالاسترجاع.

Chang Han Low, Ziyue Wang, Tianyi Zhang, Zhu Zhuo, Zhitao Zeng, Evangelos B. Mazomenos, Yueming Jin2026-09-17
💻 computer science

VLEM: Real-Time 3D Vision-Language Embedding Mapping

يُعد VLEM إطار عمل في الوقت الفعلي يدمج تمثيلات لغوية-بصرية ثنائية الأبعاد محاذية للبكسلات من تدفقات RGB-D الخام في تمثيل ثلاثي الأبعاد متسق عالمياً ودقيق مترياً، مما يتيح تجزئة فائقة مفتوحة المجموعة ومعالجة روبوتية تفاعلية دون الحاجة إلى أوضاع حقيقية.

Christian Rauch, Björn Ellensohn, Linus Nwankwo, Vedant Dave, Elmar Rueckert2026-09-17
💻 computer science

End2Race: An End-to-End Learning Framework for Multi-Vehicle Autonomous Racing

تقدم هذه الورقة البحثية End2Race، وهو إطار عمل للتعلم من طرف إلى طرف لسباقات السيارات ذاتية القيادة متعددة المركبات، والذي يحقق زمن استجابة للاستدلال يقل عن ميلي ثانية واحدة ويتفوق على الأساليب القائمة على القواعد وطرق تعلم المركبة الواحدة الموجودة حالياً من خلال إظهار قدرة قوية على التعميم، وسرعات عالية، وتجاوز تكيفي في المنافسات المباشرة وجهاً لوجه.

Zhijie Qiao, Haowei Li, Zhong Cao, Henry X. Liu2026-09-17