💻 computer science

Phantom: Training Robots Without Robots Using Only Human Videos

تقدم الورقة البحثية "Phantom"، وهو إطار عمل قابل للتوسع يتيح التدريب بنمط "الصفر محاولة" (zero-shot) لروبوتات المناولة متعددة الأغراض باستخدام فيديوهات العروض البشرية فقط عبر تحويلها إلى بيانات متوافقة مع الروبوت من خلال تقدير وضعية اليد ومحاذاة النطاق البصري، محققةً معدلات نجاح عالية في مهام متنوعة دون الحاجة إلى أي بيانات روبوتية أو ضبط دقيق.

Marion Lepert, Jiaying Fang, Jeannette Bohg2026-05-29
💻 computer science

Follow Everything: A Leader-Following and Obstacle Avoidance Framework with Goal-Aware Adaptation

تقدم هذه الورقة إطار عمل موحداً لعملية التبعية القوية للقائد، والتي تستخدم الكشف القائم على التجزئة للتعامل مع أشكال القائد التعسفية وآلية تكيف واعية بالهدف مع تخطيط قائم على الرسوم البيانية لضمان التتبع المستمر وتجنب العوائق حتى عندما يغادر القائد مجال رؤية الروبوت مؤقتاً.

Qianyi Zhang, Shijian Ma, Boyi Liu, Jianhao Jiao, Dimitrios Kanoulas2026-05-29
💻 computer science

Masquerade: Learning from In-the-wild Human Videos using Data-Editing

يعالج Masquerade مشكلة ندرة بيانات الروبوتات من خلال تحرير فيديوهات بشرية من الواقع لتخليق عروض توضيحية للروبوت عبر طلاء الذراع (inpainting) وتراكب الروبوت (robot overlay)، مما يتيح استراتيجية تدريب مشترك تتفوق بشكل كبير على الأساليب الحالية في المهام ثنائية اليد طويلة المدى.

Marion Lepert, Jiaying Fang, Jeannette Bohg2026-05-29
🤖 machine learning

Contrastive Representation Regularization for Vision-Language-Action Models

تقدم هذه الورقة البحثية فقدان التباين المدرك لحالة الروبوت (RS-CL)، وهو تقنية خفيفة الوزن لتنظيم التمثيل تعمل على محاذاة تمثيلات نماذج الرؤية واللغة والعمل مع حالات الاستقبال الحسي الخاص بالروبوت، مما يحسن الأداء بشكل كبير في كل من معايير الاختبار للمناولة في البيئات المحاكية والواقعية.

Taeyoung Kim, Jimin Lee, Myungkyu Koo, Dongyoung Kim, Kyungmin Lee, Changyeon Kim, Younggyo Seo, Jinwoo Shin2026-05-29
💻 computer science

A Sliding-Window Filter for Online Continuous-Time Continuum Robot State Estimation

تقدم هذه الورقة أول مرشح نافذة منزلقة عشوائي للروبوتات المستمرة، والذي يتيح تقديرًا دقيقًا ومباشرًا للحالة في الوقت المستمر مع العمل بسرعات تفوق الوقت الفعلي، متجاوزًا بذلك قيود التقريبات الحالية ذات الوقت المنفصل والطرق غير المتصلة بالإنترنت.

Spencer Teetaert, Sven Lilge, Jessica Burgner-Kahrs, Timothy D. Barfoot2026-05-29
💻 computer science

Dual-Stream Diffusion for World-Model Augmented Vision-Language-Action Model

تقترح الورقة البحثية DUST، وهو إطار عمل انتشار ثنائي المسار يعزز نماذج الرؤية واللغة والعمل بنماذج العالم للتغلب على الفجوات بين الوسائط وتحسين تعلم سياسة الروبوت، محققاً مكاسب أداء كبيرة في كل من المهام المحاكية والواقعية من خلال التعلم السببي عبر الوسائط وأخذ العينات غير المتزامن.

John Won, Kyungmin Lee, Huiwon Jang, Dongyoung Kim, Jinwoo Shin2026-05-29
💻 computer science

SurfFill: Completion of LiDAR Point Clouds via Gaussian Surfel Splatting

تُعد SurfFill طريقة مبتكرة لإكمال السحابة النقطية لتقنية ليدار (LiDAR) تستفيد من تقنية "Gaussian surfel splatting" لتحديد وتكثيف المناطق الغامضة الناتجة عن تباعد الحزم، مما يجمع بفعالية بين الدقة الهندسية لتقنية ليدار واستعادة التفاصيل القائمة على الكاميرا للتفوق على تقنيات إعادة البناء الحالية.

Svenja Strobel, Matthias Innmann, Bernhard Egger, Marc Stamminger, Linus Franke2026-05-29
💻 computer science

Sentinel-VLA: A Metacognitive VLA Model with Active Status Monitoring for Dynamic Reasoning and Error Recovery

يُعد Sentinel-VLA نموذجاً رؤيوياً-لغوياً-حركياً فوق معرفي يتميز بوحدة مراقبة حالة نشطة للتحليل الديناميكي عند الطلب والتعافي من الأخطاء، وقد تم تدريبه على بيانات مُولدة تلقائياً وتعزيزه بخوارزمية تعلم مستمر ذاتي التطور لتحقيق تحسن في معدل النجاح بنسبة 30% مقارنة بالنماذج الرائدة.

Wenhao Li, Xiu Su, Dan Niu, Yichao Cao, Hongyan Xu, Zhe Qu, Lei Fan, Shan You, Chang Xu2026-05-29
💻 computer science

VLA-ATTC: Adaptive Test-Time Compute for VLA Models with Relative Action Critic Model

تقدم هذه الورقة البحثية إطار عمل VLA-ATTC، الذي يعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) عبر حوسبة تكيفية في وقت الاختبار من خلال "قابض معرفي" (cognitive clutch) قائم على عدم اليقين، وناقد عمل نسبي (Relative Action Critic) مبتكر للاختيار بين أزواج من الأفعال، مما يقلل بشكل كبير من معدلات الفشل في مهام المناولة المعقدة دون الحاجة إلى توصيف يدوي.

Wenhao Li, Xiu Su, Yichao Cao, Hongyan Xu, Xiaobo Xia, Shan You, Yi Chen, Chang Xu2026-05-29
🤖 machine learning

Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning

تقدم الورقة البحثية خوارزمية التعلم المعزز غير المتصل بالإنترنت "التعلم بـ Q المشروط بالضجيج والمثبت بالتدفق" (FAN)، وهي خوارزمية فعالة للتعلم المعزز غير المتصل بالإنترنت تحقق أداءً رائدًا في المهام الروبوتية من خلال تحسين سياسات التدفق والنقاد التوزيعيين لتتطلب تكرارًا واحدًا وعينة ضجيج واحدة فقط، مما يقلل بشكل كبير من التكاليف الحسابية دون التضحية بالدقة.

Sungyoung Lee, Dohyeong Kim, Eshan Balachandar, Zelal Su Mustafaoglu, Keshav Pingali2026-05-29