💻 computer science

In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use

تقدم هذه الورقة البحثية **In-Context VLA**، وهو إطار عمل يعزز نماذج الرؤية واللغة والعمل (Vision-Language-Action) عبر استبدال توليد سلسلة الأفكب (chain-of-thought) حرة التنسيق بالتدريب اللاحق في السياق (in-context post-training) على أدلة إدراكية مهيكلة واستخدام الأدوات الوكيلية (agentic tool use)، مما يتيح استهلاكاً لغوياً مُرتبطاً بالواقع من أجل تحكم فائق في المستويات الدنيا وأداءً رائدًا عبر مهام المحاكاة والتلاعب في العالم الحقيقي.

Jiarui Yang, Wen Huang, Jiale Zhang, Maowei Hu, Hang Guo2026-08-07
🤖 AI

SkillMemo: Expert-guided Skill Memory Framework for Compositional Embodied Manipulation

يُعد SkillMemo إطار عمل موجَّهًا بالخبرة يعمل على تعزيز التعميم التركيبي في النماذج البصرية الحركية المتجسدة عبر تفكيك المسارات طويلة الأمد ضمنيًا إلى مهارات ذرية كامنة من خلال بنية "خليط من الخبراء"، ودمجها في بنك ذاكرة عرضية ديناميكي لتوفير أولويات سياقية قوية للتنبؤ بالأفعال.

Changyuan Wang, Chubin Zhang, Zhenyu Wu, Runhao Li, Angyuan Ma, Ke Chao, Yinan Liang, Xiuwei Xu, Ziwei Wang, Yansong Tan (…)2026-08-07
🤖 AI

TRACE: Learned Proprioceptive Odometry for Legged Robots under Unreliable Contact Conditions

تقدم هذه الورقة البحثية TRACE، وهو مُقدِّر لتقدير قياس المسافات الحركي (proprioceptive odometry) مُتعلم من الطرف إلى الطرف للروبوتات ذات الأرجل، والذي يستخدم وحدة انتباه تقاطعي مدركة للقدم وأهداف تدريب مستوحاة من الفيزياء لتحقيق تقدير قوي للموقع والسرعة في ظل ظروف التلامس غير الموثوقة والتضاريس المتنوعة.

Taehyeon Kong, Woojin Kim, Jemin Hwangbo2026-08-07
💻 computer science

Beyond Flat Policies: Hierarchical Post-Training for Embodied Agents in Robotic Manipulation

تقترح هذه الورقة إطار عمل HiRoC، وهو إطار عمل هرمي لما بعد التدريب يعمل على فصل تخطيط المهام رفيع المستوى عن تنفيذ الإجراءات منخفض المستوى للتغلب على قيود السياسات المسطحة في نماذج الرؤية واللغة والعمل، مما يتيح معالجة روبوتية قوية طويلة المدى من خلال التوجيه الدلالي الصريح والتعلم التعزيزي.

He Kong, Zengjue Chen, Qi Wang, Qianli Xing, Runliang Niu, Peidong Liu, Jiawei Li, Shiqi Wang, Yi Chang2026-08-07
💻 computer science

Adaptive-WAM: Quality-Guided Early-Exit Planning from Intermediate Video-Diffusion Features

يُعد Adaptive-WAM إطار عمل للتخطيط القائم على الخروج المبكر والموجه بالجودة، والذي يستفيد من الميزات الوسيطة لنماذج انتشار الفيديو لتخصيص العمق الحسابي ديناميكيًا، محققًا بذلك أداءً رائدًا في القيادة الذاتية مع تقليل زمن الاستجابة بشكل كبير عبر تجاوز عملية توليد الفيديو التكرارية.

Sining Ang, Yuguang Yang, Yan Wang2026-08-07
🤖 AI

Visual Grounding in Zero-Shot Vision-Language Control

تُثبت هذه الورقة أنه في حين تفشل نماذج الرؤية واللغة الحالية غالباً كأدوات تحكم أحادية متكاملة في وضع الصفر (zero-shot) بسبب الافتقار إلى التجذر البصري الحقيقي، إلا أنها يمكن أن تعمل بفعالية كمساعدين محددين وانتقائيين للمخاطر عند تعزيزها بحراس نمطيين يعتمدون على إجماع التماثل للتحقق من الأدلة البصرية وفرض التكافؤ.

J. de Curtò, Dayani Plasencia, Diego Sánchez, I. de Zarzà2026-08-07
💻 computer science

Design and Evaluation of a Touchscreen-Based Teleoperation Interface for Robotic Manipulators

تقدم هذه الدراسة وتقيم واجهة تشغيل عن بُعد جديدة تعتمد على شاشة اللمس للمناولات الروبوتية، والتي تُظهر، من خلال دراسة مستخدم مقارنة، تحسناً ملحوظاً في كفاءة المهام، والدقة، وتقليل العبء المعرفي مقارنة بعناصر التحكم التقليدية عبر عصا التحكم في مهام تلامس الأسطح النووية المحاكات.

Juan José García Cárdenas, Alperen Kenan, Hamidreza Raei, Paul Bremner, Manuel Giuliani, Arash Ajoudani, Adriana Tapus2026-08-07
🤖 machine learning

Robot Learning from Human Demonstrations: Handwritten Alphabet Trajectories and Human-Likeness Evaluation

تقدم هذه الورقة إطار عمل مفتوح المصدر لتعلم حركة الروبوت الشبيهة بالبشر من مجموعة بيانات كبيرة من نماذج الحروف الأبجدية المكتوبة بخط اليد، وذلك عبر توسيع نماذج الخليط الغاوسي لتشمل أبعاد القوة والزمن، وهو ما تم التحقق من صحته من خلال دراسة مستخدم أظهرت أن المسارات المتولدة تُدرك على أنها شبيهة بالبشر بشكل كبير.

Alperen Kenan, Paul Bremner, Manuel Giuliani2026-08-07
💻 computer science

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

يُعد GeniWorld نموذجاً عالمياً تفاعلياً للنماذج العالمية لعمليات المناولة الروبوتية، حيث يستفيد من تمثيلات الأفعال البصرية القائمة على تنسيق (URDF) والسينماتيكا المنفصلة لتحقيق تعميم قوي صفري في بيئات غير مرئية، ليعمل كمقيم قابل للتوسع للسياسات ومولد للبيانات بهدف تحسين أداء الروبوتات في المهام اللاحقة.

Chenghao Gu, Hanyang Yu, Jingbo Zhang, Haitao Lin, Wenyao Zhang, Jinghe Wang, Hanglei Jin, Shuzhao Xie, Jingyan Jiang, Z (…)2026-08-07
🤖 AI

Curiosity-Diffuser: Curiosity Guide Diffusion Models for Reliability

تقدم هذه الورقة البحثية Curiosity-Diffuser، وهي طريقة تعزز موثوقية سياسات التقليد الروبوتية باستخدام وحدة تقطير الشبكة العشوائية (RND) لتوجيه نماذج الانتشار الشرطية نحو توليد مسارات ذات فضول أقل، مما يقلل من الهلوسة والتعميم المفرط مع مواءمة السلوكيات بشكل وثيق مع بيانات التدريب.

Zihao Liu, Xing Liu, Yuhang Dong, Haitao Chang, Zhengxiong Liu, Panfeng Huang2026-08-06