💻 computer science

Distributed Model-Based Diffusion For Scalable Multi-Robot Trajectory Optimization

تقترح هذه الورقة نموذج الانتشار الموزع القائم على النموذج (DMBD)، وهو إطار عمل قابل للتوسع يربط بين الخادم والروبوت يعمل على تفكيك مشكلة الاستدلال عالية الأبعاد لتحسين مسار الروبوتات المتعددة إلى عمليات إزالة ضجيج شرطية محلية، مما يتيح تنسيقاً فعالاً في البيئات المعقدة وغير المحدبة بأوقات حوسبة تقل عن الثانية.

Haejoon Lee, Xinyi Wang, Taekyung Kim, Dimitra Panagou2026-09-16
💻 computer science

Learning Manipulation-Sufficient Representations via Outcome Bottlenecks

تقترح هذه الورقة تمثيلاً عشوائياً مشروطاً بالفعل وخالياً من السياسات، يقوم بضغط الإدراك في عنق زجاجة للنتائج بحجم 512 بايت لتحسين معدلات نجاح التلاعب والقدرة على التكيف بشكل كبير، مع تقليل عرض نطاق الاتصال بشكل جذري مقارنة بنقل الحالة الهندسية الكثيفة التقليدية.

Md Selim Sarowar, Sungho Kim2026-09-16
💻 computer science

From Vision to Harvest: Benchmarking Vision-Language Models for Multi-Arm Robotic Fruit Harvesting

تقدم هذه الورقة أول معيار شامل للتعلم الصفري (zero-shot) لتقييم نماذج الرؤية واللغة المدربة مسبقاً في حصاد الفاكهة باستخدام أذرع روبوتية متعددة، مما يبرز قدرتها على إنشاء خطط حصاد فعالة مع تسليط الضوء على القيود الحالية في دقة النقاط المسارية ثلاثية الأبعاد والتنسيق الواعي بالاصطدام.

Vrishan Inukollu, Adyan Zaman, Anvi Kudaraya, Carlos Lazcano, Yuankai Zhu, Stavros Vougioukas, Xiaofan Yu2026-09-16
💻 computer science

When Do Learned Priors Help Visual Inertial Estimation? A Controlled Study of Prior Integration, Calibration, Initialization, and Backend Consistency

تقدم هذه الورقة إطاراً منضبطاً يوضح أن مكاسب الأداء في التقدير البصري-القصوري غالباً ما تكون مدفوعة بعوامل تتعلق بالخلفية، أو المعايرة، أو التهيئة بدلاً من الأوليات المتعلمة، مما يكشف أن أولوية الحركة القائمة على نموذج MonoViT لا تحقق سوى تحسينات طفيفة في الدقة عند مطابقة هذه المتغيرات بدقة.

Jinchang Zhang, Guoyu Lu2026-09-16
💻 computer science

Vision-Force Admittance Learning for Peg Insertion into a Movable Hole

تقترح هذه الورقة إطار عمل لتعلم الممانعة بالرؤية والقوة (VFAL) يدمج التغذية الراجعة البصرية غير المتزامنة من النماذج التأسيسية مع التحكم في القوة عالي التردد لتمكين عملية إدخال وتد في ثقب بدقة مليمترية قوية في الثقوب المتحركة ضمن البيئات الديناميكية.

Yuzhong Chen, Yongqing Liang, Yunzhi Xu, Irving Fang, Chase Kidder, Hui-ping Wang, Raihan Haque, Yubiao Zhang, Chen Feng2026-09-16
💻 computer science

Visible Touch: Rendering Contact for Visuomotor Policies

تقدم هذه الورقة البحثية "اللمس المرئي" (Visible Touch)، وهي طريقة تدمج التغذية الراجعة اللمسية مباشرة في الإطار البصري باستخدام مستشعر مخصص منخفض التكلفة، مما يُمكّن سياسات التحكم البصري الحركي القائمة على الصور ونماذج الرؤية واللغة والعمل المسبقة التدريب من الاستفادة من معلومات الاتصال دون تغييرات هيكلية، ويحسن معدلات نجاح عمليات المناولة بشكل كبير.

Metin Alp Dogan, Edward Sun, Feng Xu, Daniel Wu, Allen Peng, Dennis Hong, Yuchen Cui2026-09-16
💻 computer science

Learning Communication-Conditioned Generative Policies for Decentralized Multi-Agent Collision Avoidance

تقترح هذه الورقة إطار عمل توليديًا لامركزيًا مشروطًا بالاتصال، يستخدم سياسات مطابقة التدفق (flow-matching) المدربة على بيانات غير متصلة متميزة لتمكين تجنب الاصطدام بين الوكلاء المتعددين من خلال تبادل النوايا الكامنة المتعلم، محققةً أداءً بمستوى الخبراء وتعميمًا قويًا في كل من سيناريوهات المحاكاة والواقع دون تخطيط مركزي.

Prajwal Koirala, Mark Campbell2026-09-16
💻 computer science

BIG-CBF: Behavior-Imagination-Guided Control Barrier Function with Shared Uncertainty for Mobile Robot Navigation

تقدم هذه الورقة البحثية BIG-CBF، وهي بنية ملاحة ثنائية المعدل تدمج تخيل السلوك مع نمذجة عدم اليقين المشترك لتوجيه دالات حاجز التحكم، مما يحقق نجاحاً شبه مثالي للمهام ويقلل من تدخلات مرشح السلامة في ملاحة الروبوتات المتنقلة.

Shibo Li, Zhongcheng Wang, Jiahe Cao, Jianhua Yang, Ke Wu2026-09-16
💻 computer science

EMoG: Emotion-Modulated Gait Generation for Expressive Humanoid Locomotion

تقدم الورقة البحثية EMoG، وهو إطار عمل يولد حركة بشرية تعبيرية في الوقت الفعلي باستخدام شبكة عصبية متعددة الطبقات (MLP) خفيفة الوزن لتعديل مسارات المشي بناءً على رموز أسلوب عاطفي قابلة للضبط وأوامر فيزيائية، مدعوماً بمجموعة بيانات ضخمة موسومة عاطفياً ومحلل يعتمد على نموذج لغوي كبير (LLM) للتحكم التفاعلي.

Yi Lu, Tianhao Jiang, Honglong Tian, Yumeng Zhang, Qingrui Zhao, Zhengtao Wang, Xiao-Xiao Long, Qiu Shen, Xun Cao2026-09-16
💻 computer science

DynEoMT: Learning Object Dynamicity from Online Segmentation Queries

يُعد DynEoMT إطار عمل عبر الإنترنت يعمل على تعزيز تقسيم الفيديو القائم على الاستعلام للتنبؤ بديناميكية الأجسام على مستوى المنطقة (متحرك مقابل ثابت) دون الحاجة إلى التدفق البصري أو العمق أو وضعية الكاميرا، محققاً أداءً قوياً من خلال مسار إشراف غير متصل بالإنترنت مبتكر تم تدريبه على التدفق البصري المعوض لحركة الكاميرا.

Calvin Galagain, Martyna Poreba, François Goulette2026-09-16