💻 computer science

PACE: Physics Augmentation for Coordinated End-to-end Reinforcement Learning toward Versatile Humanoid Table Tennis

تقدم هذه الورقة PACE، وهو إطار عمل للتعلم المعزز المعزز بالفيزياء يُمكّن روبوتًا بشريًا بـ 23 درجة من الحرية من تحقيق لعب تنس طاولة متعدد الاستخدامات، ومنسق، وعالي الأداء من خلال دمج متنبئ بحالة الكرة مُتعلم مع مكافآت كثيفة موجهة فيزيائيًا للتحكم الكامل في الجسم من البداية إلى النهاية.

Muqun Hu, Wenxi Chen, Wenjing Li, Falak Mandali, Zijian He, Renhong Zhang, Praveen Krisna, Katherine Christian, Leo Bena (…)2026-03-19
💬 NLP

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

تقدم هذه الورقة SO-Bench، وهو معيار شامل يتكون من أكثر من 6,500 مخطط JSON متنوع و1,800 زوج من الصور والمخططات المنسقة عبر أربعة مجالات بصرية لتقييم وتحسين قدرات النماذج اللغوية الكبيرة متعددة الوسائط في إنتاج مخرجات مهيكلة متوافقة مع المخططات بشكل منهجي.

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang (…)2026-03-19
💻 computer science

SimScale: Learning to Drive via Real-World Simulation at Scale

تقدم الورقة البحثية SimScale، وهو إطار عمل محاكاة قابل للتوسع يقوم بتخليق سيناريوهات قيادة متنوعة وعالية الدقة من سجلات العالم الحقيقي، ويقوم بتدريب سياسات القيادة الذاتية عبر التدريب المشترك مع إشراف الخبراء الزائف، مما يحسن بشكل كبير من المتانة والقدرة على التعميم في الاختبارات المعيارية الصعبة دون الحاجة إلى بيانات إضافية من العالم الحقيقي.

Haochen Tian, Tianyu Li, Haochen Liu, Jiazhi Yang, Yihang Qiu, Guang Li, Junli Wang, Yinfeng Gao, Zhang Zhang, Liang Wan (…)2026-03-19
🤖 machine learning

Beware Untrusted Simulators -- Reward-Free Backdoor Attacks in Reinforcement Learning

تقدم هذه الورقة البحثية "Daze"، وهو هجوم باب خلفي جديد خالٍ من المكافآت (reward-free) يستهدف اختراق وكلاء التعلم المعزز المدربين في بيئات محاكاة غير موثوقة ببراعة عبر التلاعب بديناميكيات البيئة لتحفيز أفعال خبيثة دون الحاجة إلى الوصول إلى إشارات المكافأة أو تعديلها، وهي قدرة تم التحقق من صحتها تجريبياً على كل من المحاكاة والأجهزة الروبوتية في العالم الحقيقي.

Ethan Rathbun, Wo Wei Lin, Alina Oprea, Christopher Amato2026-03-19
💻 computer science

LaS-Comp: Zero-shot 3D Completion with Latent-Spatial Consistency

يُعد LaS-Comp إطار عمل يعتمد على التعلم الصفري ولا يتطلب تدريباً، حيث يستفيد من الأولويات المستمدة من النماذج التأسيسية ثلاثية الأبعاد عبر تصميم ثنائي المراحل يتكون من الاستبدال الصريح والتحسين الضمني لتحقيق إكمال أشكال ثلاثية الأبعاد عالية الجودة وغير مرتبطة بفئة معينة، وهو ما تم التحقق منه بواسطة معيار Omni-Comp الجديد.

Weilong Yan, Haipeng Li, Hao Xu, Nianjin Ye, Yihao Ai, Shuaicheng Liu, Jingyu Hu2026-03-19
💻 computer science

NavThinker: Action-Conditioned World Models for Coupled Prediction and Planning in Social Navigation

يُعد NavThinker إطار عمل يستشرف المستقبل، حيث يربط نموذج عالم مشروط بالفعل مع التعلم التعزيزي في السياسة نفسها لتمكين الروبوتات من التفكير في التأثير المتبادل بين أفعالها وحركة البشر، مما يحقق أداءً رائدًا في الملاحة الاجتماعية والتعميم في العالم الحقيقي.

Tianshuai Hu, Zeying Gong, Lingdong Kong, XiaoDong Mei, Yiyi Ding, Qi Zeng, Ao Liang, Rong Li, Yangyi Zhong, Junwei Lian (…)2026-03-19
💻 computer science

Asymmetric Nash Seeking via Best Response Maps: Global Linear Convergence and Robustness to Inexact Reaction Models

تقترح هذه الورقة طريقة التدرج المتناقص المتماثل مع تكرار الاستجابة المثلى للألعاب المقيدة ذات اللاعبين، حيث يفتقر أحد اللاعبين إلى المعرفة الكاملة بأهداف الآخر، وتثبت تقاربها الخطي العالمي إلى توازن ناش فريد في ظل شروط دقيقة، وتؤكد أن التكرارات تتقارب إلى جوار قدره O(ε)O(\varepsilon) عندما تكون خريطة الاستجابة المثلى غير دقيقة.

Mahdis Rabbani, Navid Mojahed, Shima Nazari2026-03-19
💻 computer science

TeleDex: Accessible Dexterous Teleoperation

تُعد TeleDex نظاماً مفتوح المصدر يتيح تحكماً عن بُعد ببراعة وبتكلفة منخفضة وسهولة في الوصول باستخدام الهواتف الذكية القياسية لتسهيل الجمع السريع للنماذج التوضيحية من أجل الضبط الدقيق لسياسات الروبوت دون الحاجة إلى بنية تحتية خارجية للتتبع.

Omar Rayyan, Maximilian Gillesm, Yuchen Cui2026-03-19
💻 computer science

SLowRL: Safe Low-Rank Adaptation Reinforcement Learning for Locomotion

تقدم الورقة البحثية إطار عمل SLowRL، الذي يجمع بين التكيف منخفض الرتبة (Low-Rank Adaptation) وسياسة الاسترداد لتمكين الضبط الدقيق الآمن والفعال لسياسات الحركة المدربة في المحاكاة على روبوتات حقيقية، محققاً انخفاضاً بنسبة 46.5% في وقت الضبط الدقيق وانعداماً شبه تام لانتهاكات السلامة.

Elham Daneshmand, Shafeef Omar, Glen Berseth, Majid Khadiv, Hsiu-Chin Lin2026-03-19
💻 computer science

ReSteer: Quantifying and Refining the Steerability of Multitask Robot Policies

تقدم الورقة البحثية ReSteer، وهو إطار عمل يعمل على قياس وتعزيز قابلية التوجيه لسياسات الروبوت متعددة المهام من خلال تحديد حالات انخفاض قابلية التوجيه وتوليف بيانات تصحيحية لتمكين الانتقال القوي واللحظي بين المهام في كل من سيناريوهات المحاكاة والواقع الحقيقي.

Zhenyang Chen, Alan Tian, Liquan Wang, Benjamin Joffe, Yingyan Celine Lin, Yuxiao Chen, Siddharth Karamcheti, Danfei Xu2026-03-19