🤖 machine learning

Behavior-Consistent Deep Reinforcement Learning

تقدم هذه الورقة البحثية "اختلاف المئينات لقيمة-Q" (QED)، وهو جدول زمني لدرجة الحرارة يعتمد على الحالة ويستفيد من اختلاف الناقد المزدوج لتقليل تباعد السياسة عبر التشغيلات بشكل كبير في تعلم التعزيز ذي الإنتروبيا القصوى مع الحفاظ على أداء عالٍ عبر مهام التحكم المستمر.

Marcel Hussing, Liv G. d'Aliberti, Claas Voelcker, Benjamin Eysenbach, Eric Eaton2026-05-21
🔬 optics

Artificial Intelligence Reshapes Microwave Photonics

تقدم هذه الورقة المراجعية أول نظرة شاملة حول كيفية قيام الذكاء الاصطناعي بإعادة تشكيل علم الفتونيات الميكروية بشكل جذري من خلال إحداث ثورة في تصميم، ومحاكاة، وتصنيع، واختبار، ونشر، وتشغيل الأنظمة عبر عمليات توليد الإشارات، ونقلها، ومعالجتها، وكشفها.

Peng Li, Xihua Zou, Jia Ye, Wei Pan, Lianshan Yan2026-05-21
🤖 machine learning

APEX: Autonomous Policy Exploration for Self-Evolving LLM Agents

تقترح الورقة البحثية إطار عمل APEX، وهو إطار لاستكشاف السياسات المستقلة يستخدم خريطة استراتيجية وآلية اكتشاف التفرع للتغلب على انهيار الاستكشاف في وكلاء النماذج اللغوية الكبيرة (LLM) ذاتية التطور، مما يمكنهم من اكتشاف استراتيجيات متفوقة من خلال الذاكرة والتفكير دون تحديث أوزان النموذج.

Yibo Li, Jiashuo Yang, Zhi Zheng, Zhiyuan Hu, Yuan Sui, Shizun Wang, Yufei He, Bryan Hooi2026-05-21
💻 computer science

Learning Structural Latent Points for Efficient Visual Representations in Robotic Manipulation

تقترح هذه الورقة إطار عمل مبتكر للتدريب المسبق يتعلم نقاطاً كامنة هيكلية هجينة من خلال الجمع بين مشفر تلقائي متباين (VAE) كامن نقطي ومشفر تلقائي لسحابة النقاط لإنشاء تمثيلات مدمجة ومعبرة تسد الفجوة بين النماذج ثلاثية الأبعاد الضمنية والصريحة، مما يظهر تفوقاً في نجاح المهام وكفاءة العينات في التلاعب الروبوتي عبر بيئات محاكاة وواقعية.

Yicheng Jiang, Jiaxu Wang, Junhao He, Zesen Gan, Junhao Li, Qiang Zhang, Jingkai Sun, Jiahang Cao, Mingyuan Sun, Xiangyu (…)2026-05-21
🤖 machine learning

\textit{Stochastic} MeanFlow Policies: One-Step Generative Control with Entropic Mirror Descent

تقدم هذه الورقة سياسات تدفق المتوسط العشوائية (SMFP)، وهي فئة سياسات توليدية من خطوة واحدة تجمع بين تقدير الإنتروبيا القابل للتتبع وانحدار المرآة خارج السياسة للتعامل بفعالية مع توزيعات الأفعال متعددة الأنماط مع الحفاظ على كفاءة الاستدلال واستقرار التدريب عبر اختبارات MuJoCo المرجعية.

Zeyuan Wang, Da Li, Yulin Chen, Yuehu Gong, Yanming Guo, Ye Shi, Liang Bai, Tianyuan Yu, Yanwei Fu2026-05-21
📊 statistics

Large-Step Training Dynamics of a Two-Factor Linear Transformer Model

تحلل هذه الورقة ديناميكيات التدريب ذات الخطوة الكبيرة لنموذج محول خطي ثنائي العوامل، مظهرةً أن معدلات التعلم المرتفعة يمكن أن تغير نتائج التدريب بشكل جوهري عبر تحويل النظام من التقارب الرتيب إلى الدورات، أو الفوضى المحدودة، أو التباعد، بدلاً من مجرد تسريع تعلم الانحدار الخطي داخل السياق.

Krishnakumar Balasubramanian2026-05-21
💬 NLP

Tracing the ongoing emergence of human-like reasoning in Large Language Models

تكشف هذه الورقة أنه بينما تُظهر النماذج اللغوية الكبيرة دقة عالية في المنطق الدلالي، فإنها تفشل عموماً في محاكاة الاستدلال البراغماتي الذي يسمح للبشر بإثراء الجمل الشرطية بمعانٍ تعتمد على السياق، وهي قدرة تظل مهارة ناشئة بغض النظر عن بنية النموذج أو توجه التدريب.

Paolo Morosi, Nikoleta Pantelidou, Fritz Günther, Elena Pagliarini, Evelina Leivada2026-05-21
🤖 machine learning

DeCoR: Design and Control Co-Optimization for Urban Streets Using Reinforcement Learning

تقدم الورقة البحثية DeCoR، وهو إطار عمل للتعلم التعزيزي ثنائي المراحل يعمل على التحسين المشترك لتخطيطات ممرات المشاة الحضرية والتحكم التكيفي في الإشارات لتقليل تأخيرات المشاة والمركبات بشكل كبير في ممرات حقيقية مع التعميم على الطلبات المتغيرة دون الحاجة لإعادة التدريب.

Bibek Poudel, Lei Zhu, Kevin Heaslip, Sai Swaminathan, Weizi Li2026-05-21
💬 NLP

TextReg: Mitigating Prompt Distributional Overfitting via Regularized Text-Space Optimization

تقدم الورقة البحثية TextReg، وهو إطار تنظيم يعمل على الحد من الإفراط في التخصيص لتوزيع المطالبات في النماذج اللغوية الكبيرة من خلال التحكم في عدم كفاءة التمثيل عبر التدرجات النصية، مما يحسن بشكل كبير من تعميم خارج التوزيع مقارنة بطرق التحسين الحالية.

Lucheng Fu, Ye Yu, Yiyang Wang, Yiqiao Jin, Haibo Jin, B. Aditya Prakash, Haohan Wang2026-05-21
🤖 machine learning

Insights Generator: Systematic Corpus-Level Trace Diagnostics for LLM Agents

تقدم هذه الورقة نظام "مولد الرؤى" (Insights Generator - IG)، وهو نظام متعدد الوكلاء يعمل على أتمتة تشخيص إخفاقات وكلاء النماذج اللغوية الكبيرة (LLM) من خلال التحليل المنهجي لمجموعات ضخمة من سجلات التنفيذ لإنتاج رؤى لغوية مدعومة بالأدلة، والتي أثبتت قدرتها على تحسين أداء الوكلاء بشكل كبير وتفوق على طرق التشخيص اليدوية في العمق والتغطية.

Akshay Manglik (Emily), Apaar Shanker (Emily), Kaustubh Deshpande (Emily), Jason Qin (Emily), Yash Maurya (Emily), Veron (…)2026-05-21