💬 NLP

Reinforcement Learning with Semantic Rewards Enables Low-Resource Language Expansion without Alignment Tax

تقترح هذه الورقة نهجاً للتعلم التعزيزي باستخدام تحسين السياسة النسبية للمجموعة (GRPO) مع مكافآت دلالية لتوسيع النماذج اللغوية الكبيرة إلى اللغات منخفضة الموارد، مما يخفف بفعالية من "ضريبة المحاذاة" والنسيان الكارثي الناتج عادةً عن الضبط الدقيق الخاضع للإشراف، مع الحفاظ على القدرات العامة وتحسين الجودة الدلالية.

Zeli Su, Ziyin Zhang, Zhou Liu, Xuexian Song, Zhankai Xu, Longfei Zheng, Xiaolu Zhang, Rong Fu, Guixian Xu, Wentao Zhang2026-05-15
🤖 machine learning

Turning Stale Gradients into Stable Gradients: Coherent Coordinate Descent with Implicit Landscape Smoothing for Lightweight Zeroth-Order Optimization

تقدم هذه الورقة "النزول الإحداثي المتماسك" (CoCD)، وهو مُحسِّن حتمي من الدرجة صفر يعمل على تحويل التدرجات القديمة إلى اتجاهات تحديث مستقرة من خلال النزول الإحداثي الدوري الكتلي ذي البداية الدافئة وتنعيم المشهد الضمني، محققاً كفاءة عينات واستقرار تقارب متفوقين مقارنة بالطرق العشوائية الحالية.

Chen Liang, Xiatao Sun, Qian Wang, Daniel Rakita2026-05-15
🤖 machine learning

Data-Augmented Game Starts for Accelerating Self-Play Exploration in Imperfect Information Games

تقدم هذه الورقة "بدايات الألعاب المعززة بالبيانات" (DAGS)، وهي طريقة تسرع عملية الاستكشاف في ألعاب المعلومات غير الكاملة واسعة النطاق من خلال تهيئة التعلم التعزيزي من عروض توضيحية بشرية غير متصلة، مما يحقق قابلية استغلال أقل في ظل ميزانيات حوسبة ثابتة مع توفير حلول لانحيازات التوازن المحتملة.

JB Lanier, Nathan Monette, Pierre Baldi, Roy Fox2026-05-15
💬 NLP

Nexus : An Agentic Framework for Time Series Forecasting

تقدم الورقة البحثية "Nexus"، وهو إطار عمل متعدد الوكلاء يعمل على تفكيك التنبؤ بالسلاسل الزمنية إلى مراحل متخصصة لدمج البيانات السياقية غير المهيكلة مع الأنماط الرقمية بفعالية، مما يمكّن النماذج اللغوية الكبيرة الحالية من مضاهاة أو التفوق على النماذج الرائدة مع توفير مسارات استدلال شفافة.

Sarkar Snigdha Sarathi Das, Palash Goyal, Mihir Parmar, Nanyun Peng, Vishy Tirumalashetty, Chun-Liang Li, Rui Zhang, Jin (…)2026-05-15
🤖 machine learning

Watch your neighbors: Training statistically accurate chaotic systems with local phase space information

تقدم هذه الورقة إطار عمل مبتكر لتدريب النماذج البديلة للأنظمة الفوضوية، والذي يحقق في آن واحد دقة عالية في تقدير جاكوبي المحلي والسلوك الإحصائي طويل الأمد من خلال تقليل الحد الأقصى لتباين متوسط التباعد بين توزيعات الدفع لتغطيات فضاء الطور المحلية.

Joon-Hyuk Ko, Andrus Giraldo, Deok-Sun Lee2026-05-15
🤖 machine learning

MahaVar: OOD Detection via Class-wise Mahalanobis Distance Variance under Neural Collapse

تقدم هذه الورقة البحثية MahaVar، وهو أسلوب كشف عن القيم الخارجة عن التوزيع لاحقاً (post-hoc) يستفيد من الملاحظة ذات الأسس النظرية التي تشير إلى أن العينات ضمن التوزيع تظهر تبايناً عالياً في مسافة ماهالانوبيس لكل فئة نتيجة لهندسة الانهيار العصبي (Neural Collapse)، محققاً أداءً هو الأفضل في فئته على المعايير القياسية.

Donghwan Kim, Hyunsoo Yoon2026-05-15
🤖 machine learning

What if Tomorrow is the World Cup Final? Counterfactual Time Series Forecasting with Textual Conditions

تقدم هذه الورقة مهمة التنبؤ بالسلاسل الزمنية القائمة على التوقعات المضادة مع الشروط النصية، مقترحةً آلية جديدة لنسب النصوص وإطار تقييم شامل لتمكين تنبؤات مرنة ومدركة للشروط في السيناريوهات المعقدة الواقعية حيث تؤثر الأحداث المستقبلية على النتائج.

Shuqi Gu, Yongxiang Zhao, Baoyu Jing, Kan Ren2026-05-15
🤖 machine learning

Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic

تقترح هذه الورقة إطار عمل "ممثل-ناقد" اتحادي أحادي المقياس الزمني يوازن بين التعلم التعاوني والتخصيص من خلال مشاركة فضاء جزئي خطي مشترك مع الحفاظ على مكونات السياسة المحلية، محققاً تقارباً في زمن محدد مع تسريع خطي بالنسبة لعدد الوكلاء، ومظهراً أداءً فائقاً في المهام غير المتجانسة.

Leo Muxing Wang, Pengkun Yang, Lili Su2026-05-15
🤖 machine learning

Prompting Policies for Multi-step Reasoning and Tool-Use in Black-box LLMs with Iterative Distillation of Experience

تقترح هذه الورقة إطار عمل للتعلم التعزيزي يعمل على تحسين نموذج "مُحفز" (prompter) خفيف الوزن من خلال التقطير التكراري للخبرة لتعزيز قدرات الاستدلال متعدد الخطوات واستخدام الأدوات للنماذج اللغوية الكبيرة (LLMs) ذات الصندوق الأسود والمجمدة بشكل كبير، محققةً أداءً وكفاءة في العينات يتفوقان على النماذج التطورية المرجعية الحالية.

Krishna Sayana, Ketan Todi, Ambarish Jash2026-05-15
🤖 machine learning

LiSA: Lifelong Safety Adaptation via Conservative Policy Induction

تقدم الورقة البحثية LiSA، وهو إطار عمل لاستقراء السياسات التحفظية يعمل على تعزيز حواجز الحماية الثابتة للذكاء الاصطناعي من خلال تحويل حالات فشل النشر المتفرقة والمشوشة إلى تجريدات سياسات قابلة لإعادة الاستخدام عبر ذاكرة مهيكلة، مما يمكّن الوكلاء من التكيف مع مخاطر السلامة السياقية دون الحاجة إلى ضبط دقيق متكرر.

Minbeom Kim, Lesly Miculicich, Bhavana Dalvi Mishra, Mihir Parmar, Phillip Wallis, Bharath Chandrasekhar, Kyomin Jung, T (…)2026-05-15