📊 statistics

Some Robustness Properties of Label Cleaning

تُثبت هذه الورقة أن إجراءات التعلم التي تستخدم تسميات مجمعة ومنقحة تحقق متانة فائقة وضمانات أقوى لاتساق المخاطر مقارنة بالطرق التي تستخدم التسميات الخام، لا سيالما عندما تكون النماذج غير محددة بدقة طفيفة أو عند تقليل الخسائر البديلة.

Chen Cheng, John Duchi2026-05-26
🤖 machine learning

Dynamic Relational Priming Improves Transformer in Multivariate Time Series

تقدم هذه الورقة "انتباه برايم" (prime attention)، وهي آلية مبتكرة تعزز التنبؤ بالسلاسل الزمنية متعددة المتغيرات من خلال تعديل تمثيلات الرموز ديناميكيًا لالتقاط التبعيات المتنوعة بين القنوات، مما يحقق دقة وكفاءة متفوقتين مقارنة بالانتباه الاستاتيكي القياسي مع الحفاظ على نفس التعقيد الحسابي.

Hunjae Lee, Corey Clark2026-05-26
🤖 machine learning

Is GPT-4o mini Blinded by its Own Safety Filters? Exposing the Multimodal-to-Unimodal Bottleneck in Hate Speech Detection

تحدد هذه الورقة "عنق زجاجة أحادي المنوال" حرجاً في نموذج GPT-4o mini من OpenAI، حيث تقوم مرشحات السلامة العمياء عن السياق بحظر المحتوى متعدد الوسائط الضار والسليم على حد سواء بشكل عشوائي بناءً فقط على إشارات بصرية أو نصية معزولة، مما يقوض قدرات الاستدلال المتقدمة للنموذج ويسلط الض<unused54>وء على الحاجة إلى استراتيجيات مواءمة أكثر تكاملاً.

Niruthiha Selvanayagam, Ted Kurti2026-05-26
🤖 machine learning

Nonconvex Decentralized Stochastic Bilevel Optimization under Heavy-Tailed Noise

تقترح هذه الورقة أول خوارزمية لامركزية للتحسين ثنائي المستوى العشوائي ذات ضمانات نظرية صارمة للمسائل غير المحدبة تحت ضجيج ذي ذيول ثقيلة، وذلك باستخدام طريقة مبتكرة لخفض تباين التدرج المنسوب (normalized variance-reduced gradient descent) تلغي الحاجة إلى تقليم التدرج (gradient clipping).

Xinwen Zhang, Yihan Zhang, Heng Liang, Hongchang Gao2026-05-26
🤖 machine learning

Fine-Tuning Masked Diffusion for Provable Self-Correction

تقدم هذه الورقة البحثية PRISM، وهي طريقة خفيفة الوزن ومستقلة عن النموذج تتيح التصحيح الذاتي القابل للإثبات لنماذج الانتشار المقنعة مسبقة التدريب من خلال حساب درجات جودة لكل رمز (token) أثناء الاستدلال لاكتشاف الرموز منخفضة الجودة ومراجعتها دون الحاجة إلى تغييرات هيكلية، أو تعلم تعزيزي، أو أدوات تحقق خارجية.

Jaeyeon Kim, Seunggeun Kim, Taekyun Lee, David Z. Pan, Hyeji Kim, Sham Kakade, Sitan Chen2026-05-26
🤖 machine learning

XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation

إن XRPO هو إطار عمل موحد يعزز التعلم المعزز القائم على GRPO للنماذج اللغوية الكبيرة من خلال تقديم مخصص تدفق (rollout allocator) تكيفي للاستكشاف المستهدف وآلية شحذ ميزة مدركة للجدة (novelty-aware advantage sharpening mechanism) لتحسين الاستغلال، مما يؤدي إلى أداء فائق وتقارب أسرع في معايير الرياضيات والبرمجة.

Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai2026-05-26
🤖 machine learning

Test-Time Graph Search for Goal-Conditioned Reinforcement Learning

تقدم هذه الورقة البحثية "البحث في الرسوم البيانية وقت الاختبار" (TTGS)، وهو غلاف تخطيط خفيف الوزن ولا يتطلب تدريباً، يستفيد من البنية الهندسية المتأصلة لسياسات التعلم المعزز الحالية الموجهة نحو الأهداف والمعدة مسبقاً (offline) لتحسين معدلات النجاح بشكل كبير في المهام طويلة الأمد دون الحاجة إلى إشراف إضافي أو تحديثات للمعلمات.

Evgenii Opryshko, Junwei Quan, Claas Voelcker, Yilun Du, Igor Gilitschenski2026-05-26✓ Author reviewed
🤖 machine learning

DeepEN: A Deep Reinforcement Learning Framework for Personalized Enteral Nutrition in Critical Care

يُعد DeepEN إطار عمل جديد للتعلم المعزز غير المتصل، تم تدريبه على أكثر من 11,000 مريض في وحدة العناية المركزة، ويقوم بإنشاء توصيات شخصية وآمنة للتغذية المعوية، مُظهراً استقراراً أيضياً فائقاً وانخفاضاً بنسبة 4.0% في معدل الوفيات مقارنة بالممارسة السريرية القياسية.

Daniel Jason Tan, Jiayang Chen, Dilruk Perera, Kay Choong See, Mengling Feng2026-05-26
💬 NLP

Agent Learning via Early Experience

تقدم هذه الورقة "الخبرة المبكرة"، وهي نموذج حيث تتعلم الوكلاء اللغوية من بيانات تفاعلها الخاصة دون إشارات مكافأة صريحة من خلال نمذجة العالم الضمنية والتأمل الذاتي، مما يظهر فعالية وقدرة أفضل على التعميم مع سد الفجوة بين الضبط الدقيق الخاضع للإشراف والتعلم المعزز.

Kai Zhang, Xiangchao Chen, Bo Liu, Tianci Xue, Zeyi Liao, Zhihan Liu, Xiyao Wang, Yuting Ning, Zhaorun Chen, Xiaohan Fu (…)2026-05-26
🤖 machine learning

ΔEnergy\Delta \mathrm{Energy}: Optimizing Energy Change During Vision-Language Alignment Improves both OOD Detection and OOD Generalization

تقدم هذه الورقة Δ\DeltaEnergy، وهو مقياس جديد لـ OOD مستوحى من تغيرات الطاقة أثناء المحاذاة بين الرؤية واللغة، وإطار عمل للضبط الدقيق (EBM) يعزز في آن واحد كشف البيانات خارج التوزيع والتعميم في نماذج الرؤية واللغة، محققاً مكاسب أداء كبيرة مقارنة بالطرق الحالية.

Lin Zhu, Yifeng Yang, Xinbing Wang, Qinying Gu, Nanyang Ye2026-05-26