🤖 machine learning

F-GRPO: Don't Let Your Policy Learn the Obvious and Forget the Rare

تقترح الورقة البحثية F-GRPO، وهي طريقة للتعلم التعزيزي مدركة للصعوبة تعمل على التخفيف من ميل الخوارزميات القياسية القائمة على المجموعات نحو الإفراط في ملاءمة الحلول الشائعة وإهمال المسارات الصحيحة النادرة عبر تقليل وزن التحديثات عالية النجاح، مما يؤدي إلى تحسين أداء الاستدلال الرياضي بشكل كبير عبر مختلف النماذج المرجعية دون زيادة التكاليف الحسابية.

Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii, Alexey Malakhov, Daria Korotyshova, Daniil Gav (…)2026-05-26
🤖 machine learning

Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards

تقترح هذه الورقة "Contextual Rollout Bandits"، وهو إطار جدولة عصبي موحد يعامل عمليات الـ rollout كأذرع bandit سياقية لاختيار وإعادة استخدام البيانات التاريخية ذات القيمة العالية بشكل تكيفي، مما يؤدي إلى تحسين كفاءة العينات والأداء في التعلم التعزيزي مع المكافآت القابلة للتحقق (RLVR) للنماذج اللغوية الكبيرة.

Xiaodong Lu, Xiaohan Wang, Jiajun Chai, Guojun Yin, Wei Lin, Zhijun Chen, Yu Luo, Fuzhen Zhuang, Yikun Ban, Deqing Wang2026-05-26
📊 statistics

Why Agentic Theorem Prover Works: A Statistical Provability Theory of Mathematical Reasoning Models

تؤسس هذه الورقة نظرية إثبات إحصائي تُمذل البحث عن البراهين الصورية كعملية اتخاذ قرار ماركوفية (MDP) ذات أفق زمني محدد، لتوضيح كيفية قيام المكونات الوكيلة مثل الاسترجاع والتحقق بتحسين نجاح البرهان عبر تقليل أخطاء قيمة الفعل الموزونة بالانشغال، مما يفسر فعاليتها في أعباء العمل الواقعية دون التعارض مع الصعوبة الكلاسيكية في أسوأ الحالات.

Sho Sonoda, Shunta Akiyama, Yuya Uezato2026-05-26
🤖 machine learning

LT2: Linear-Time Looped Transformers

تقدم هذه الورقة البحثية LT2، وهي عائلة من المحولات الحلقية ذات الزمن الخطي التي تستبدل الانتباه التربيعي بمتغيرات خطية أو متفرقة فعالة، مما يثبت أن التكرار الحلقي يتآزر مع هذه الآليات لتحقيق أداء وقابلية توسع فائقين في مهام نمذجة اللغة.

Chunyuan Deng, Yizhe Zhang, Rui-Jie Zhu, Yuanyuan Xu, Jiarui Liu, T. S. Eugene Ng, Hanjie Chen2026-05-26
🤖 AI

Confidence Calibration in Large Language Models

تقدم هذه الورقة دراسة مسجلة مسبقاً تُظهر أن النماذج اللغوية الكبيرة تظهر نزعة عامة نحو الإفراط في الثقة، والتي يتم تعديلها من خلال تأثير "السهل-الصعب" حيث يبلغ الإفراط في الثقة ذروته في المهام الصعبة بينما يحدث نقص الثقة في المهام السهلة، مما أدى إلى تطوير معيار LifeEval لتقييم المعايرة عبر مستويات الصعوبة المختلفة.

Noam Michael, Daniel BenShushan, Jacob Bien, Don A. Moore2026-05-26
🤖 machine learning

The Model Parking Tax: Quantifying the Hidden Energy Cost of Always-On GPU Model Deployment

تثبت هذه الورقة تجريبياً أن تكلفة الطاقة لإبقاء نماذج الذكاء الاصطناعي محملة في ذاكرة وحدة معالجة الرسومات مدفوعة أساساً بزيادة منفصلة في القدرة ناتجة عن انتقال نظام تغيير الجهد والتردد الديناميكي (DVFS) الخاص بسياق كودا (CUDA context)، وليس بسبب إشغال ذاكرة الوصول العشوائي للفيديو (VRAM)، مما يكشف أن الاستراتيجية المثلى لاستهلاك الطاقة عند نشر النماذج تعتمد على معدلات وصول الطلبات وزمن انتقال التشغيل البارد بدلاً من حجم النموذج.

Sai Sathvik Vadari2026-05-26
🤖 AI

High-Risk AI Systems and the Problem of Identity in the European AI Act

تجادل هذه الورقة بأن اعتماد قانون الذكاء الاصطناعي الأوروبي على أحكام الهوية الغامضة لأنظمة الذكاء الاصطناعي عالية المخاطر يمكن حله من خلال تطبيق إطار "الوظيفة+"، الذي يعمل على تخصيص الأنظمة عبر الوظيفة المقصودة وملفات تعريف الموثوقية لإنشاء معيار قابل للتدقيق والتشغيل للهوية التزامنية في السياقات التنظيمية والحوكمية.

Andrea Ferrario2026-05-26
🤖 AI

Quantum Frog: Emergent Cooperation and Difficulty Scaling in a Quantized-Time Cooperative Game

تقدم هذه الورقة "Quantum Frog"، وهي لعبة تعاونية ذات زمن مكمم، حيث يكشف التعلم المعزز أن الاندفاع المتزامن هو الاستراتيجية المثلى، مما يثبت أن التدريب التعاوني يتفوق بشكل كبير على اللعب المستقل من خلال تقليل طول الحلقة وتجاوز عقوبة الصعوبة الشديدة الناتجة عن التفاعل متعدد الوكلاء غير المنسق.

Saad Mankarious2026-05-26
🤖 AI

QUIVER: A Formal Framework for Quantifying Perturbation Propagation and Bifurcation in Compound AI Systems

تقدم هذه الورقة QUIVER، وهو إطار عمل رسمي يقيس انتشار الاضطراب والتفرع الهيكلي في أنظمة الذكاء الاصطناعي المركبة من خلال تعريف مصفوفات الحساسية، ومقاييس تباعد المسار، وعتبات التفرع، والتي تم التحقق من صحتها عبر مسارات إنتاجية وعامة متنوعة للكشف عن ملفات تعريف حساسية متميزة وتحديد مواضع عيوب التقييم.

Prashanti Nilayam, Sankalp Nayak2026-05-26
🤖 AI

Low-Cost Labels, Reliable Choices: Rollout-Calibrated Hyper-Heuristics for Job Shop Scheduling

تقترح هذه الورقة بحثاً خوارزمية استدلال فائق (hyper-heuristic) معززة بالتعلم، موثوقة ومنخفضة التكلفة لجدولة ورشة العمل (Job Shop Scheduling)، تعمل على التخفيف من حدة التوليد المكلف للتسميات وضمان استقرار الاختيار عبر الجمع بين تسميات التدحرج المنظمة بالندم (regret-normalized rollout labels)، وتقديرات عدم اليقين السياقية لـ KNN، وآلية قرار بوابية (gated decision mechanism).

Junhao Wei, Yanxiao Li, Yifu Zhao, Zhenhong Peng, Baili Lu, Dexing Yao, Haochen Li, Qinbin He, Sio-Kei Im, Yapeng Wang (…)2026-05-26