🤖 machine learning

Navigating LLM Valley: From AdamW to Memory-Efficient and Matrix-Based Optimizers

تقدم هذه الدراسة مراجعة شاملة لخوارزميات التحسين للنماذج اللغوية الكبيرة، حيث تصنف الأساليب من النهج الكلاسيكية من الدرجة الأولى إلى المحسنات المتقدمة القائمة على المصفوفات مثل Muon، مع الدعوة إلى إجراء تقييم مرجعي صارم ومراعٍ للحجم يقيم بشكل مشترك التقارب، والاستقرار، وكفاءة الذاكرة، وتعقيد التنفيذ.

Aditya Ranganath2026-05-12
🤖 machine learning

Learning When to Stop: Selective Imitation Learning Under Arbitrary Dynamics Shift

تقدم هذه الورقة البحثية "SeqRejectron"، وهي خوارزمية للتعلم بالتقليد الانتقائي تتيح للوكلاء الامتناع بأمان عن التصرف في ظل تحولات ديناميكية تعسفية من خلال بناء قاعدة توقف خالية من الأفق مع ضمانات مثبتة لتعقيد العينات.

Surbhi Goel, Jonathan Pei, James Wang2026-05-12
🤖 AI

Emergent Semantic Role Understanding in Language Models

تُثبت هذه الورقة أن فهم الأدوار الدلالية يظهر جزئياً في نماذج المحولات المكونة من فك تشفير فقط (decoder-only transformers) والمجمدة أثناء مرحلة ما قبل التدريب، كما يتضح من خلال المسابير الخطية، رغم أن الأداء الكامل يتطلب الضبط الدقيق، كما يصبح التمثيل الداخلي لهذه الأدوار موزّعاً بشكل متزايد مع زيادة حجم النموذج.

Carla Griffiths, Mirco Musolesi2026-05-12
🤖 machine learning

DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation

تقترح الورقة البحثية إطار عمل DARE، وهو إطار موحد يطور تقدير الصعوبة مع السياسة من خلال أخذ العينات بأهمية ذاتية التقييس وتخصيص الحوسبة التكيفي لتحسين كفاءة التدريب، والأداء النهائي، وإيجاز الاستدلال في آن واحد عبر مستويات صعوبة المهام المتفاوتة.

Yang Zhou, Can Jin, Zihan Dong, Zhepeng Wang, Yanting Yang, Shiyu Zhao, Lei Li, Runxue Bao, Yaochen Xie, Dimitris N. Met (…)2026-05-12
📊 statistics

Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability

تضع هذه الورقة البحثية أول حدود عليا لتعقيد العينات السريع من رتبة O~(ϵ1)\tilde{O}(\epsilon^{-1}) لتعقيد "المناديب السياقية غير المتصلة" (offline contextual bandits) مع تنظيم "كاي إل" الأمامي (forward-KL regularization) في ظل حالة تركيز السياسة الواحدة، موحدةً بذلك بين إعدادات الجداول (tabular) والتقريب الوظيفي العام من خلال تحليل تحليلي محدب مبتكر، ومثبتةً دقة هذه المعدلات عبر حدود دنيا مطابقة.

Qingyue Zhao, Kaixuan Ji, Heyang Zhao, Quanquan Gu2026-05-12
🤖 AI

Flame3D: Zero-shot Compositional Reasoning of 3D Scenes with Agentic Language Models

يُعد Flame3D إطار عمل لا يتطلب تدريباً، يُمكّن من الاستدلال التكويني للمشاهد ثلاثية الأبعاد بنمط "الصفر محاولة" (zero-shot) عبر تمثيل المشاهد كذكريات بصرية-نصية قابلة للتحرير، وتمكين النماذج اللغوية الكبيرة متعددة الوسائط (MLLMs) الجاهزة من تخليق أدوات مكانية مخصصة ديناميكياً للاستدلال مفتوح النهايات.

Sagar Bharadwaj, Ziyong Ma, Anurag Ghosh, Srinivasan Seshan, Anthony Rowe2026-05-12
🤖 machine learning

The Pokémon Theorem and other Fairness Impossibility Results

توحد هذه الورقة نتائج استحالة العدالة المتنوعة تحت هندسة فضاء هيلبرت للنواة التركيبية (RKHS) مشتركة، مظهرةً أن عدم تساوي معدلات الأساس يؤدي إلى جعل قيود العدالة الخطية غير محددة بشكل زائد، مما يفضي إلى رؤى جديدة حول ثنائية كلاينبيرغ-موليناثان-راغافان، و"نظرية بوكيمون" فيما يتعلق بالانتهاكات المتبقية المقاسة بمسافة التباعد المتوسط المربع الأدنى (MMD)، والحدود الجوهرية لتعلم الميزات العادلة.

Daniel Matsui Smola, Alex Smola2026-05-12
🤖 machine learning

ProactBench: Beyond What The User Asked For

يقدم ProactBench معياراً مرجعياً جديداً لتقييم المبادرة الحوارية —وهي قدرة النماذج اللغوية الكبيرة على تحديد الاحتياجات الضمنية للمستخدم والعمل بناءً عليها— وذلك من خلال تفكيكها إلى مراحل: الناشئة، والحرجة، والاستردادية، وإثبات أن أداء مرحلة الاسترداد يمثل إشارة تقييم متميزة وصعبة لا تلتقطها المعايير المرجعية الحالية.

Sepehr Harfi, Ahmad Salimi, Dongming Shen, Alex Smola2026-05-12
🤖 machine learning

Privacy-Preserving Distributed Learning in IoT Systems: A Unified Threat Model and Evaluation Framework

تقترح هذه الورقة نموذج تهديد وإطار تقييم موحد لتحليل ومقارنة تقنيات الحفاظ على الخصوصية للتعلم الموزع في أنظمة إنترنت الأشياء بشكل منهجي، مع تسليط الضوء على المقايضات بين متانة الخصوصية وكفاءة النظام، بينما تستعرض إمكانات الأساليب خفيفة الوزن القائمة على مرشح بلوم (Bloom Filter).

John Cartmell, Alexander Williams2026-05-12
🤖 machine learning

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

تُثبت هذه الورقة أن فشل النماذج اللغوية الكبيرة في عدّ الرموز المتكررة لا ينبع من عدم القدرة على تمثيل العدد الصحيح داخلياً، بل من آلية "طبقة بيرسبترون متعدد الطبقات" (MLP) محفزة بتنسيق محدد تقوم باستبدال التمثيل الدقيق بإجابة خاطئة ثابتة أثناء عملية توليد المخرجات.

Sohan Venkatesh2026-05-12