🤖 machine learning

Max-Window Scale Estimation for Near-Lossless HiF8 W8A8 Quantization-Aware Training

تحدد هذه الورقة وتعالج نمطي فشل متميزين في التدريب الواعي بالكمية من نوع HiF8 W8A8 —وهما تشبع الـ amax والنسيان الكارثي— عبر تقديم استراتيجية تقدير مقياس نافذة الحد الأقصى وجدول إحماء BF16، محققةً بذلك أداءً يقارب انعدام الفقد في نموذج OpenPangu-Embedded-1B.

Yingying Cheng, Jinquan Shi, Li Zhou, Zhiyang He, Zhaoyi Sun, Fan Zhang, Jie Sun2026-05-27
🤖 AI

Can LLMs Introspect? A Reality Check

تجادل هذه الورقة بأن الأدلة الحالية على قدرة النماذج اللغوية الكبيرة على الاستبطان سابقة لأوانها، ومن المرجح أنها تعكس مطابقة الأنماط بناءً على إشارات سطحية بدلاً من كونها مراقبة معرفية وراء معرفية حقيقية، حيث تفشل النماذج في التمييز بشكل موثوق بين التلاعب بالحالة الداخلية والتلاعب بالمدخلات، ولا تؤدي أداءً أفضل من المصنفات التي تعتمد على المدخلات فقط في التنبؤ بالحالات الخفية.

Shashwat Singh, Tal Linzen, Shauli Ravfogel2026-05-27
🤖 machine learning

Unified Neural Scaling Laws

تقدم الورقة البحثية قانون توسع عصبي موحد (UNSL)، وهو شكل دالي ينمذج ويتنبأ بدقة بأداء مختلف الشبكات العصبية العميقة عبر أبعاد متعددة متزامنة — بما في ذلك حجم النموذج، والبيانات، والحوسبة، والمعلمات الفائقة — متفوقاً على قوانين التوسع الحالية من حيث الدقة عبر مهام الرؤية، واللغة، والرياضيات، والتعلم التعزيزي.

Ethan Caballero, Priyank Jaini, David Krueger, Irina Rish2026-05-27
🤖 AI

Is Agent Memory a Database? Rethinking Data Foundations for Long-Term AI Agent Memory

تجادل هذه الورقة بأن نماذج قواعد البيانات الحالية غير كافية لذاكرة الوكلاء الاصطناعيين طويلة الأمد بسبب تركيزها على مستوى السجلات، وتقترح "الذاكرة المتطورة المحكومة" (GEM) كعبء عمل جديد لإدارة البيانات على مستوى الحالة، محددةً بأربعة عوامل تشغيل وستة شروط صحة لمعالجة أنماط الفشل المتكررة مثل النمو غير المنظم والمراجعة الدلالية المفقودة.

Abdelghny Orogat, Essam Mansour2026-05-27
🤖 AI

Personalizing Embodied Multimodal Large Language Model Agents over Long-term User Interactions

تقدم هذه الورقة POLAR، وهو إطار عمل متعدد الوسائط معزز بالذاكرة ينظم تفاعلات المستخدم طويلة الأمد في رسم بياني معرفي لتمكين الوكلاء المجسدين من استرجاع السياق الشخصي بفعالية لتحسين تنفيذ المهام والاستدلال بمرور الوقت.

Jeongeun Lee, Chanyoung Park, Dongha Lee2026-05-27
💻 computer science

Decoupled Delay Compensation: Enhancing Pre-trained MARL Policies via Learned Dynamics Filtering

تقترح هذه الورقة طبقة تقدير حالة نمطية وقابلة للإضافة، تجمع بين نموذج انتقال بوابي (Gated) مُتعلم وبين مرشح كالمان تكراري لتعويض تأخيرات الاتصال وفقدان الحزم في سياسات التعلم المعزز متعدد الوكلاء سابقة التدريب، مما يعزز بشكل كبير من متانتها وأدائها في البيئات غير المتزامنة الواقعية.

Maxim Mednikov, Oren Gal2026-05-27
💬 NLP

CroCo: Cross-Lingual Contrastive Preference Tuning on Self-Generations

تقدم الورقة البحثية CroCo، وهي طريقة تثبت أن الضبط التفضيلي التبايني عبر اللغات باستخدام استجابات مولدة ذاتياً ونموذج مكافأة مدرب باللغة الإنجليزية يحسن بفعالية أداء النماذج اللغوية الكبيرة متعددة اللغات عبر مهام متنوعة دون الحاجة إلى تعليقات تفضيلية خاصة بكل لغة، شريطة استخدام بيانات السياسة المباشرة (on-policy data).

Mike Zhang, Ali Basirat, Desmond Elliott2026-05-27
💻 computer science

Intelligent Detection and Mitigation of Carpet-Bombing DDoS Attacks in SDN Using Retrieval-Augmented Generation and Large Language Models

تقترح هذه الورقة إطار عمل للجيل المعزز بالاسترجاع (RAG) متكاملاً مع النماذج اللغوية الكبيرة (LLMs) لتحقيق كشف وتخفيف في الوقت الفعلي، وبدون تدريب، لهجمات حجب الخدمة من نوع "القصف السجادي" (Carpet-Bombing DDoS) في بيئات الشبكات المعرفة برمجياً (SDN)، مظهرةً أن تهيئة نموذج Gemma-4-31B-IT تحقق أعلى مستويات الدقة والاستقرار.

Mohammed N. Swileh, Shengli Zhang, Kai Lei2026-05-27
🤖 machine learning

Curriculum Learning for Safety Alignment

تقترح هذه الورقة "الكفاءة المرحلية" (Staged-Competence)، وهو إطار عمل للتعلم المنهجي ينظم بيانات التفضيل حسب درجة الصعوبة ويقوم بتحديث النموذج المرجعي تدريجياً لتحسين متانة التحسين المباشر للتفضيلات (DPO) تجاه البيانات خارج النطاق ومقاومة الاختراق لأغراض السلامة بشكل كبير، مع الحفاظ على القدرات العامة.

Sandeep Kumar, Virginia Smith, Chhavi Yadav2026-05-27