🤖 machine learning

SlimQwen: Exploring the Pruning and Distillation in Large MoE Model Pre-training

تتقصى هذه الورقة بشكل منهجي التقليم الهيكلي وتقطير المعرفة لضغط نماذج خليط الخبراء (MoE) واسعة النطاق أثناء مرحلة ما قبل التدريب، مبرهنةً على أن التقليم يوفر تهيئة فائقة، وأن جداول الضغط التدريجية تتفوق على أساليب الخطوة الواحدة، وأن الجمع بين نمذجة اللغة وتقطير التنبؤ متعدد الرموز يحقق أداءً تنافسياً في نموذج أصغر حجماً بشكل ملحوظ.

Shengkun Tang, Zekun Wang, Bo Zheng, Liangyu Wang, Rui Men, Siqi Zhang, Xiulong Yuan, Zihan Qiu, Zhiqiang Shen, Dayiheng (…)2026-05-12
🤖 machine learning

Communicating Sound Through Natural Language

تقدم هذه الورقة "الترميز الصوتي المعجمي" (LAC)، وهو إطار عمل تتواصل فيه وكلاء النماذج اللغوية الكبيرة (LLM) المدربة مسبقًا عبر الصوت من خلال تحويل الموجات الصوتية إلى أوصاف نصية إنجليزية قابلة للتفسير وإعادة بنائها عبر صقل الحلقة المغلقة، مما يعامل اللغة الطبيعية فعليًا كتمثيل نقل فاقد ذي معدل محدود للصوت.

Emanuele Rossi, Emanuele Rodolà2026-05-12
🤖 AI

SimReg: Achieving Higher Performance in the Pretraining via Embedding Similarity Regularization

تقترح الورقة البحثية SimReg، وهي طريقة لتنظيم تشابه التضمين في مرحلة ما قبل التدريب للنماذج اللغوية الكبيرة، تعمل على تقليل التباين داخل الفئة الواحدة وتقليل التشابه بين الفئات لتسريع التقارب بنسبة تزيد عن 30% وتحسين أداء الصفر المعرفي (zero-shot) في المهام اللاحقة بأكثر من 1%.

Yan Sun, Guoxia Wang, Jinle Zeng, JiaBin Yang, Shuai Li, Li Shen, Dacheng Tao, DianHai Yu, Haifeng Wang2026-05-12
🤖 AI

The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans

تكشف هذه الورقة أنه بينما تستطيع النماذج اللغوية الكبيرة تحديد أبعاد التجذر عند استجوابها صراحةً، إلا أنها تظهر "فجوة تجذر" كبيرة مقارنة بالبشر من خلال الاعتماد المفرط على الارتباطات اللفظية والفشل في استدعاء مفاهيم الحالات العاطفية والداخلية بشكل طبيعي أثناء التوليد الحر.

Odysseas S. Chlapanis, Orfeas Menis Mastromichalakis, Christos H. Papadimitriou2026-05-12
🤖 AI

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

تقدم هذه الورقة SeedRG، وهي مسار لتوليد معايير قياسية شبه اصطناعية يخفف من حدة تسرب المعرفة وتقادم المعايير في تقييم التوليد المعزز بالاسترجاع (RAG) عن طريق استخراج رسوم بيانية للاستدلال من البيانات البذرية وتوليد أمثلة جديدة مشابهة هيكلياً لا يمكن الإجابة عليها من الذاكرة البارامترية للنماذج اللغوية الكبيرة (LLM).

Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville2026-05-12
💬 NLP

Architecture, Not Scale: Circuit Localization in Large Language Models

تتحدى هذه الورقة الافتراض القائل بأن التفسير الآلي يزداد سوءاً بطبيعته مع حجم النموذج، مبرهنةً بدلاً من ذلك على أن الخيارات المعمارية مثل انتباه الاستعلام المجموع وعتبات القياس المحددة تؤدي إلى تحديد أكثر تركيزاً واستقراراً للدوائر في النماذج اللغوية الكبيرة.

Sohan Venkatesh2026-05-12
🤖 machine learning

Max-pooling Network Revisited: Analyzing the Role of Semantic Probability in Multiple Instance Learning for Hallucination Detection

تقترح هذه الورقة طريقة فعالة حاسوبياً للكشف عن الهلوسة تستبدل حسابات الاتساق الدلالي المكلفة المستخدمة في مناهج التعلم التداخلي متعدد الوسائط (MIL) المتطورة بشبكة تجميع قصوى (max-pooling) وطبقة إدراك متعدد الطبقات (MLP) خفيفة الوزن، محققةً أداءً تنافسياً من خلال الاستفادة من الرؤى النظرية حول توسيع هامش القرار.

Shota Fujikawa, Issei Sato2026-05-12
🤖 AI

Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

تكشف هذه الورقة أن النماذج اللغوية الكبيرة ذات التكميم المفرط تعاني من تدهور منهجي في السلاسة يؤدي إلى رداءة جودة التوليد، وتقترح مبدأً حافظاً للسلاسة يحقق مكاسب في الأداء تتجاوز مجرد التحسينات في الدقة العددية.

Yuzhuang Xu, Xu Han, Yuxuan Li, Pengzhan Li, Wanxiang Che2026-05-12
🤖 AI

FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness

تقدم هذه الورقة FragileFlow، وهو منظم إضافي (plug-in regularizer) يعمل على صياغة والتحكم في أخطاء التنبؤ "الصحيحة ولكن الهشة" عبر تحليل طيفي مدرك للهامش (margin-aware spectral analysis) لتحسين متانة الحالة الأسوأ (worst-class robustness) في النماذج التأسيسية مع الحفاظ على دقة البيانات النظيفة.

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Xiaowei Huang, Yi Dong2026-05-12
🤖 machine learning

Non-Monotonic Latency in Apple MPS Decoding: KV Cache Interactions and Execution Regimes

تكشف هذه الورقة أن خلفية (MPS) الخاصة بشركة أبل تظهر طفرات زمنية غير رتيبة وغير متوقعة أثناء الاستدلال التوليدي (autoregressive inference)، حيث يمكن لأداء فك الترميز أن يتدهور فجأة بمقدار يصل إلى 21 ضعفاً لإعدادات محددة بسبب ديناميكيات تنفيذ الخلفية، مما يتناقض مع التوسع السلس الملحوظ في أنظمة المعالجات المركزية (CPU) وأنظمة (NVIDIA CUDA).

Willy Fitra Hendria2026-05-12