💬 NLP

Out of the Memory Barrier: A Highly Memory Efficient Training System for LLMs with Million-Token Contexts

يُعد OOMB نظام تدريب عالي الكفاءة في استهلاك الذاكرة للنماذج اللغوية الكبيرة ذات السياق الطويل، حيث يستخدم إطار عمل تكراري قائم على الأجزاء (chunk-recurrent framework) مع إعادة حساب التنشيط آنياً وتحسينات تآزرية لذاكرة التخزين المؤقت لـ KV، مما يمكّن من تدريب نماذج مثل Qwen2.5-7B بسياقات تصل إلى مليون توكن على وحدة معالجة رسوميات واحدة.

Wenhao Li, Daohai Yu, Gen Luo, Yuxin Zhang, Fei Chao, Rongrong Ji, Yifan Wu, Jiaxin Liu, Ziyang Gong, Zimu Liao2026-03-03
⚡ electrical engineering

WAXAL: A Large-Scale Multilingual African Language Speech Corpus

تقدم هذه الورقة البحثية WAXAL، وهو متن لغوي صوتي متعدد اللغات، واسع النطاق، ومتاح للوصول المفتوح، يضم أكثر من 1,485 ساعة من البيانات عبر 24 لغة من دول أفريقيا جنوب الصحراء الكبرى، صُمم لسد الفجوة الرقمية والنهوض بتكنولوجيا الكلام لهذه المجتمعات ذات الموارد المحدودة.

Abdoulaye Diack, Perry Nelson, Kwaku Agbesi, Angela Nakalembe, MohamedElfatih MohamedKhair, Vusumuzi Dube, Tavonga Siyav (…)2026-03-03
💬 NLP

FASA: Frequency-aware Sparse Attention

يُعد FASA إطار عمل مبتكر يعالج عنق زجاجة الذاكرة في النماذج اللغوية الكبيرة ذات السياق الطويل من خلال الاستفادة من تشتت كتل التردد في تمثيل التدوير الموضعي (RoPE) لتحديد والاحتفاظ فقط بالرموز الأكثر أهمية لانتباه الاستعلام الواعي، مما يحقق دقة تقارب الدقة المثالية (near-oracle) مع تقليل استخدام ذاكرة التخزين المؤقت لـ KV بشكل كبير.

Yifei Wang, Yueqi Wang, Zhenrui Yue, Huimin Zeng, Yong Wang, Ismini Lourentzou, Zhengzhong Tu, Xiangxiang Chu, Julian Mc (…)2026-03-03
⚡ electrical engineering

Universal Robust Speech Adaptation for Cross-Domain Speech Recognition and Enhancement

تقدم هذه الورقة URSA-GAN، وهو إطار توليدي موحد يستخدم بنية تضمين مزدوجة واضطراباً عشوائياً ديناميكياً للتخفيف بفعالية من انزياحات النطاق الناتجة عن الضوضاء غير المرئية وتشويهات القنوات، مما يحسن بشكل كبير من متانة وأداء كل من أنظمة التعرف التلقائي على الكلام وأنظمة تحسين الكلام.

Chien-Chun Wang, Hung-Shin Lee, Hsin-Min Wang, Berlin Chen2026-03-03
💬 NLP

Investigating Disability Representations in Text-to-Image Models

تتقصى هذه الدراسة التمثيل غير المستكشف كفايةً للإعاقة في نماذج تحويل النص إلى صورة مثل "Stable Diffusion XL" و"DALL-E 3"، كاشفةً عن اختلالات مستمرة وقضايا في التأطير العاطفي تسلط الضوء على الحاجة الملحة للتقييم والتحسين المستمرين لتعزيز تصويرات أكثر شمولاً.

Yang Tian, Yu Fan, Liudmila Zavolokina, Sarah Ebling2026-03-03
💬 NLP

Online Causal Kalman Filtering for Stable and Effective Policy Optimization

تقترح هذه الورقة البحثية "ترشيح كالمان السببي عبر الإنترنت لتحسين السياسة" (KPO)، وهي طريقة مبتكرة تُمذل نسب أخذ العينات الهامة كحالات كامنة متطورة يتم تحديثها عبر ترشيح كالمان للتخفيف من ضوضاء التباين العالي وعدم الاتساق الهيكلي في التعلم خارج السياسة على مستوى الرمز (token-level)، مما يحقق تعلماً معززاً أكثر استقراراً وفعالية للنماذج اللغوية الكبيرة.

Shuo He, Lang Feng, Xin Cheng, Lei Feng, Bo An2026-03-03
💬 NLP

MiniCPM-SALA: Hybridizing Sparse and Linear Attention for Efficient Long-Context Modeling

تقدم هذه الورقة البحثية MiniCPM-SALA، وهو نموذج هجين بـ 9 مليارات معلمة يجمع بين آليات الانتباه المتناثر والخطي مع إطار عمل للتدريب المستمر منخفض التكلفة لتحقيق نمذجة سياق طويل عالية الأداء وفعالة تصل إلى مليون رمز، مع تقليل تكاليف التدريب وزمن انتقال الاستدلال بشكل كبير مقارنة بنماذج الانتباه الكامل التقليدية.

MiniCPM Team, Wenhao An, Yingfa Chen, Yewei Fang, Jiayi Li, Xin Li, Yaohui Li, Yishan Li, Yuxuan Li, Biyuan Lin, Chuan L (…)2026-03-03
💬 NLP

Unleashing Low-Bit Inference on Ascend NPUs: A Comprehensive Evaluation of HiFloat Formats

تقيم هذه الورقة تنسيقات HiFloat (HiF8 وHiF4) على وحدات المعالجة العصبية Ascend، مما يثبت أداءها المتفوق على التنسيقات الصحيحة في التعامل مع البيانات عالية التباين ومنع انهيار الدقة في أنظمة الـ 4 بت مع الحفاظ على التوافق مع أطر عمل التكميم الحديثة من أجل استنتاج فعال للنماذج اللغوية الكبيرة.

Pengxiang Zhao, Hui-Ling Zhen, Xing Li, Han Bao, Weizhe Lin, Zhiyuan Yang, Manyi Zhang, Yuanyong Luo, Ziwei Yu, Xin Wang (…)2026-03-03
💬 NLP

Are LLMs Ready to Replace Bangla Annotators?

تقيم هذه الورقة ١٧ نموذجاً لغوياً كبيراً كموسمين بنظام "التعلم الصفري" لخطاب الكراهية باللغة البنغالية، كاشفةً عن إظهارها انحيازاً وعدم استقرار ملحوظين، مع تفوق النماذج الأصغر والمتوافقة مع المهمة غالباً على النماذج الأكبر، مما يسلط الضوء على محدودية النماذج اللغوية الكبيرة الحالية في مهام التوسيم الحساسة للغات ذات الموارد المنخفضة.

Md. Najib Hasan, Touseef Hasan, Souvika Sarkar2026-03-03
💬 NLP

Large Language Models are Algorithmically Blind

تكشف هذه الورقة أنه على الرغم من معرفتها الواسعة، تعاني النماذج اللغوية الكبيرة من "العمى الخوارزمي"، حيث تفشل بشكل منهجي في التنبؤ بدقة أو الاستنتاج حول العمليات الحسابية والأداء الخوارزمي، وغالبًا ما يكون أداؤها ليس أفضل من التخمين العشوائي بسبب فجوة جوهرية بين معرفتها التقريرية وقدراتها على الاستدلال الإجرائي.

Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote2026-03-03