🤖 machine learning

Deterministic Differentiable Structured Pruning for Large Language Models

تقدم هذه الورقة البحثية طريقة "التقليم التفاضلي الحتمي" (DDP)، وهي منهجية مبتكرة تقضي على عدم التطابق بين التدريب والاختبار والعشوائية في أساليب التقليم الهيكلي السابقة من خلال التحسين المباشر لنموذج بديل ناعم حتمي لهدف l0، مما يحقق تقارباً أسرع، وتعبيراً أكبر، وقدرة فائقة على الاحتفاظ بالأداء (على سبيل المثال، فقدان بنسبة ~1%) في النماذج اللغوية الكبيرة مثل Qwen3 عند مستويات تخلخل عالية.

Weiyu Huang, Pengle Zhang, Xiaolu Zhang, Jun Zhou, Jun Zhu, Jianfei Chen2026-03-10
💬 NLP

Ramsa: A Large Sociolinguistically Rich Emirati Arabic Speech Corpus for ASR and TTS

تقدم الورقة البحثية "رامسا"، وهي مدونة صوتية للغة العربية الإماراتية متنوعة لغويًا واجتماعيًا مدتها 41 ساعة وتضم 157 متحدثًا عبر مختلف اللهجات والمواضيع، والتي تعمل كمورد أساسي لتطوير تقنيات التعرف التلقائي على الكلام (ASR) وتحويل النص إلى كلام (TTS) منخفضة الموارد مع وضع خطوط أساس أداء أولية للنماذج الحالية.

Rania Al-Sabbagh2026-03-10
💬 NLP

EvoScientist: Towards Multi-Agent Evolving AI Scientists for End-to-End Scientific Discovery

يُعد EvoScientist إطار عمل متعدد الوكلاء متطوراً يستفيد من الذاكرة المستمرة والتطور الذاتي لصقل استراتيجيات البحث باستمرار، مما يجعله يتفوق على الأنظمة الحالية الرائدة في توليد أفكار علمية مبتكرة وتنفيذ تجارب ناجحة للاكتشاف الشامل من البداية إلى النهاية.

Yougang Lyu, Xi Zhang, Xinhao Yi, Yuyue Zhao, Shuyu Guo, Wenxiang Hu, Jan Piotrowski, Jakub Kaliski, Jacopo Urbani, Zaiq (…)2026-03-10
💬 NLP

Gender Bias in MT for a Genderless Language: New Benchmarks for Basque

تقدم هذه الورقة معيارين جديدين، WinoMTeus وFLORES+Gender، لتقييم التحيز الجنساني في الترجمة الآلية التي تشمل اللغة الباسكية، مما يكشف أن النماذج اللغوية الكبيرة وأنظمة الترجمة الآلية الحالية تظهر تفضيلاً منهجياً للصور المذكرة عند الترجمة بين اللغات غير المحددة جنسياً واللغات المحددة جنسياً.

Amaia Murillo, Olatz-Perez-de-Viñaspre, Naiara Perez2026-03-10
💬 NLP

RexDrug: Reliable Multi-Drug Combination Extraction through Reasoning-Enhanced LLMs

يُعد RexDrug إطار عمل لنماذج لغوية كبيرة معززة بالاستنتاج، يستخدم استراتيجية تدريب ثنائية المراحل تجمع بين التوليد الاستنتاجي التعاوني متعدد الوكلاء والتعلم التعزيزي لتحقيق أداء رائد في استخراج تركيبات الأدوية المعقدة متعددة العناصر (n-ary) من الأدبيات الطبية الحيوية.

Zhijun Wang, Ling Luo, Dinghao Pan, Huan Zhuang, Lejing Yu, Yuanyuan Sun, Hongfei Lin2026-03-10
💬 NLP

TildeOpen LLM: Leveraging Curriculum Learning to Achieve Equitable Language Representation

تقدم هذه الورقة البحثية نموذج TildeOpen LLM، وهو نموذج مفتوح الأوزان بـ 30 مليار معلمة يحقق أداءً فائقاً عبر 34 لغة أوروبية، لا سيية للمجموعات ذات الموارد المنخفضة، وذلك من خلال توظيف التعلم المنهجي وزيادة عينات البيانات لمعالجة عدم التوازن في البيانات دون الحاجة إلى زيادة الموارد الحوسبية.

Toms Bergmanis, Martins Kronis, Ingus Jānis Pretkalniņš, Dāvis Nicmanis, Jeļizaveta Jeļinska, Roberts Rozis, Rinalds Vīk (…)2026-03-10
💬 NLP

DualTurn: Learning Turn-Taking from Dual-Channel Generative Speech Pretraining

يُعد DualTurn نموذجاً توليدياً للكلام ثنائي القنوات يتعلم ديناميكيات تبادل الأدوار الطبيعية من خلال التدريب المسبق غير الخاضع للإشراف على التسجيلات الصوتية الحوارية والضبط الدقيق للتنبؤ بأفعال الوكيل، متفوقاً بذلك على الأساليب الحالية في كل من دقة التنبؤ بالفعل واستباق حدود تبادل الأدوار مع تمكينه من قدرات استدعاء الأدوات.

Shangeth Rajaa2026-03-10
💬 NLP

Quantifying Cross-Lingual Transfer in Paralinguistic Speech Tasks

تقدم هذه الورقة مصفوفة النقل عبر اللغات (CLTM) للقياس المنهجي لتباينات الأداء المعتمدة على اللغة في المهام شبه اللغوية مثل تحديد الجنس والتحقق من هوية المتحدث، كاشفةً أنه على الرغم من طبيعتها الصوتية، تُظهر هذه المهام أنماط نقل عبر اللغات متميزة عند استخدام مشفرات تعتمد على نموذج HuBERT متعدد اللغات.

Pol Buitrago, Oriol Pareras, Federico Costa, Javier Hernando2026-03-10
🤖 machine learning

Fibration Policy Optimization

تقدم هذه الورقة البحثية "تحسين سياسة الألياف" (FiberPO)، وهو إطار عمل موحد يربط بين نظرية منطقة الثقة والبنى الجبرية التركيبية لتمكين التحكم المبدئي في الاستقرار متعدد المقاييس في تدريب النماذج اللغوية الكبيرة من خلال "هدف رقابة السياسة التجميعي" المبتكر وآلية "بوابة حزمة الألياف".

Chang Li, Tshihao Tsu, Yaren Zhang, Chao Xue, Xiaodong He2026-03-10
💬 NLP

Sensivity of LLMs' Explanations to the Training Randomness:Context, Class & Task Dependencies

تتقصى هذه الورقة كيف تؤثر عشوائية التدريب على استقرار تفسيرات نماذج "ترانسفورمر" (Transformer)، حيث تُبين أنه في حين أن السياق النحوي، وفئات الأهداف، وأنواع المهام، جميعها تؤثر بشكل كبير على هذه الحساسية، فإن التأثير يكون في أدنى مستوياته بالنسبة للسياق، ومتوسطاً للفئات، وأكبره للمهام.

Romain Loncour, Jérémie Bogaert, François-Xavier Standaert2026-03-10