💬 NLP

Hearing to Translate: The Effectiveness of Speech Modality Integration into LLMs

تقدم هذه الورقة البحثية "Hearing to Translate"، وهو معيار شامل لتقييم 6 نماذج لغوية كبيرة للكلام (SpeechLLMs) مقابل 16 نظاماً متتالياً عبر ظروف متنوعة، كاشفةً أنه في حين تظل البنى المتتالية هي الأكثر موثوقية بشكل عام، فإن دمج النماذج اللغوية الكبيرة أمر ضروري للترجمة الكلامية عالية الجودة، وأن النماذج اللغوية الكبيرة للكلام الحديثة يمكنها مضاهاة أو تجاوز الأنظمة المتتالية في إعدادات محددة.

Sara Papi, Javier Garcia Gilabert, Zachary Hopton, Vilém Zouhar, Carlos Escolano, Gerard I. Gállego, Jorge Iranzo-Sánche (…)2026-03-30
💬 NLP

T^\star: Progressive Block Scaling for Masked Diffusion Language Models Through Trajectory Aware Reinforcement Learning

تقدم الورقة البحثية TT^\star، وهو منهج تدريبي قائم على TraceRL يُمكّن نماذج اللغة ذات الانتشار المقنع من التوسع تدريجياً من كتل فك تشفير صغيرة إلى كبيرة، محققاً قدرة فك تشفير عالية التوازي مع أدنى فقد في الأداء في مهام الاستدلال الرياضي.

Hanchen Xia, Baoyou Chen, Yutang Ge, Guojiang Zhao, Siyu Zhu2026-03-30
💬 NLP

CitiLink: Enhancing Municipal Transparency and Citizen Engagement through Searchable Meeting Minutes

سيتي لينك (CitiLink) هي منصة تجريبية تسخر النماذج اللغوية الكبيرة لتحويل محاضر الاجتماعات البلدية غير المهيكلة إلى بيانات مهيكلة وقابلة للبحث، مما يعزز الشفافية الحكومية والمشاركة المدنية من خلال واجهة سهلة الاستخدام تم اختبارها على سجلات بلدية برتغالية.

Rodrigo Silva, José Evans, José Isidro, Miguel Marques, Afonso Fonseca, Ricardo Morais, João Canavilhas, Arian Pasquali (…)2026-03-30
💬 NLP

Formula-One Prompting: Equation-First Reasoning For Applied Mathematics

تقدم الورقة البحثية أسلوب "Formula-One Prompting" (F-1)، وهو طريقة استدلال ثنائية المراحل تعمل على تحسين أداء النماذج اللغوية الكبيرة في الرياضيات التطبيقية من خلال صياغة المعادلات الحاكمة صراحةً كخطوة وسيطة قبل اختيار استراتيجية الحل، مما يؤدي إلى التفوق على أساليب "Chain-of-Thought" و"Program-of-Thought" الحالية عبر اختبارات معيارية متعددة.

Natapong Nitarach, Pittawat Taveekitworachai, Kunat Pipatanakul2026-03-30
💬 NLP

ClaimPT: A Portuguese Dataset of Annotated Claims in News Articles

تقدم هذه الورقة ClaimPT، وهي مجموعة بيانات للغة البرتغالية الأوروبية عالية الجودة تتكون من 1,308 مقالاً إخبارياً من وكالة أنباء LUSA تحتوي على 6,875 ادعاءً واقعياً مُصنفاً، صُممت لمعاللة ندرة الموارد لعمليات التحقق من الحقائق آلياً في اللغات ذات الموارد المحدودة ووضع معايير مرجعية أساسية للكشف عن الادعاءات.

Ricardo Campos, Raquel Sequeira, Sara Nerea, Inês Cantante, Diogo Folques, Luís Filipe Cunha, João Canavilhas, António B (…)2026-03-30
💬 NLP

AI and My Values: User Perceptions of LLMs' Ability to Extract, Embody, and Explain Human Values from Casual Conversations

تقدم هذه الورقة "مجموعة أدوات إدراك توافق القيم" (VAPT) لتقييم كيفية إدراك المستخدمين لقدرة النماذج اللغوية الكبيرة على استخراج قيمهم وتجسيدها وشرحها، كاشفةً أنه في حين اقتنع العديد من المشاركين بفهم الذكاء الاصطناعي، فإن هذه الظاهرة تثير مخاوف حرجة بشأن "التعاطف المسلح" والحاجة إلى ضمانات شفافة في تصميم الذكاء الاصطناعي المستقبلي.

Bhada Yun, Renn Su, April Yi Wang2026-03-30
💬 NLP

MiNER: A Two-Stage Pipeline for Metadata Extraction from Municipal Meeting Minutes

تقدم هذه الورقة MiNER، وهو مسار عمل مكون من مرحلتين يجمع بين الإجابة على الأسئلة والنماذج القائمة على المحولات (Transformer) لاستخراج البيانات الوصفية من محاضر الاجتماعات البلدية غير المتجانسة، والذي يُظهر أداءً قوياً في النطاق المحلي ويضع المعيار الأول لهذه المهمة رغم التحديات في التعميم عبر البلديات المختلفة.

Rodrigo Batista, Luís Filipe Cunha, Purificação Silvano, Nuno Guimarães, Alípio Jorge, Evelin Amorim, Ricardo Campos2026-03-30
💬 NLP

CitiLink-Minutes: A Multilayer Annotated Dataset of Municipal Meeting Minutes

تقدم هذه الورقة البحثية CitiLink-Minutes، وهي مجموعة بيانات متعددة الطبقات والموسومة تضم أكثر من مليون رمز (token) مستخرجة من ١٢٠ محضر اجتماع بلدية باللغة البرتغالية الأوروبية، وتتميز ببيانات وصفية مهيكلة، ومواضيع نقاش، ونتائج تصويت، وذلك لتعزيز الأبحاث في مجال معالجة اللغات الطبيعية واسترجاع المعلومات للحوكمة المحلية.

Ricardo Campos, Ana Filipa Pacheco, Ana Luísa Fernandes, Inês Cantante, Rute Rebouças, Luís Filipe Cunha, José Miguel Is (…)2026-03-30
💬 NLP

Quantization-Robust LLM Unlearning via Low-Rank Adaptation

تقترح هذه الورقة طريقة لـ "إلغاء التعلم" (unlearning) قوية تجاه التكميم باستخدام التكيف منخفض الرتبة (LoRA)، والتي تعمل على تجميد النموذج الأساسي للحفاظ على تحديثات إلغاء التعلم تحت تأثير التكميم الشديد بعد التدريب بدقة 4 بت، مما يؤدي إلى تحسين المنفعة وتقليل تسرب الخصوصية بشكل كبير مقارنة بالضبط الدقيق القياسي لكامل المعلمات.

João Vitor Boer Abitante, Joana Meneguzzo Pasquali, Luan Fonseca Garcia, Ewerton de Oliveira, Thomas da Silva Paula, Rod (…)2026-03-30
💬 NLP

LLM-to-Speech: A Synthetic Data Pipeline for Training Dialectal Text-to-Speech Models

تقدم هذه الورقة NileTTS، وهي أول مجموعة بيانات متاحة للجمهور لتحويل النص إلى كلام باللهجة المصرية ومسار بيانات اصطناعية قابل لإعادة الإنتاج، لمعالجة ندرة الموارد لهذه اللهجة واسعة الانتشار عبر توليد 38 ساعة من الكلام المتنوع بواسطة النماذج اللغوية الكبيرة وضبط نموذج XTTS v2.

Ahmed Khaled Khamis, Hesham Ali2026-03-30