💬 NLP

ClaimPT: A Portuguese Dataset of Annotated Claims in News Articles

تقدم هذه الورقة ClaimPT، وهي مجموعة بيانات للغة البرتغالية الأوروبية عالية الجودة تتكون من 1,308 مقالاً إخبارياً من وكالة أنباء LUSA تحتوي على 6,875 ادعاءً واقعياً مُصنفاً، صُممت لمعاللة ندرة الموارد لعمليات التحقق من الحقائق آلياً في اللغات ذات الموارد المحدودة ووضع معايير مرجعية أساسية للكشف عن الادعاءات.

Ricardo Campos, Raquel Sequeira, Sara Nerea, Inês Cantante, Diogo Folques, Luís Filipe Cunha, João Canavilhas, António B (…)2026-03-30
💬 NLP

AI and My Values: User Perceptions of LLMs' Ability to Extract, Embody, and Explain Human Values from Casual Conversations

تقدم هذه الورقة "مجموعة أدوات إدراك توافق القيم" (VAPT) لتقييم كيفية إدراك المستخدمين لقدرة النماذج اللغوية الكبيرة على استخراج قيمهم وتجسيدها وشرحها، كاشفةً أنه في حين اقتنع العديد من المشاركين بفهم الذكاء الاصطناعي، فإن هذه الظاهرة تثير مخاوف حرجة بشأن "التعاطف المسلح" والحاجة إلى ضمانات شفافة في تصميم الذكاء الاصطناعي المستقبلي.

Bhada Yun, Renn Su, April Yi Wang2026-03-30
💬 NLP

MiNER: A Two-Stage Pipeline for Metadata Extraction from Municipal Meeting Minutes

تقدم هذه الورقة MiNER، وهو مسار عمل مكون من مرحلتين يجمع بين الإجابة على الأسئلة والنماذج القائمة على المحولات (Transformer) لاستخراج البيانات الوصفية من محاضر الاجتماعات البلدية غير المتجانسة، والذي يُظهر أداءً قوياً في النطاق المحلي ويضع المعيار الأول لهذه المهمة رغم التحديات في التعميم عبر البلديات المختلفة.

Rodrigo Batista, Luís Filipe Cunha, Purificação Silvano, Nuno Guimarães, Alípio Jorge, Evelin Amorim, Ricardo Campos2026-03-30
💬 NLP

CitiLink-Minutes: A Multilayer Annotated Dataset of Municipal Meeting Minutes

تقدم هذه الورقة البحثية CitiLink-Minutes، وهي مجموعة بيانات متعددة الطبقات والموسومة تضم أكثر من مليون رمز (token) مستخرجة من ١٢٠ محضر اجتماع بلدية باللغة البرتغالية الأوروبية، وتتميز ببيانات وصفية مهيكلة، ومواضيع نقاش، ونتائج تصويت، وذلك لتعزيز الأبحاث في مجال معالجة اللغات الطبيعية واسترجاع المعلومات للحوكمة المحلية.

Ricardo Campos, Ana Filipa Pacheco, Ana Luísa Fernandes, Inês Cantante, Rute Rebouças, Luís Filipe Cunha, José Miguel Is (…)2026-03-30
💬 NLP

Quantization-Robust LLM Unlearning via Low-Rank Adaptation

تقترح هذه الورقة طريقة لـ "إلغاء التعلم" (unlearning) قوية تجاه التكميم باستخدام التكيف منخفض الرتبة (LoRA)، والتي تعمل على تجميد النموذج الأساسي للحفاظ على تحديثات إلغاء التعلم تحت تأثير التكميم الشديد بعد التدريب بدقة 4 بت، مما يؤدي إلى تحسين المنفعة وتقليل تسرب الخصوصية بشكل كبير مقارنة بالضبط الدقيق القياسي لكامل المعلمات.

João Vitor Boer Abitante, Joana Meneguzzo Pasquali, Luan Fonseca Garcia, Ewerton de Oliveira, Thomas da Silva Paula, Rod (…)2026-03-30
💬 NLP

LLM-to-Speech: A Synthetic Data Pipeline for Training Dialectal Text-to-Speech Models

تقدم هذه الورقة NileTTS، وهي أول مجموعة بيانات متاحة للجمهور لتحويل النص إلى كلام باللهجة المصرية ومسار بيانات اصطناعية قابل لإعادة الإنتاج، لمعالجة ندرة الموارد لهذه اللهجة واسعة الانتشار عبر توليد 38 ساعة من الكلام المتنوع بواسطة النماذج اللغوية الكبيرة وضبط نموذج XTTS v2.

Ahmed Khaled Khamis, Hesham Ali2026-03-30
💬 NLP

Relational graph-driven differential denoising and diffusion attention fusion for multimodal conversation emotion recognition

تقترح هذه الورقة نموذجاً لدمج الانتباه في التناثر وإزالة الضجيج المدرك للعلاقات للتعرف على عواطف المحادثة متعدد الوسائط، والذي يستخدم محولاً تفاضلياً لتثبيط الضوضاء في الصوت والفيديو، ويستغل الرسوم البيانية الفرعية للعلاقات لالتقاط التبعيات العاطفية المعتمدة على المتحدث، ويسخر آلية تناثر موجهة نصياً لتحقيق دمج متعدد الوسائط قوي ومتوافق دلالياً.

Ying Liu, Yuntao Shou, Wei Ai, Tao Meng, Keqin Li2026-03-30
💬 NLP

RealChart2Code: Advancing Chart-to-Code Generation with Real Data and Multi-Task Evaluation

تقدم هذه الورقة البحثية \texttt{RealChart2Code}، وهو معيار مرجعي جديد واسع النطاق يضم أكثر من 2,800 حالة مستندة إلى مجموعات بيانات حقيقية لتقييم قدرات نماذج الرؤية واللغة بشكل منهجي في توليد مخططات معقدة متعددة الأجزاء من البيانات الخام وتحسينها من خلال محادثات متعددة الأدوار، مما يكشف عن فجوات أداء كبيرة بين النماذج المملوكة والنماذج ذات الأوزان المفتوحة.

Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng, Yiran Yang, Jianke Zhang, Qingbin Li, Shannan Y (…)2026-03-30
💬 NLP

Can Small Models Reason About Legal Documents? A Comparative Study

تُظهر هذه الدراسة أن النماذج التي يقل عدد معاملاتها عن 10 مليارات، ولا سيما بنية "خليط الخبراء" (Mixture-of-Experts) ذات الـ 3 مليارات معلمة، يمكنها مضاهاة أو تجاوز النماذج الرائدة مثل GPT-4o-mini في الاختبارات المعيارية القانونية عند اقترانها باستراتيجيات صياغة أوامر مناسبة، مما يكشف أن بنية النموذج وجودة التدريب أكثر أهمية من عدد المعلمات الخام، مع تسليط الضوء على الفعالية المعتمدة على المهمة لطرق الصياغة المختلفة وكفاية الاسترجاع الكثيف لتقنية التوليد المعزز بالاسترداد (RAG).

Snehit Vaddi2026-03-30
💬 NLP

When Chain-of-Thought Backfires: Evaluating Prompt Sensitivity in Medical Language Models

تُظهر هذه الورقة أن تقنيات هندسة الأوامر القياسية، مثل سلسلة الأفكار والتحفيز بلقطات قليلة، تُضعف بشكل كبير أداء النماذج اللغوية الكبيرة الطبية، بينما توفر تقنيات التقييم بالفراغات والتصويت بالتبديل بدائل أكثر قوة ودقة للإجابة على الأسئلة الطبية.

Binesh Sadanandan, Vahid Behzadan2026-03-30