💬 NLP

Triples and Knowledge-Infused Embeddings for Clustering and Classification of Scientific Documents

تقيم هذه الدراسة مساراً نموذجياً لتجميع وتصنيف الوثائق العلمية باستخدام تضمينات المحولات وثلاثيات (مبتدأ-خبر-مفعول به)، حيث وجدت أنه بينما تعد المعرفة المهيكلة معلوماتية، فإن تمثيلات النصوص المجردة تتفوق باستمرار أو تضاهي المتغيرات المعززة بالمعرفة، مما يشير إلى أن فوائد التعزيز القائم على الثلاثيات تعتمد بشكل كبير على الإعدادات بدلاً من كونها عالمية.

Mihael Arcan2026-04-21
💬 NLP

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

تقدم الورقة البحثية "الإسكندرية" (Alexandria)، وهي مجموعة بيانات ضخمة مدفوعة من المجتمع تضم 107 ألف دورة محادثة متوازية بين الإنجليزية واللهجات العربية عبر 13 دولة و11 مجالاً، مع بيانات وصفية دقيقة على مستوى المدن وتصنيفات جندرية، صُممت لتحسين أداء الترجمة الآلية والنماذج اللغوية الكبيرة للهجات العربية المتنوعة.

Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan S (…)2026-04-21
💬 NLP

The GDN-CC Dataset: Automatic Corpus Clarification for AI-enhanced Democratic Citizen Consultations

تقدم هذه الورقة مجموعة بيانات GDN-CC وإطار عمل لتوضيح المتون (Corpus Clarification) لتوحيد بيانات الاستشارات الديمقراطية المشوشة إلى وحدات حجاجية مهيكلة، مما يثبت أن النماذج اللغوية الصغيرة ذات الأوزان المفتوحة يمكنها أتمتة هذه العملية بفعالية وتمكين التحليل السياسي واسع النطاق.

Pierre-Antoine Lequeu, Léo Labat, Laurène Cave, Gaël Lejeune, François Yvon, Benjamin Piwowarski2026-04-21
💬 NLP

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

تكشف هذه الورقة أن الضبط الدقيق الحميد للنماذج اللغوية يمكن أن يتسبب في "فشل صامت" يُعرف باسم انهيار الخصوصية، حيث تفقد النماذج قدرتها على التفكير في معايير الخصوصية السياقية وتُسرب معلومات حساسة رغم حفاظها على أداء عالٍ في معايير السلامة والمنفعة القياسية.

Anmol Goel, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri2026-04-21
💬 NLP

From Attribution to Abstention: Training-Free Attention-Based Auditing for Clinical Summarization

تقدم الورقة البحثية ClinTrace، وهو إطار عمل لا يتطلب تدريباً يستفيد من أوزان انتباه فك التشفير (decoder attention weights) الموجودة في النماذج اللغوية الكبيرة متعددة الوسائط لتوليد عزوات المصدر دقيقة التفاصيل ودرجات كشف الهلوسة في آن واحد، مما يعزز الشفافية والأمانة في التلخيص السريري دون تكاليف استدلال إضافية.

Qianqi Yan, Huy Nguyen, Sumana Srivatsa, Hari Bandi, Xin Eric Wang, Krishnaram Kenthapadi2026-04-21
💬 NLP

LOGICAL-COMMONSENSEQA: A Benchmark for Logical Commonsense Reasoning

تقدم الورقة البحثية LOGICAL-COMMONSENSEQA، وهو معيار مرجعي جديد يعيد صياغة الاستدلال القائم على المنطق السليم كتركيب منطقي فوق أزواج من العبارات باستخدام مؤثرات مثل "و" (AND)، و"أو" (OR)، و"لا/ليس" (NEITHER/NOR)، مما يكشف أنه في حين تتعامل النماذج الحالية بشكل جيد مع مهام الربط والتقسيم، إلا أنها تعاني بشكل كبير في الاستدلال القائم على النفي.

Obed Junias, Maria Leonor Pacheco2026-04-21
💬 NLP

Information Representation Fairness in Long-Document Embeddings: The Peculiar Interaction of Positional and Language Bias

تحدد هذه الورقة تحيزات موضعية ولغوية منهجية في تمثيلات المستندات الطويلة حيث يتم الإفراط في تمثيل الأجزاء المبكرة واللغات ذات الموارد العالية، وتقترح إطار تقييم قائم على التبديل إلى جانب طريقة معايرة الانتباه عند الاستدلال للتخفيف من هذه المشكلات وتحسين قابلية اكتشاف جميع أجزاء المستند.

Elias Schuhmacher, Andrianos Michail, Juri Opitz, Rico Sennrich, Simon Clematide2026-04-21
💬 NLP

LVLMs and Humans Ground Differently in Referential Communication

تقدم هذه الورقة تجربة في التواصل المرجعي تُظهر أن نماذج الرؤية واللغة الكبيرة (LVLMs) تواجه صعوبة في إرساء أرضية مشتركة وتوليد أو حل التعبيرات المرجعية بشكل تفاعلي بفعالية تضاهي البشر، مما يحد من قدرتها على التعاون بسلاسة مع المستخدمين البشر.

Peter Zeng, Weiling Li, Amie Paige, Zhengxiang Wang, Panagiotis Kaliosis, Dimitris Samaras, Gregory Zelinsky, Susan Bren (…)2026-04-21
💬 NLP

Function Words as Statistical Cues for Language Learning

تُثبت هذه الورقة، من خلال التحليل عبر اللغات والنمذجة العصبية، أن الخصائص الإحصائية العالمية لكلمات الوظيفة — وتحديداً تواترها العالي، وارتباطها النحوي الموثوق، ومحاذاتها لحدود العبارات — تخلق توازناً مثالياً من نوع "غولديلاكس" (الاعتدال) يسهل اكتساب المعرفة النحوية المجردة من المدخلات الخطية.

Xiulin Yang, Heidi Getz, Ethan Gotlieb Wilcox2026-04-21
🤖 machine learning

Less Noise, More Voice: Reinforcement Learning for Reasoning via Instruction Purification

تقترح الورقة إطار عمل أخذ عينات أقل ضجيجاً (LENS)، وهو نهج للتعلم المعزز يحدد ويزيل رموز التداخل من المطالبات لتوجيه تحسين السياسة، مما يحسن بشكل كبير من كفاءة وأداء وسرعة تقارب استدلال النماذج اللغوية الكبيرة في المهام المعقدة مقارنة بالطرق الحالية مثل GRPO.

Yiju Guo, Tianyi Hu, Zexu Sun, Yankai Lin2026-04-21