💬 NLP

Self-Distillation for Multi-Token Prediction

تقترح هذه الورقة MTP-D، وهي طريقة تقطير ذاتي تعتمد على استراتيجية تمديد حلقية تعمل على تحسين معدلات قبول التنبؤ متعدد الرموز وسرعة الاستدلال بشكل كبير مع الحفاظ على أداء الرأس الرئيسي في النماذج اللغوية الكبيرة.

Guoliang Zhao, Ruobing Xie, An Wang, Shuaipeng Li, Huaibing Xie, Xingwu Sun2026-03-26
💬 NLP

Thinking with Tables: Enhancing Multi-Modal Tabular Understanding via Neuro-Symbolic Reasoning

تقدم هذه الورقة البحثية "التفكير مع الجداول" (TWT)، وهو إطار عمل للاستدلال العصبي الرمزي يستفيد من البرمجة المعتمدة على الكود لمعالقة التحديات الهيكلية وتحديات التبعية في البيانات الجدولية، متفوقاً بشكل كبير على النماذج المرجعية الحالية ومنافسًا للنماذج المملوكة في مهام الفهم متعدد الوسائط للجداول.

Kun-Yang Yu, Zhi Zhou, Shi-Yu Tian, Xiao-Wen Yang, Zi-Yi Jia, Ming Yang, Zi-Jian Cheng, Lan-Zhe Guo, Yu-Feng Li2026-03-26
💬 NLP

CVPD at QIAS 2026: RAG-Guided LLM Reasoning for Al-Mawarith Share Computation and Heir Allocation

تقدم الورقة البحثية مساراً للتوليد المعزز بالاسترجاع (RAG) يجمع بين البيانات الاصطناعية القائمة على القواعد، والاسترجاع الهجين مع إعادة ترتيب باستخدام المشفر المتقاطع، والتحقق المقيد بالمخطط (schema) لتحقيق أداء رائد في حساب حصص الميراث الإسلامي وتوزيعها على الورثة، مما ضمن المركز الأول في لوحة صدارة مسابقة QIAS 2026.

Wassim Swaileh, Mohammed-En-Nadhir Zighem, Hichem Telli, Salah Eddine Bekhouche, Abdellah Zakaria Sellam, Fadi Dornaika (…)2026-03-26
💬 NLP

Schema on the Inside: A Two-Phase Fine-Tuning Method for High-Efficiency Text-to-SQL at Scale

تقدم هذه الورقة نموذجاً متخصصاً بـ 8 مليارات معلمة (8B-parameter) لنظام Dream11 البيئي، يحقق أداءً عالي الدقة ومنخفض التأخير في تحويل النص إلى استعلام SQL (Text-to-SQL) عبر استخدام طريقة ضبط دقيق مبتكرة ثنائية المراحل لاستيعاب مخطط قاعدة البيانات داخلياً، مما أدى إلى تقليل رموز الإدخال (input tokens) بنسبة تزيد عن 99% والتفوق على النماذج المملوكة القائمة على واجهات برمجة التطبيقات (API-based) ذات الحالة الراهنة في بيئة إنتاج واسعة النطاق.

Chinmay Soni, Shivam Chourasia, Gaurav Kumar, Hitesh Kapoor2026-03-26
💬 NLP

ConceptKT: A Benchmark for Concept-Level Deficiency Prediction in Knowledge Tracing

تقدم هذه الورقة ConceptKT، وهو معيار ومجموعة بيانات جديدة مصممة لتطوير تتبع المعرفة من خلال تمكين التنبؤ بنقص مفاهيمي محدد عبر تقييم النماذج اللغوية الكبيرة والنماذج الاستدلالية الكبيرة باستخدام استراتيجيات التعلم في السياق القائمة على التوافق المفاهيمي والتشابه الدلالي.

Yu-Chen Kang, Yu-Chien Tang, An-Zi Yen2026-03-26
💬 NLP

LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scale

يكشف مشروع LLMpedia أن المعرفة الموسوعية الحقيقية للنماذج اللغوية الكبيرة أقل بكثير مما تشير إليه المعايير القياسية، وذلك من خلال إنشاء موسوعة مفتوحة بالكامل وخالية من الاسترجاع مكونة من مليون مقال تكشف عن فجوات جوهرية في الواقعية وتحيزات موضوعية عبر عائلات النماذج المختلفة.

Muhammed Saeed, Simon Razniewski2026-03-26
🤖 machine learning

The Alignment Tax: Response Homogenization in Aligned LLMs and Its Implications for Uncertainty Estimation

تحدد هذه الورقة "تجانس الاستجابة" كضريبة محاذاة كبيرة في النماذج اللغوية المدربة باستخدام التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) تجعل تقدير عدم اليقين القائم على أخذ العينات غير فعال، مبرهنةً أن إنتروبيا الرمز (token entropy) تظل إشارة قوية ومقترحةً استراتيجية تتابع منخفضة التكلفة لتحسين دقة التنبؤ الانتقائي.

Mingyi Liu2026-03-26
💬 NLP

A visual observation on the geometry of UMAP projections of the difference vectors of antonym and synonym word pair embeddings

يُبلغ هذا البحث عن نمط "دوامي" مثير للاهتمام لوحظ في الإسقاطات الهندسية لمتجهات الفرق بين تمثيلات أزواج الكلمات المترادفة والمتضادة عبر نماذج محولة (transformer) متنوعة، مما يسلط الضوء على البنى المكانية المعقدة التي تكمن وراء التضاد الدلالي.

Rami Luisto2026-03-26
💬 NLP

Variation is the Norm: Embracing Sociolinguistics in NLP

تقترح هذه الورقة إطار عمل يدمج المبادئ اللغوية الاجتماعية في معالجة اللغات الطبيعية للتعامل مع التباين اللغوي كسمة ذات دلالة بدلاً من كونه ضجيجاً، وتثبت من خلال دراسة حالة للغة اللوكسمبورغية أن مراعاة التباين الإملائي صراحةً أثناء عملية الضبط الدقيق يحسن بشكل كبير من متانة النموذج وأدائه.

Anne-Marie Lutgen, Alistair Plum, Verena Blaschke, Barbara Plank, Christoph Purschke2026-03-26
💬 NLP

Optimizing Multilingual LLMs via Federated Learning: A Study of Client Language Composition

تستقصي هذه الورقة البحثية تأثير تكوين لغة العميل على التعلم الاتحادي متعدد اللغات للنماذج اللغوية الكبيرة، مبرهنةً على أن زيادة تعدد اللغات داخل العميل الواحد تؤدي إلى نماذج عالمية أكثر عدلاً وفعالية، لا سيالما بالنسبة للغات ذات الموارد المنخفضة، مع تقديم آلية مبتكرة للتوقف المبكر الديناميكي المحلي لتعزيز كفاءة التدريب.

Aleix Sant, Jordi Luque, Carlos Escolano2026-03-26