💬 NLP

Curriculum Learning and Pseudo-Labeling Improve the Generalization of Multi-Label Arabic Dialect Identification Models

تتناول هذه الورقة ندرة بيانات اللهجات العربية متعددة الملصقات من خلال بناء مجموعة بيانات جديدة عبر نموذج GPT-4o ومصنفات قبول اللهجات، ثم تُثبت أن تدريب نموذج قائم على BERT باستخدام التعلم المنهجي يحسن التعميم بشكل كبير، محققاً مقياس F1 كلي قدره 0.69 مقارنة بأفضل النتائج السابقة التي بلغت 0.55.

Ali Mekky, Mohamed El Zeftawy, Lara Hassan, Amr Keleg, Preslav Nakov2026-02-18
💬 NLP

Annotation-Efficient Vision-Language Model Adaptation to the Polish Language Using the LLaVA Framework

تقدم هذه الورقة طريقة لتكييف إطار عمل LLaVA مع اللغة البولندية باستخدام مسار ترجمة مؤتمت بالكامل وبيانات اصطناعية، محققةً تحسينات كبيرة في الأداء مقارنة بالنموذج المرجعي الإنجليي، مع إثبات أن الترجمة المؤتمتة واسعة النطاق يمكن أن تعزز بفعالية نماذج الرؤية واللغة عالية الجودة للغات ذات الموارد المحدودة.

Grzegorz Statkiewicz, Alicja Dobrzeniecka, Karolina Seweryn, Aleksandra Krasnodębska, Karolina Piosek, Katarzyna Bogusz (…)2026-02-18
💬 NLP

Query as Anchor: Scenario-Adaptive User Representation via Large Language Model

تقدم هذه الورقة "الاستعلام كمرساة" (Query-as-Anchor)، وهو إطار عمل يستفيد من مجموعة بيانات تدريب مسبق واسعة النطاق (UserU) وبنية نموذج لغوي كبير ثنائية البرج مع ضبط المحفز الناعم القائم على التجميع لتوليد تمثيلات مستخدم ديناميكية ومرتبطة بالاستعلام، مما يحقق أداءً هو الأفضل حالياً ونشراً فعالاً عبر سيناريوهات صناعية متعددة في Alipay.

Jiahao Yuan, Yike Xu, Jinyong Wen, Baokun Wang, Ziyi Gao, Xiaotong Lin, Yun Liu, Xing Fu, Yu Cheng, Yongchao Liu, Weiqia (…)2026-02-18
💬 NLP

FrameRef: A Framing Dataset and Simulation Testbed for Modeling Bounded Rational Information Health

تقدم هذه الورقة FrameRef، وهي مجموعة بيانات واسعة النطاق من الادعاءات المعاد صياغتها بشكل منهجي، وبيئة اختبار محاكاة تستخدم شخصيات وكلاء حساسة لإعادة الصياغة لنمذجة كيف يمكن للتحولات المنهجية الصغيرة في التعرض للمعلومات داخل أنظمة التصنيف أن تتراكم بمرور الوقت لتؤثر بشكل كبير على الصحة المعلوماتية طويلة الأمد.

Victor De Lima, Jiqun Liu, Grace Hui Yang2026-02-18
💬 NLP

Making Large Language Models Speak Tulu: Structured Prompting for an Extremely Low-Resource Language

تُثبت هذه الورقة أن تقنيات التلقين المهيكلة، بما في ذلك التوثيق النحوي الصريح، والقيود السلبية، وتوليد البيانات الاصطناعية، يمكن أن تمكّن النماذج اللغوية الكبيرة من تحقيق دقة نحوية عالية في لغة "تولو"، وهي لغة ذات موارد منخفضة للغاية، دون الحاجة إلى ضبط دقيق للنموذج.

Prathamesh Devadiga, Paras Chopra2026-02-18
💬 NLP

Measuring Social Integration Through Participation: Categorizing Organizations and Leisure Activities in the Displaced Karelians Interview Archive using LLMs

تقدم هذه الورقة طريقة لاستخدام النماذج اللغوية الكبيرة لتصنيف أكثر من 350,000 إشارة غير منظمة للمنظمات والأنشطة الترفيهية من مقابلات النازحين الفنلنديين من منطقة كاريليا خلال الحرب العالمية الثانية إلى إطار عمل مهيكل، مما يتيح التحليل الكمي للاندماج الاجتماعي.

Joonatan Laato, Veera Schroderus, Jenna Kanerva, Jenni Kauppi, Virpi Lummaa, Filip Ginter2026-02-18
💬 NLP

LuxMT Technical Report

تقدم هذه الورقة LuxMT، وهو نظام ترجمة آلية تم ضبطه بدقة على نموذج Gemma 3 27B للترجمة من اللغة اللوكسمبورغية إلى الفرنسية والإنجليزية باستخدام بيانات من LuxAlign وLuci، مما يُظهر تحسينات كبيرة في الأداء مقارنة بالنموذج المرجعي ويستكشف إمكانات LuxEmbedder كمعيار لتقدير الجودة.

Nils Rehlinger2026-02-18
💬 NLP

ExpertWeaver: Unlocking the Inherent MoE in Dense LLMs with GLU Activation Patterns

يُعد ExpertWeaver إطار عمل لا يتطلب تدريباً يعمل على إطلاق بنية "خليط الخبراء" (Mixture-of-Experts) الكامنة داخل النماذج اللغوية الكبيرة الكثيفة سابقة التدريب، وذلك من خلال تحليل أنماط تنشيط وحدات (GLU) لتقسيم الخلايا العصبية إلى مجموعات عامة ومتخصصة، مما يجعله يتفوق على الأساليب الحالية في كل من التقليم الهيكلي الديناميكي وتهيئة نماذج (MoE).

Ziyu Zhao, Tong Zhu, Zhi Zhang, Tiantian Fan, Jinluan Yang, Kun Kuang, Zhongyu Wei, Fei Wu, Yu Cheng2026-02-18
💬 NLP

RUVA: Personalized Transparent On-Device Graph Reasoning

تُعد Ruva بنية ذكاء اصطناعي شخصي من نوع "الصندوق الزجاجي" تستبدل الاسترجاع القائم على المتجهات غير الشفاف برسم بياني معرفي شخصي محلي وشفاف لتمكين التنسيق البشري في الحلقة ضمن الذاكرة، والتعمية الدقيقة للحقائق، والامتثال الحقيقي للخصوصية.

Gabriele Conte, Alessio Mattiace, Gianni Carmosino, Potito Aghilar, Giovanni Servedio, Francesco Musicco, Vito Walter An (…)2026-02-18
💬 NLP

Beyond Static Pipelines: Learning Dynamic Workflows for Text-to-SQL

تقدم هذه الورقة البحثية SquRL، وهو إطار عمل للتعلم التعزيزي يُمكّن النماذج اللغوية الكبيرة من بناء مسارات عمل (Text-to-SQL) مثالية ديناميكيًا عند وقت الاستدلال، مما يتفوق بذلك على الطرق الثابتة — لا سيما في الاستعلامات المعقدة وخارج نطاق التوزيع — من خلال الاستفادة التكيفية من تباين مسارات العمل المرشحة.

Yihan Wang, Peiyu Liu, Runyu Chen, Wei Xu2026-02-18