💻 computer science

Automating Database-Native Function Code Synthesis with LLMs

تقدم الورقة البحثية نظام DBCooker، وهو نظام قائم على النماذج اللغوية الكبيرة (LLM) يعمل على أتمتة تخليق الدوال المعقدة الأصلية لقواعد البيانات من خلال بنية متخصصة ثلاثية المكونات تتضمن توصيف الدوال، وعمليات الترميز الهجينة، والتحقق متعدد المستويات، محققاً دقة أعلى بكثير من الطرق الحالية عبر أنظمة قواعد البيانات الرئيسية.

Wei Zhou, Xuanhe Zhou, Qikang He, Guoliang Li, Bingsheng He, Quanqing Xu, Fan Wu2026-04-09
💬 NLP

In-Context Learning in Speech Language Models: Analyzing the Role of Acoustic Features, Linguistic Structure, and Induction Heads

تتقصى هذه الورقة البحثية التعلم في السياق (In-Context Learning) في نماذج لغة الكلام من خلال إثبات أن معدل التحدث يؤثر بشكل كبير على كل من استنتاج المهام والمحاكاة الصوتية، مع بيان أن رؤوس الاستقراء (induction heads) تلعب دوراً سببياً في تمكين هذه القدرات، بشكل مشابه للنتائج التي تم التوصل إليها في النماذج القائمة على النصوص.

Charlotte Pouw, Hosein Mohebbi, Afra Alishahi, Willem Zuidema2026-04-09
💬 NLP

The Illusion of Superposition? A Principled Analysis of Latent Thinking in Language Models

تتقصى هذه الورقة ما إذا كانت النماذج اللغوية تستخدم التراكب (superposition) للحفاظ على مسارات استدلال متعددة في سلاسل الأفكار الكامنة، وتجد أن هذه القدرة لا تظهر إلا في النماذج المدربة من الصفر، بينما تفشل أنظمة التدريب بدون تدريب إضافي (training-free) والأنظمة التي خضعت للضبط الدقيق (fine-tuned) في الاستفادة من التراكب بسبب انحيازات ما قبل التدريب نحو الالتزام بالرموز (token commitment) وقيود السعة.

Michael Rizvi-Martel, Guillaume Rabusseau, Marius Mosbach2026-04-09
💬 NLP

Application-Driven Pedagogical Knowledge Optimization of Open-Source LLMs via Reinforcement Learning and Supervised Fine-Tuning

تقدم هذه الورقة البحثية EduQwen، وهي عائلة من النماذج اللغوية الكبيرة المفتوحة المصدر ذات الـ 32 مليار معلمة والمخصصة للأغراض التربوية، والتي تستفيد من استراتيجية تحسين مبتكرة متعددة المراحل تجمع بين التعلم التعزيزي والضبط الدقيق الخاضع للإشراف لتحقيق أداء رائد في المعايير التعليمية، متفوقةً بذلك بشكل كبير على الأنظمة المملوكة الأكبر حجماً مع الحفاظ على الشفافية وكفاءة التكلفة المطلوبة للنشر المسؤول للذكاء الاصطناي.

Navan Preet Singh, Xiaokun Wang, Anurag Garikipati, Madalina Ciobanu, Qingqing Mao, Ritankar Das2026-04-09
💬 NLP

FMI@SU ToxHabits: Evaluating LLMs Performance on Toxic Habit Extraction in Spanish Clinical Texts

تقدم هذه الورقة دراسة أجراها فريق FMI@SU قيمت استراتيجيات متنوعة لتلقين النماذج اللغوية الكبيرة لاستخراج وتصنيف ذكر العادات السامة (التبغ، والكحول، والقنب، والمخدرات) في النصوص السريرية الإسبانية، محققةً درجة F1 في مجموعة الاختبار بلغت 0.65 باستخدام تقنية التلقين بلقطات قليلة لنموذج GPT-4.1.

Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva2026-04-09
💬 NLP

Say Something Else: Rethinking Contextual Privacy as Information Sufficiency

تعيد هذه الورقة تعريف الخصوصية السياقية لوكلاء النماذج اللغوية الكبيرة باعتبارها مهمة "كفاية معلومات"، مقدمةً إخفاء الهوية عبر النصوص الحرة كاستراتيجية متفوقة، وبروتوكول تقييم حواري يكشف كيف أن التقييمات القائمة على الرسالة الواحدة تستهين بتسرب الخصوصية مقارنة بالتفاعلات متعددة الأدوار.

Yunze Xiao, Wenkai Li, Xiaoyuan Wu, Ningshan Ma, Yueqi Song, Weihao Xuan2026-04-09
💬 NLP

Attention Flows: Tracing LLM Conceptual Engagement via Story Summaries

تقيم هذه الورقة قدرة النماذج اللغوية الكبيرة المتطورة على استيعاب السرديات الطويلة من خلال مقارنة ملخصاتها المبتكرة بتلك المكتوبة بشرياً، مما يكشف عن معاناة النماذج في التكامل الشمولي وتركيزها بشكل غير متناسب على نهايات النصوص، وهو اكتشاف مرتبط بآليات الانتباه لديها.

Rebecca M. M. Hicke, Sil Hamilton, David Mimno, Ross Deans Kristensen-McLachlan2026-04-09
💬 NLP

State-of-the-Art Arabic Language Modeling with Sparse MoE Fine-Tuning and Chain-of-Thought Distillation

تقدم الورقة البحثية نموذج Arabic-DeepSeek-R1، وهو نموذج لغوي كبير مفتوح المصدر للغة العربية يستفيد من بنية "خليط الخبراء" (MoE) المتفرقة واستراتيجية تقطير "سلسلة الأفكار" المستندة إلى السياق الثقافي لتحقيق أداء رائد عبر معايير قياسية شاملة، متفوقاً بذلك على الأنظمة المملوكة مثل GPT-5.1، ومثبتاً أن التكيف المتخصص يمكنه التغلب على عجز الأداء في اللغات غير الممثلة كفاية دون تكاليف التدريب المسبق على نطاق صناعي.

Navan Preet Singh, Anurag Garikipati, Ahmed Abulkhair, Jyani Akshay Jagdishbhai, Atul Yaduvanshi, Amarendra Chaudhary, M (…)2026-04-09
💬 NLP

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

تقدم هذه الورقة مجموعة بيانات "نسب الألوان المتدرجة" (GCA) لتوضيح أنه في حين يظل البشر مخلصين لقواعدهم الاستبطانية في نسب الألوان، فإن النماذج اللغوية البصرية تنتهك بشكل منهجي استدلالاتها المعلنة، لا سيما عندما تتأثر بالمعارف المسبقة حول العالم، مما يكشف عن سوء معايرة جوهري في معرفتها الذاتية يتحدى موثوقيتها في عمليات النشر عالية المخاطر.

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman2026-04-09
💬 NLP

Team Fusion@ SU@ BC8 SympTEMIST track: transformer-based approach for symptom recognition and linking

يعالج نظام Team Fusion@SU@BC8 تحدي SympTEMIST من خلال توظيف مسار عمل قائم على المحولات يجمع بين نموذج RoBERTa-BiLSTM-CRF مضبوط بدقة للتعرف على الأعراض ومنهج SapBERT عابر للغات لربط الكيانات، مما يثبت أن اختيار قاعدة المعرفة هو العامل الأكثر أهمية للدقة.

Georgi Grazhdanski, Sylvia Vassileva, Ivan Koychev, Svetla Boytcheva2026-04-09