💬 NLP

BMdataset: A Musicologically Curated LilyPond Dataset

تقدم هذه الورقة البحثية BMdataset، وهي مجموعة مختارة موسيقياً من نوتات LilyPond المنسوخة من قبل خبراء من مخطوطات عصر الباروك، وتثبت أن الضبط الدقيق لنموذج LilyBERT المعدل على هذه المجموعة الصغيرة عالية الجودة يتفوق على التدريب على مجموعات بيانات ضخمة وصاخبة في مهام فهم الموسيقى الرمزية.

Matteo Spanio, Ilay Guler, Antonio Rodà2026-04-14
🤖 machine learning

SpectralLoRA: Is Low-Frequency Structure Sufficient for LoRA Adaptation? A Spectral Analysis of Weight Updates

تُثبت هذه الورقة من خلال التحليل الطيفي أن تحديثات أوزان LoRA تهيمن عليها المكونات ذات التردد المنخفض، مما يكشف أن الاحتفاظ بجزء صغير فقط من هذه الترددات يقلل التخزين بشكل كبير مع حد أدنى من الخسارة في الأداء، ويشير إلى أن المكونات عالية التردد غالباً ما تعمل كضجيج تكيفي.

Rajveer Singh2026-04-14
💬 NLP

HeceTokenizer: A Syllable-Based Tokenization Approach for Turkish Retrieval

تقدم الورقة البحثية HeceTokenizer، وهو نهج ترميز يعتمد على المقطع الصوتي وموفر للموارد للغة التركية، يستفيد من الانتظام الفونولوجي للغة لتحقيق أداء استرجاع فائق (50.3% Recall@5) على معيار TQuAD باستخدام نموذج أصغر بكثير مقارنة بالنماذج المرجعية القائمة على الصرف.

Senol Gulgonul2026-04-14
💬 NLP

QFS-Composer: Query-focused summarization pipeline for less resourced languages

تقدم هذه الورقة QFS-Composer، وهو إطار عمل مبتكر يدمج بين تفكيك الاستعلام، وتوليد الأسئلة، والإجابة على الأسئلة لتعزيز المواءمة الواقعية والصلة بالاستعلام في الملخصات التي تركز على الاستعلام في اللغات ذات الموارد المحدودة، وهو ما تم إثباته من خلال تحسين الأداء في النصوص السلوفينية.

Vuk {\DJ}uranović, Marko Robnik Šikonja2026-04-14
💬 NLP

Detecting RAG Extraction Attack via Dual-Path Runtime Integrity Game

تقدم هذه الورقة البحثية CanaryRAG، وهو آلية دفاع وقت التشغيل قابلة للتركيب والتشغيل الفوري، تعمل على تضمين رموز الكناري (canary tokens) في الأجزاء المسترجعة وتستخدم لعبة سلامة ثنائية المسار للكشف عن هجمات استخراج بيانات الـ RAG والتخفيف من حدتها في الوقت الفعلي دون الحاجة إلى إعادة تدريب النموذج أو التأثير على الأداء.

Yuanbo Xie, Yingjie Zhang, Yulin Li, Shouyou Song, Xiaokun Chen, Zhihan Liu, Liya Su, Tingwen Liu2026-04-14
🤖 AI

Teaching Language Models How to Code Like Learners: Conversational Serialization for Student Simulation

تقترح هذه الورقة طريقة لتدريب النماذج اللغوية ذات الأوزان المفتوحة على محاكاة سلوك البرمجة لدى الطلاب عبر تحويل سجلات العمليات الزمنية إلى حوارات محادثة وتطبيق مسار تدقيق دقيق تحت الإشراف بالإضافة إلى تحسين التفضيل، مما يحسن بشكل كبير قدرة النماذج على تكرار أنماط تصحيح الأخطاء الحقيقية مقارنة بالنهج القائم على الكود فقط والنماذج المرجعية المعتمدة على التلقين.

Charles Koutcheme, Arto Hellas, Juho Leinonen2026-04-14
💬 NLP

Expect the Unexpected? Testing the Surprisal of Salient Entities

تتحدى هذه الورقة فرضية كثافة المعلومات الموحدة من خلال إثبات أن الكيانات البارزة عالمياً في الخطاب تظهر مفاجأة أعلى بكثير من الكيانات غير البارزة، بينما تقلل في الوقت نفسه من مفاجأة المحتوى المحيط بها، مما يكشف عن بروز الكيان العالمي كآلية رئيسية تشكل توزيع المعلومات عبر الأنواع الأدبية المختلفة.

Jessica Lin, Amir Zeldes2026-04-14
💬 NLP

Too Nice to Tell the Truth: Quantifying Agreeableness-Driven Sycophancy in Role-Playing Language Models

تُثبت هذه الورقة بشكل منهجي أنه في نماذج اللغة القائمة على تقمص الأدوار، يتنبأ ارتفاع مستوى الود في الشخصية (persona agreeableness) بشكل كبير بزيادة السلوك المتملق، مما يكشف عن رابط حاسم بين سمات الشخصية والميل إلى تقديم إرضاء المستخدم على الدقة الواقعية.

Arya Shah, Deepali Mishra, Chaklam Silpasuwanchai2026-04-14
💬 NLP

Self-Correcting RAG: Enhancing Faithfulness via MMKP Context Selection and NLI-Guided MCTS

تقترح هذه الورقة البحثية "RAG ذاتي التصحيح" (Self-Correcting RAG)، وهو إطار عمل موحد يعزز الموثوقية في مهام الاستدلال المعقدة من خلال إعادة صياغة اختيار السياق كمسألة حقيبة متعددة الخيارات ومتعددة الأبعاد، وتوظيف بحث مونت كارلو في شجرة البحث (MCTS) الموجه بالاستدلال اللغوي الطبيعي (NLI) للتحقق ديناميكيًا من الإجابات المولدة، مما يؤدي إلى تحسين الدقة بشكل كبير وتقليل الهلوسة.

Shijia Xu, Zhou Wu, Xiaolong Jia, Yu Wang, Kai Liu, April Xiaowen Dong2026-04-14
💬 NLP

BlasBench: An Open Benchmark for Irish Speech Recognition

تقدم هذه الورقة BlasBench، وهو أول معيار مفتوح للتعرف على الكلام باللغة الأيرلندية يستخدم بروتوكول تقييم مدركاً لخصوصية اللغة الأيرلندية للكشف عن فجوات تعميم وتفاوتات كبيرة في الأداء بين 12 نظاماً للتعرف التلقائي على الكلام، بما في ذلك النتيجة التي تشير إلى أن جميع متغيرات Whisper تتجاوز معدل خطأ في الكلمات بنسبة 100%.

Jyoutir Raj, John Conway2026-04-14