💬 NLP

SomaliBench Eval: Measuring English-to-Somali Refusal Gaps in Open-Weight Language Models

تُقيّم هذه الورقة أربعة نماذج لغوية مفتوحة الأوزان باستخدام معيار SomaliBench v0 الذي تم التحقق منه من قبل مؤلفين أصليين، وتكشف عن فجوات كبيرة في رفض السلامة بين الإنجليزية والصومالية، حيث تفشل النماذج بشكل متكرر في رفض المطالبات الضارة باللغة الصومالية بسبب مخرجات غير مترابطة أو بلغة خاطئة بدلاً من الامتثال الضار بطلاقة.

Khalid Yusuf Dahir2026-05-26
💬 NLP

A Multi-Agent LLM Framework for Rating the Quality of Surgical Feedback

تقدم هذه الورقة إطار عمل مكوناً من مرحلتين ومتعدد الوكلاء يعتمد على النماذج اللغوية الكبيرة (LLM) لاكتشاف معايير قابلة للتفسير لجودة التغذية الراجعة الجراحية لتقييم تفاعلات غرف العمليات المباشرة تلقائياً، مما يظهر أداءً فائقاً على الطرق السابقة في التنبؤ بفعالية التغذية الراجعة والتعديلات السلوكية للمتدربين.

Rafal Kocielnik, J. Everett Knudsen, Steven Y. Cen, Jasmine Lin, Cherine H. Yang, Atharva Deo, Ujjwal Pasupulety, Peter (…)2026-05-26
💬 NLP

TypedCSIP: Typed Counterfactual Pretraining for Chinese Legislative Conflict Classification

تقدم هذه الورقة TypedCSIP، وهي طريقة تدريب مسبق تعتمد على التناقضات النمطية (typed counterfactual) تستفيد من المراجعات الدنيا المكتوبة من قبل الخبراء لتحسين تصنيف التعارض التشريعي الصيني، محققةً مكاسب ذات دلالة إحصائية في درجات macro-F1 على معيار LCR-CN مع إظهار تخصص في مهام محددة.

Yao Liu2026-05-26
💬 NLP

IndexMem: Learned KV-Cache Eviction with Latent Memory for Long-Context LLM Inference

يعالج IndexMem مشكلة عنق الزجاجة في ذاكرة التخزين المؤقت لمفاتيح وقيم (KV-cache) أثناء استنتاج النماذج اللغوية الكبيرة ذات السياق الطويل، وذلك عبر الجمع بين فهرس قابل للتعلم لاستبعاد الرموز بدقة ووحدة ذاكرة كامنة خفيفة الوزن تحافظ على المعلومات المستبعدة، مما يؤدي إلى تحسين الأداء والاستقرار بشكل كبير عبر مختلف النماذج والمعايير.

Xintong Yang, Hao Gu, Binxing Xu, Lujun Li, Bei Liu, Jiacheng Liu, Qiyuan Zhu, Sirui Han, Yike Guo2026-05-26
💬 NLP

A Controlled Synthetic Benchmark for Educational Aspect-Based Sentiment Analysis

تقدم هذه الورقة معياراً مرجعياً اصطناعياً منضبطاً لتحليل المشاعر القائم على الجوانب في المجال التعليمي، يتكون من 10,000 مراجعة دورات تم إنشاؤها بدقة وفق مخطط مكون من 20 جانباً، وذلك لمعالجة ندرة البيانات المصنفة العامة وتوفير بيئة قابلة للتكرار لتقييم النماذج التي تظهر أداءً واعداً، وإن كان مليئاً بالتحديات، على كل من الملاحظات الاصطناعية والواقعية.

Yehudit Aperstein, Alexander Apartsin2026-05-26
💬 NLP

RotMoLE: Enhancing Mixture of Low-Rank Experts through Rotational Gating Mechanism

تقترح الورقة البحثية RotMoLE، وهو إطار عمل جديد لخليط من الخبراء منخفضة الرتبة (Mixture of Low-rank Experts)، يعزز قدرة التمثيل والتعميم في السيناريوهات المعقدة عبر إدخال آلية بوابات دورانية لتجاوز قيود إعادة الوزن القياسية التي تتسم بها بنيات خليط الخبراء التقليدية.

Mengyang Sun, Maochuan Dou, Tao Feng, Dan Zhang, Yihao Wang, Junpeng Liu, Yifan Zhu, Jie Tang2026-05-26
💬 NLP

PennySynth: RAG-Driven Data Synthesis for Automated Quantum Code Generation

يُعد PennySynth إطار عمل للجيل المعزز بالاسترجاع يستفيد من قاعدة معرفية منسقة من أزواج التعليمات والأكواد الخاصة بـ PennyLane وتضمينات مدركة للكود لتحسين الدقة والصلاحية الهيكلية لتوليد الأكواد الكمومية الآلية بشكل كبير، متفوقاً بذلك على النماذج اللغوية الكبيرة الحديثة في تحديات مسابقة QHack.

Minghao Shao, Nouhaila Innan, Hariharan Janardhanan, Muhammad Kashif, Alberto Marchisio, Muhammad Shafique2026-05-26
💬 NLP

Toward a Benchmark for Controllable Simulation of Imperfect Students with Large Language Models

تقدم هذه الورقة إطار عمل موجهًا نحو المعايير لاستخدام النماذج اللغوية الكبيرة لمحاكاة الطلاب ذوي الإتقان الجزئي والمنضبط للمهارات لدعم تعليم المعلمين، مظهرةً أنه في حين يمكن تحقيق الاستبقاء الانتقائي وكبح الكفاءات، فإن درجة التحكم تظل معتمدة على النموذج المحدد المستخدم.

Alexander Apartsin, Omri Sason, Yehudit Aperstein2026-05-26
💬 NLP

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

تقترح الورقة البحثية طريقة "تحسين الميزة التكيفي مع التباين الديناميكي" (DVAO)، وهي طريقة مبتكرة تعمل على ضبط أوزان دمج المكافآت المتعددة ديناميكياً بناءً على التباين التجريبي للتغلب على عدم الاستقرار في التدريب والقيود الثابتة لعملية التدرج القياسي المعيارية في "تحسين السياسة النسبي للمجموعات" (GRPO)، مما يحقق أداءً واستقراراً فائقين في محاذاة النماذج اللغوية الكبيرة مع أهداف متعددة.

Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang2026-05-26
💬 NLP

When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

تكشف هذه الورقة أن تعلم التفضيلات من الضعيف إلى القوي غالباً ما يفشل في ظل تغير التوزيعات بسبب انزياح التمثيل، وتقترح منظم "تثبيت التمثيل" لتقييد الانحراف المفرط عن فضاء النموذج المدرب مسبقاً، مما يؤدي إلى تحسين النقل خارج التوزيع مع الحفاظ على الأداء داخل التوزيع.

Khoi Le, Tri Cao, Phong Nguyen, Cong-Duy Nguyen, Anh Tuan Luu, Miao Chunyan, See-Kiong Ng, Thong Nguyen2026-05-26