🤖 AI

RLSF: Fine-tuning LLMs via Symbolic Feedback

تقدم الورقة البحثية "التعلم التعزيزي عبر التغذية الراجعة الرمزية" (RLSF)، وهو نموذج جديد للضبط الدقيق يستفيد من أدوات الاستدلال الرمزي لتوفير تغذية راجعة دقيقة على مستوى الرمز (token-level)، مما يمكّن النماذج اللغوية الكبيرة الأصغر حجماً من التفوق بشكل كبير على النماذج المغلقة الأكبر حجماً في المهام التي تتطلب توافقاً منطقياً خاصاً بمجال معين.

Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh2026-02-27
💬 NLP

ANCHOLIK-NER: A Benchmark Dataset for Bangla Regional Named Entity Recognition

تقدم هذه الورقة البحثية ANCHOLIK-NER، وهي أول مجموعة بيانات مرجعية للتعرف على الكيانات المسماة في خمس لهجات إقليمية للغة البنغالية، وتقيم النماذج القائمة على المحولات (transformer-based models) عليها لتضع خطوة تأسيسية لتطوير أنظمة معالجة اللغات الطبيعية المدركة للهجات.

Bidyarthi Paul, Faika Fairuj Preotee, Shuvashis Sarker, Shamim Rahim Refat, Shifat Islam, Tashreef Muhammad, Mohammad As (…)2026-02-27
💬 NLP

Evaluating the Diversity and Quality of LLM Generated Content

تقدم هذه الورقة إطاراً لقياس "التنوع الدلالي الفعال" لتوضيح أنه في حين قد تبدو النماذج اللغوية الكبيرة التي تم ضبطها وفق التفضيلات أقل تنوعاً بموجب المقاييس القياسية، إلا أنها في الواقع تولد مجموعة أكبر من المخرجات عالية الجودة مقارنة بالنماذج الأساسية أو تلك التي خضعت للضبط الدقيق الخاضع للإشراف، مع إثبات أن النماذج الأصغر حجماً أكثر كفاءة في استخدام المعلمات لإنتاج محتوى فريد.

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani2026-02-27
💬 NLP

Cost-of-Pass: An Economic Framework for Evaluating Language Models

تقدم هذه الورقة "تكلفة المرور" (Cost-of-Pass)، وهو إطار اقتصادي يقيم إنتاجية النماذج اللغوية من خلال الجمع بين الدقة وتكاليف الاستدلال، مما يكشف أن الابتكارات المتكاملة على مستوى النموذج هي المحركات الأساسية لكفاءة التكلفة، ويوفر أداة منهجية لتوجيه قرارات النشر.

Mehmet Hamza Erol, Batu El, Mirac Suzgun, Mert Yuksekgonul, James Zou2026-02-27
💬 NLP

Can LLMs Simulate Human Behavioral Variability? A Case Study in the Phonemic Fluency Task

تُظهر هذه الدراسة أنه في حين يمكن لبعض النماذج اللغوية الكبيرة محاكاة المتوسطات البشرية في مهمة الطلاقة الفونيمية، إلا أنها تخفق باستمرار في إعادة إنتاج نطاق وهيكل التباين السلوكي البشري، مما يسلط الضوء على قيود كبيرة في استخدام النماذج اللغوية الكبيرة كبدائل للمشاركين البشريين في الأبحاث المعرفية.

Mengyang Qiu, Zoe Brisebois, Siena Sun2026-02-27
💬 NLP

Knowledge Fusion of Large Language Models Via Modular SkillPacks

تقدم هذه الورقة البحثية GraftLLM، وهي طريقة مبتكرة تتيح نقلاً فعالاً وعابراً للقدرات وخالياً من النسيان ودمجاً للنماذج للنماذج اللغوية الكبيرة وغير المتجانسة، وذلك عبر ضغط قدرات المصدر في "حزم مهارات" (SkillPacks) مدمجة وقابلة للنقل تحافظ على القدرات العامة مع تقليل تضارب المعلمات إلى أدنى حد.

Guodong Du, Zhuo Li, Xuanning Zhou, Junlin Li, Zesheng Shi, Wanyu Lin, Ho-Kin Tang, Xiucheng Li, Fangming Liu, Wenya Wan (…)2026-02-27
💬 NLP

DeVisE: Behavioral Testing of Medical Large Language Models

تقدم الورقة البحثية DeVisE، وهو إطار عمل للاختبار السلوكي يستخدم اضطرابات مضادة للواقع محكومة في السمات الديموغرافية وعلامات المؤشرات الحيوية في ملاحظات الخروج من وحدة العناية المركزة للكشف عن كيفية تباين النماذج اللغوية الطبية الكبيرة الحالية في حساسيتها واتساق استدلالها، مما يثبت أن المقاييس القياسية غالبًا ما تفشل في رصد الاختلافات السلوكية ذات الصلة سريريًا.

Camila Zurdo Tagliabue, Heloisa Oss Boll, Aykut Erdem, Erkut Erdem, Iacer Calixto2026-02-27
💬 NLP

Is This Just Fantasy? Language Model Representations Reflect Human Judgments of Event Plausibility

تُثبت هذه الورقة أن النماذج اللغوية تمتلك تمثيلات موثوقة وقابلة للفصل خطياً لمعقولية الأحداث تظهر باستمرار أثناء التدريب ويمكنها نمذجة الأحكام البشرية الدقيقة للفئات الوجوبية بفعالية، مما يقدم رؤى جديدة لكل من قدرات الذكاء الاصطناعي والإدراك البشري.

Michael A. Lepori, Jennifer Hu, Ishita Dasgupta, Roma Patel, Thomas Serre, Ellie Pavlick2026-02-27
💬 NLP

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

تقدم هذه الورقة LiveMCPBench، وهو معيار مرجعي واسع النطاق وقابل لإعادة الإنتاج يضم 70 خادماً و527 أداة لتقييم وكلاء النماذج اللغوية الكبيرة في مهام بروتوكول سياق النموذج (MCP) متعددة الخوادم في العالم الحقيقي، كاشفةً أن أخطاء الاسترجاع هي العائق الأساسي وأن التكوين النشط للأدوات يؤثر بشكل كبير على معدلات النجاح.

Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun2026-02-27
💬 NLP

Self-adaptive Dataset Construction for Real-World Multimodal Safety Scenarios

تتناول هذه الورقة البحثية أوجه القصور في الأساليب الحالية الموجهة نحو المخاطر في بناء مجموعات بيانات السلامة متعددة الوسائط من خلال اقتراح مسار جديد ذاتي التكيف موجه نحو الصور يقوم تلقائياً بتوليد مجموعة بيانات سلامة واقعية مكونة من 35 ألف عنصر، وتقديم مقياس تقييم معياري للتحقق من فعاليتها عبر مهام متنوعة.

Jingen Qu, Lijun Li, Bo Zhang, Yichen Yan, Jing Shao2026-02-27