💬 NLP

LFQA-E: Carefully Benchmarking Long-form QA Evaluation

تقدم هذه الورقة LFQA-E، وهو معيار مرجعي شامل متعدد اللغات يتضمن إجابات مرجعية ومقارنات زوجية صُممت لتقييم المقاييس الآلية لأسئلة الإجابة الطويلة تقييماً دقيقاً، مما يكشف أن الطرق الحالية تفشل في مضاهاة التقدير البشري في تقييم الاستجابات الكثيفة والطويلة.

Yuchen Fan, Chen Lin, Xin Zhong, Shuo Zhang, Heng Zhou, Yuchen Zhang, Mingyu Liang, Chengxing Xie, Ermo Hua, Gang Chen (…)2026-02-03
💬 NLP

Leveraging LLMs for Translating and Classifying Mental Health Data

تقيم هذه الدراسة مدى فعالية نموذج GPT-3.5-turbo في اكتشاف شدة الاكتئاب في المنشورات اليونانية المترجمة من الإنجليزية، كاشفةً عن أداء غير متسق عبر اللغات ومسلطةً الضوء على الحاجة الماسة لمزيد من البحث، والتنفيذ الدقيق، والإشراف البشري في تطبيقات الصحة النفسية غير الإنجليزية.

Konstantinos Skianis, A. Seza Doğruöz, John Pavlopoulos2026-02-03
💬 NLP

SVIP: Towards Verifiable Inference of Open-source Large Language Models

يُعد SVIP بروتوكولاً يعتمد على الأسرار وفعالاً من الناحية الحسابية، يُمكّن المستخدمين من التحقق من نزاهة مزودي استدلال النماذج اللغوية الكبيرة اللامركزيين عبر تدريب مهمة وسيطة على التمثيلات الخفية لتحديد النموذج بشكل فريد ومنع الاستبدال غير المصرح به بنسخ أصغر وأقل قدرة.

Yifan Sun, Yuhang Li, Yue Zhang, Yuchen Jin, Huan Zhang2026-02-03
💬 NLP

U-MATH: A University-Level Benchmark for Evaluating Mathematical Skills in LLMs

تقدم هذه الورقة U-MATH، وهو معيار مرجعي جديد يضم 1,100 مسألة مفتوحة على المستوى الجامعي تغطي ستة موضوعات أساسية مع محتوى متعدد الوسائط بنسبة 20%، إلى جانب مجموعة بيانات μ\mu-MATH لتقييم الحكم على الحلول، وذلك للكشف عن أوجه القصور الكبيرة في قدرات الاستدلال متعدد الوسائط للنماذج اللغوية الكبيرة الحالية وقدرتها على تقييم الحلول الرياضية بدقة.

Konstantin Chernyshev, Vitaliy Polshkov, Ekaterina Artemova, Alex Myasnikov, Vlad Stepanov, Alexei Miasnikov, Sergei Til (…)2026-02-03
💬 NLP

Evolutionary Pre-Prompt Optimization for Mathematical Reasoning

تقدم هذه الورقة البحثية "تحسين التلقين المسبق التطوري" (EPPO)، وهي طريقة تسخر الخوارزميات التطورية لاختيار أمثلة "سلسلة الأفكار" ذات القليل من الأمثلة (few-shot)، مما يحسن أداء الاستدلال الرياضي بشكل كبير على معايير مثل GSM8k وMathQA بأكثر من 10 نقاط مطلقة مقارنة بالنهج الساذج.

Mathurin Videau, Alessandro Leite, Marc Schoenauer, Olivier Teytaud2026-02-03
💬 NLP

RaZeR: Pushing the Limits of NVFP4 Quantization with Redundant Zero Remapping

تقترح الورقة البحثية RaZeR، وهو تنسيق عددي محسّن يعمل على تحسين دقة تكميم النماذج اللغوية الكبيرة ذات الـ 4 بت من خلال إعادة توظيف البتات الزائدة من تمثيل الصفر في FP4 وعامل قياس الكتلة في FP8 لدعم قيم تكميم إضافية، مما يحقق انخفاضات كبيرة في التشتت (perplexity) مقارنة بـ NVFP4 الأصلي.

Yuzong Chen, Xilai Dai, Jake Hyun, Chi-Chih Chang, Wonsuk Jang, Yuheng Wu, Thierry Tambe, Jae-sun Seo, Mohamed S. Abdelf (…)2026-02-03
🤖 AI

Enhancing Human-Like Responses in Large Language Models

تستكشف هذه الورقة تقنيات تعزيز الخصائص الشبيهة بالبشر للنماذج اللغوية الكبيرة من خلال تحسين فهم اللغة الطبيعية، والتماسك الحواري، والذكاء العاطفي، مما يبرز قدرتها على تحويل تفاعلات المستخدمين وتطبيقات الذكاء الاصطناي مع تسليط الضوء على الحاجة إلى معالجة المخاوف الأخلاقية الناجمة عن ذلك.

Ethem Yağız Çalık, Talha Rüzgar Akkuş2026-02-03
💬 NLP

How does a Multilingual LM Handle Multiple Languages?

تقيم هذه الدراسة بشكل نقدي قدرات وحدود النماذج اللغوية متعددة اللغات مثل BLOOM-1.7B وQwen2 في التمثيل الدلالي والنقل عبر اللغات، مع تسليط الضوء على أدائها القوي في اللغات ذات الموارد العالية مقابل معاناتها مع اللغات ذات الموارد المنخفضة لاقتراح تحسينات من أجل تقنيات لغوية أكثر شمولاً.

Santhosh Kakarla, Gautama Shastry Bulusu Venkata, Aishwarya Gaddam, Maheedhar Sai Omtri Mohan2026-02-03
💬 NLP

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

تقدم هذه الورقة البحثية RESM، وهي طريقة دمج مهام أحادية تعتمد على تعزيز إعادة الأوزان، تتفوق على أساليب خلط البيانات ودمج النماذج الحالية من خلال حل النزاعات بين النفعية والصدق وعدم الضرر بشكل فعال لتحقيق التوازن في المحاذاة في النماذج اللغوية الكبيرة.

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang (…)2026-02-03
🧬 biology

GENERator: A Long-Context Generative Genomic Foundation Model

تقدم الورقة البحثية نموذج GENERator، وهو نموذج جيني توليدي تأسيسي عالي الكفاءة وذو سياق طويل (98 ألف) تم تدريبه مسبقاً على 386 مليار نيوكليوتيد، ويُظهر قدرات قوية في التنبؤ بالمتغيرات والتحليل الوراثي العرقي دون تدريب مسبق، مع تحقيق أداء رائد في الاختبارات المعيارية عند الضبط الدقيق وتمكين التصميم العملي للتسلسلات المشفرة للبروتين الوظيفية والعناصر التنظيمية الاصطناعية.

Wei Wu, Qiuyi Li, Yuanyuan Zhang, Zhihao Zhan, Ruipu Chen, Mingyang Li, Kun Fu, Junyan Qi, Yongzhou Bao, Chao Wang, Yihe (…)2026-02-03