💬 NLP

Enhancing Multilingual LLM Pretraining with Model-Based Data Selection

تقدم هذه الورقة إطار عمل للترشيح القائم على النماذج يتسم بالشفافية والكفاءة لمجموعات البيانات متعددة اللغات، والذي يُمكّن نموذج لغوي كبير بمليار معلمة من مطابقة أداء النموذج المرجعي باستخدام 15% فقط من رموز التدريب عبر الاستفادة من مصنفات Transformer وFastText لاختيار عينات متنوعة وغنية معرفياً، مع التخفيف من حدة لعنة تعدد اللغات عبر 20 لغة.

Bettina Messmer, Vinko Sabolčec, Martin Jaggi2026-02-20
💬 NLP

A Scalable Framework for Evaluating Health Language Models

تقدم هذه الورقة "المعايير البولينية الدقيقة التكيفية" (Adaptive Precise Boolean rubrics)، وهي إطار تقييم قابل للتوسع يستخدم أسئلة نعم/لا مستهدفة لتقييم النماذج اللغوية الكبيرة الموجهة نحو الصحة بكفاءة وموثوقية أكبر من مقاييس ليكرت التقليدية، مما يقلل من وقت وتكاليف التقييم مع تحسين الاتفاق بين المقيمين الخبراء وغير الخبراء على حد سواء.

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Spee (…)2026-02-20
💬 NLP

FinTagging: Benchmarking LLMs for Extracting and Structuring Financial Information

تقدم هذه الورقة FinTagging، وهو أول معيار مرجعي شامل يفكك المهمة المعقدة لوسم XBRL إلى تحديد الأرقام المالية وربط المفاهيم المالية، ليكشف أن النماذج اللغوية الكبيرة، رغم تفوقها في استخراج الكيانات المالية، تعاني بشكل كبير في ربطها بتصنيف US GAAP الكامل تحت ظروف واقعية تراعي الهيكلية.

Yan Wang, Lingfei Qian, Xueqing Peng, Yang Ren, Keyi Wang, Yi Han, Dongji Feng, Fengran Mo, Shengyuan Lin, Qinchuan Zhan (…)2026-02-20
💬 NLP

Automated Web Application Testing: End-to-End Test Case Generation with Large Language Models and Screen Transition Graphs

تقدم هذه الورقة نظاماً مؤتمتاً يستفيد من النماذج اللغوية الكبيرة بالاقتران مع مخططات انتقال الشاشة والحالة لتوليد حالات اختبار قوية وشاملة (end-to-end) للتنقل في تطبيقات الويب وتعبئة النماذج، مما يعزز تغطية الاختبار وموثوقيتهته.

Nguyen-Khang Le, Quan Minh Bui, Minh Ngoc Nguyen, Hiep Nguyen, Trung Vo, Son T. Luu, Shoshin Nomura, Minh Le Nguyen2026-02-20
💬 NLP

Persona-driven Simulation of Voting Behavior in the European Parliament with Large Language Models

تُثبت هذه الورقة أن استخدام "تلقين الشخصية" (persona prompting) بنمط "الصفر محاولة" (zero-shot) مع النماذج اللغوية الكبيرة يمكنه محاكاة السلوك التصويتي لأعضاء البرلمان الأوروبي بشكل معقول والتنبؤ بدقة بمواقف المجموعات السياسية، محققاً درجة F1 موزونة تبلغ حوالي 0.793.

Maximilian Kreutner, Marlene Lutz, Markus Strohmaier2026-02-20
💬 NLP

SPECS\texttt{SPECS}: Faster Test-Time Scaling through Speculative Drafts

تقدم الورقة البحثية SPECS\texttt{SPECS}، وهي طريقة لتوسيع نطاق وقت الاختبار تراعي زمن الاستجابة، تستفيد من نموذج أصغر لعملية المسودة التخمينية والتحقق الموجه بالمكافأة لتحقيق دقة بمستوى البحث الشعاعي (beam search) مع تقليل زمن الاستجابة بنسبة تصل إلى 19.1%.

Mert Cemri, Nived Rajaraman, Rishabh Tiwari, Xiaoxuan Liu, Kurt Keutzer, Ion Stoica, Kannan Ramchandran, Ahmad Beirami (…)2026-02-20
💬 NLP

DistillNote: Toward a Functional Evaluation Framework of LLM-Generated Clinical Note Summaries

تقدم هذه الورقة DistillNote، وهو إطار تقييم وظيفي يقيس الفائدة السريرية للملخصات التي تولدها النماذج اللغوية الكبيرة من خلال قياس قدرتها على الاحتفاظ بالإشارة التشخيصية في مهام التنبؤ اللاحقة، مما يثبت أن الملخصات عالية الضغط يمكن أن تحافظ على ما يصل إلى 97% من الأداء التشخيصي الأصلي للكشف عن فشل القلب.

Heloisa Oss Boll, Antonio Oss Boll, Leticia Puttlitz Boll, Ameen Abu Hanna, Iacer Calixto2026-02-20
💬 NLP

ππ-CoT: Prolog-Initialized Chain-of-Thought Prompting for Multi-Hop Question-Answering

تقدم الورقة البحثية π\pi-CoT، وهي استراتيجية تحفيز مبتكرة تستفيد من لغة برولوغ (Prolog) لتفكيك الأسئلة المعقدة متعددة الخطوات إلى استعلامات فرعية متسلسلة أحادية الخطوة، مما يؤدي إلى تهيئة تسلسل الأفكد (Chain-of-Thought) لتحسين الأداء بشكل كبير في اختبارات قياس الإجابة على الأسئلة متعددة الخطوات مقارنة بطرق التوليد المعزز بالاسترجاع (RAG) وطرق سلسلة الأفكد في السياق القياسية.

Chao Wan, Albert Gong, Mihir Mishra, Carl-Leander Henneking, Claas Beger, Kilian Q. Weinberger2026-02-20
💬 NLP

MCIF: Multimodal Crosslingual Instruction-Following Benchmark from Scientific Talks

تقدم هذه الورقة البحثية MCIF، وهو أول معيار مرجعي عابر للغات ومُصنف بشرياً يعتمد على المحادثات العلمية، والذي يقيم بشكل منهجي النماذج اللغوية الكبيرة متعددة الوسائط عبر أربع لغات وثلاث وسائط وأطوال مدخلات متفاوتة لمعالجة الفجوات في التقييمات الحالية لقدرات اتباع التعليمات.

Sara Papi, Maike Züfle, Marco Gaido, Beatrice Savoldi, Danni Liu, Ioannis Douros, Luisa Bentivogli, Jan Niehues2026-02-20