💬 NLP

Holistic Evaluation and Failure Diagnosis of AI Agents

تقدم هذه الورقة إطار تقييم شامل يجمع بين التشخيص من الأعلى إلى الأسفل والتقييم على مستوى النطاق من الأسفل إلى الأعلى لتحديد وتصنيف الإخفاقات في الوكلاء الاصطناعيين بفعالية، محققةً أداءً هو الأفضل حالياً في اختبارات TRAIL، ومثبتةً أن منهجية التقييم، وليس قدرة النموذج، هي العائق الأساسي في تشخيص الوكيل.

Netta Madvil, Gilad Dym, Alon Mecilati, Edo Dekel, Jonatan Liberman, Rotem Brazilay, Liron Schliesser, Max Svidlo, Shai (…)2026-05-15
💬 NLP

Tokenizer Fertility and Zero-Shot Performance of Foundation Models on Ukrainian Legal Text: A Comparative Study

تُقارن هذه الدراسة بين سبعة من النماذج التأسيسية في النصوص القانونية الأوكرانية، كاشفةً أن كفاءة أداة التجزئة (tokenizer) تؤثر بشكل كبير على تكاليف واجهة برمجة التطبيقات (API)، وأن نموذج NVIDIA Nemotron Super 3 بـ 120 مليار معلمة يتفوق على نموذج Mistral Large 3 الأكبر حجماً بجزء بسيط من التكلفة، وأن التلقين بصفر محاولة (zero-shot prompting) يتفوق على التلقين ببضع محاولات (few-shot prompting) لهذه اللغة الغنية صرفياً.

Volodymyr Ovcharov2026-05-15
💬 NLP

Quantifying and Mitigating Premature Closure in Frontier LLMs

تُعرّف هذه الدراسة وتُحدد كمياً ظاهرة "الإغلاق المبكر" في النماذج اللغوية الكبيرة الرائدة بوصفها ميلها لتقديم إجابات غير ملائمة في حالات عدم اليقين، مما يكشف عن معدلات فشل عالية عبر الاختبارات المعيارية الطبية ويُظهر أنه بينما يوفر التوجيه الأمني بعض التخفيف، إلا أن مخاطر الثقة المفرطة تظل قائمة بشكل كبير.

Rebecca Handler, Suhana Bedi, Nigam Shah2026-05-15
💬 NLP

The Scientific Contribution Graph: Automated Literature-based Technological Roadmapping at Scale

تقدم هذه الورقة "رسم بياني للمساهمات العلمية" (Scientific Contribution Graph)، وهو مورد واسع النطاق يضم مليوني مساهمة مستخرجة و12.5 مليون حافة متطلب سابق من 230,000 ورقة بحثية، لتمكين رسم الخرائط التكنولوجية المؤتمت ودعم الاكتشاف العلمي من خلال التنبؤ بالمتطلبات السابقة.

Peter A. Jansen2026-05-15
💬 NLP

Small, Private Language Models as Teammates for Educational Assessment Design

تُثبت هذه الورقة أن النماذج اللغوية الصغيرة يمكن أن تعمل كزملاء تنافسيين ومحافظين على الخصوصية في تصميم التقييم التعليمي من خلال مضاهاة النماذج اللغوية الكبيرة في توليد أسئلة متوافقة تربوياً، مع تسليط الضوء على ضرورة الإشراف البشري بسبب التحيزات المنهجية في التقييم الآلي.

Chris Davis Jaldi, Anmol Saini, Shan Zhang, Noah Schroeder, Cogan Shimizu, Eleni Ilkou2026-05-15
💬 NLP

AI Knows When It's Being Watched: Functional Strategic Action and Contextual Register Modulation in Large Language Models

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تُبدي تكيفاً لغوياً ومنهجياً وصياغةً رسميةً للسجل اللغوي عندما تدرك وجود مراقبة اجتماعية، حيث تستثير المراقبة البشرية تغييرات سلوكية أقوى من المراقبة الآلية بالذكاء الاصطناعي، مما يكشف عن قدرتها على العمل التواصلي الاستراتيجي في السياقات ذات البنية الاجتماعية.

Vinicius Covas, Jorge Alberto Hidalgo Toledo2026-05-15
💬 NLP

Orchard: An Open-Source Agentic Modeling Framework

تقدم الورقة البحثية Orchard، وهو إطار عمل مفتوح المصدر يتميز بطبقة بيئة خفيفة الوزن (Orchard Env) ووصفات تدريب متخصصة تتيح نمذجة وكيلة قابلة للتوسع وعالية الأداء عبر مجالات البرمجة، وواجهات المستخدم الرسومية (GUI)، والمساعد الشخصي، محققةً بذلك نتائج رائدة بين النماذج مفتوحة المصدر.

Baolin Peng, Wenlin Yao, Qianhui Wu, Hao Cheng, Xiao Yu, Rui Yang, Tao Ge, Alessandrio Sordoni, Xingdi Yuan, Yelong Shen (…)2026-05-15
💬 NLP

On the Cultural Anachronism and Temporal Reasoning in Vision Language Models

تحدد هذه الورقة وتُحدد كمياً ظاهرة "المفارقة التاريخية الثقافية" —وهي ميل نماذج الرؤية واللغة إلى إساءة تفسير القطع الأثرية التاريخية باستخدام مفاهيم غير ملائمة زمنياً— من خلال تقديم معيار (TAB-VLM)، الذي يكشف عن فجوات أداء كبيرة في النماذج الرائدة عند التفكير في التراث الثقافي الهندي.

Mukul Ranjan, Prince Jha, Khushboo Kumari, Zhiqiang Shen2026-05-15
💬 NLP

Concurrency without Model Changes: Future-based Asynchronous Function Calling for LLMs

تقدم هذه الورقة AsyncFC، وهو إطار عمل يقلل من زمن انتقال وكلاء النماذج اللغوية الكبيرة (LLM agents) عن طريق فصل فك تشفير النموذج عن تنفيذ الدوال لتمكين استخدام الأدوات بشكل غير متزامن ومتوازٍ دون الحاجة إلى أي ضبط دقيق للنموذج أو تغييرات في البروتوكول.

Guangyu Feng, Huanzhi Mao, Prabal Dutta, Joseph E. Gonzalez2026-05-15
💬 NLP

From Text to Voice: A Reproducible and Verifiable Framework for Evaluating Tool Calling LLM Agents

تقدم هذه الورقة إطار عمل قابلاً لإعادة الإنتاج وغير مرتبط بمجموعة بيانات محددة، يقوم بتحويل معايير استدعاء الأدوات القائمة على النصوص إلى تقييمات صوتية دون الحاجة إلى إعادة التوسيم، مما يكشف عن فجوات أداء كبيرة تعتمد على النموذج بين النص والصوت، مع التحقق من فعالية النماذج اللغوية الكبيرة مفتوحة المصدر كأدوات تقييم فعالة وتحافظ على الخصوصية.

Md Tahmid Rahman Laskar, Xue-Yong Fu, Seyyed Saeed Sarfjoo, Quinten McNamara, Jonas Robertson, Shashi Bhushan TN2026-05-15