💬 NLP

ToolRegistry: A Protocol-Agnostic Tool Management Library for Function-Calling LLMs

تقدم هذه الورقة ToolRegistry، وهو نظام بيئي معياري ومستقل عن البروتوكولات يقلل بشكل كبير من أعباء التطوير ويحسن الأداء لتطبيقات النماذج اللغوية الكبيرة (LLM) من خلال توحيد إدارة الأدوات وتنفيذها وتكاملها عبر سجل مركزي، ومهايئات خادم، ومركز منسق لأدوات جاهزة للإنتاج.

Peng Ding2026-03-19
💬 NLP

Incongruent Positivity: When Miscalibrated Positivity Undermines Online Supportive Conversations

تتقصى هذه الورقة ظاهرة "الإيجابية غير المتوافقة"، حيث تؤدي الاستجابات الإيجابية التي تفتقر إلى التقدير الصحيح رغم حسن النية إلى تقويض الدعم عبر الإنترنت، مما يكشف عن كون النماذج اللغوية الكبيرة عرضة بشكل خاص لهذا التفاؤل الاستخفافي في السياقات العاطفية عالية المخاطر، وتقترح إطار عمل للكشف يهدف إلى توجيه تطوير أنظمة حوار داعمة أكثر وعياً بالسياق وحفاظاً على الثقة.

Leen Almajed, Abeer ALdayel2026-03-19
💬 NLP

IA2: Alignment with ICL Activations Improves Supervised Fine-Tuning

تقدم هذه الورقة تقنية محاذاة تنشيط التعلم في السياق (IA2)، وهي تقنية تقطير ذاتي تعمل على محاذاة نماذج الضبط الدقيق الخاضع للإشراف (SFT) مع أنماط التنشيط الداخلية للتعلم في السياق (ICL) لتحسين دقة المخرجات ومعايرتها بشكل كبير عبر معايير قياسية متعددة.

Aayush Mishra, Daniel Khashabi, Anqi Liu2026-03-19
💬 NLP

HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment

تقدم هذه الورقة HarmMetric Eval، وهو معيار منهجي يكشف أن المقاييس التقليدية القائمة على المراجع يمكن أن تتفوق على الحكام القائمين على النماذج اللغوية الكبيرة في تقييم الضرر الدقيق، مما أدى إلى تصميم حَكَم مُحسَّن يدمج هذه المقاييس ويحقق أداءً هو الأفضل في فئته.

Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren2026-03-19
💬 NLP

Bringing Emerging Architectures to Sequence Labeling in NLP

تتقصى هذه الورقة مدى قابلية تطبيق البنيات الناشئة مثل xLSTMs ونماذج فضاء الحالة الهيكلية على مهام وسم المتتاليات، كاشفةً أن أداءها القوي في الإعدادات الأبسط غالباً ما يفشل في التعميم عبر اللغات والبيانات المختلفة ومشكلات الوسم المعقدة بنيوياً.

Ana Ezquerro, Carlos Gómez-Rodríguez, David Vilares2026-03-19
📊 statistics

Silenced Biases: The Dark Side LLMs Learned to Refuse

تقدم هذه الورقة معيار "التحيز الصامت" (SBB)، وهو إطار عمل يستخدم توجيه التنشيط لتقليل حالات الرفض في النماذج وكشف "التحيزات الصامتة" — وهي تفضيلات غير عادلة مخفية داخل النماذج اللغوية الكبيرة المتوافقة مع معايير السلامة، والتي تفسرها طرق التقييم القياسية خطأً على أنها عدالة.

Rom Himelstein, Amit LeVi, Brit Youngmann, Yaniv Nemcovsky, Avi Mendelson2026-03-19
💬 NLP

SO-Bench: A Structural Output Evaluation of Multimodal LLMs

تقدم هذه الورقة SO-Bench، وهو معيار شامل يتكون من أكثر من 6,500 مخطط JSON متنوع و1,800 زوج من الصور والمخططات المنسقة عبر أربعة مجالات بصرية لتقييم وتحسين قدرات النماذج اللغوية الكبيرة متعددة الوسائط في إنتاج مخرجات مهيكلة متوافقة مع المخططات بشكل منهجي.

Di Feng, Kaixin Ma, Feng Nan, Haofeng Chen, Bohan Zhai, David Griffiths, Mingfei Gao, Zhe Gan, Eshan Verma, Yinfei Yang (…)2026-03-19
💬 NLP

The Moralization Corpus: Frame-Based Annotation and Analysis of Moralizing Speech Acts across Diverse Text Genres

تقدم هذه الورقة "مجموعة بيانات الأخلقة" (Moralization Corpus)، وهي مجموعة بيانات جديدة متعددة الأنواع من النصوص الألمانية المشروحة بمخطط قائم على الأطر لتحليل الأفعال الكلامية الأخلاقية، مع تقييم قدرات وحدود النماذج اللغوية الكبيرة في اكتشاف واستخراج هذه الحجج المعقدة والحساسة للسياق.

Maria Becker, Mirko Sommer, Lars Tapken, Yi Wan Teh, Bruno Brocai2026-03-19
💬 NLP

EpiQAL: Benchmarking Large Language Models in Epidemiological Question Answering for Enhanced Alignment and Reasoning

تقدم هذه الورقة البحثية EpiQAL، وهو أول معيار تشخيصي مصمم لتقييم النماذج اللغوية الكبيرة في الاستدلال الوبائي القائم على الأدلة عبر ثلاث مجموعات فرعية تتدرج في الصعوبة، مما يكشف أن النماذج الحالية تعاني في الاستنتاج متعدد الخطوات وأن الأداء لا يتحدد فقط بحجم النموذج.

Mingyang Wei, Dehai Min, Zewen Liu, Yuzhang Xie, Guanchen Wu, Ziyang Zhang, Carl Yang, Max S. Y. Lau, Qi He, Lu Cheng, W (…)2026-03-19
💬 NLP

APEX-SWE

تقدم الورقة البحثية APEX-SWE، وهو معيار مرجعي جديد يقيم نماذج الذكاء الاصطناعي الرائدة في مهام هندسة البرمجيات الواقعية ذات القيمة الاقتصادية مثل تكامل الأنظمة وتصحيح أخطاء الإنتاج، كاشفةً أن النماذج الأعلى أداءً تحقق النجاح بشكل أساسي من خلال الانضباط المعرفي والتحقق المنهجي.

Abhi Kottamasu, Chirag Mahapatra, Sam Lee, Ben Pan, Aakash Barthwal, Akul Datta, Ajay Arun, Silas Alberti, Adarsh Hirema (…)2026-03-19