💬 NLP

Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?

تقيم هذه الدراسة سبعة نماذج لغوية كبيرة في تحديد الآثار الجانبية للإشعاع لعلاج سرطان الثدي باستخدام إطار عمل لاختبار الإجهاد، مما يكشف عن حساسيتها للتغييرات في التوثيق وميلها إلى عدم الإبلاغ الكافي عن السميات النادرة أو طويلة الأمد، بينما تثبت أن ربط المخرجات بقوائم منسقة من قبل الأطباء يحسن الموثوقية بشكل كبير لتطبيقات رعاية الناجين.

Natalie Seah, Danielle S. Bitterman, Daphna Spiegel, Thomas Hartvigsen2026-05-12
🤖 AI

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

تقدم هذه الورقة أول تقييم تجريبي للتعلم شبه المشرف الموجه بنماذج اللغات الكبيرة لتصنيف التغريدات المتعلقة بالأزمات، مما يثبت أن أساليبًا مثل LG-CoTrain تتفوق بشكل كبير على النهج الكلاسيكية في البيئات ذات الموارد المحدودة، ويمكنها نقل معرفة نماذج اللغات الكبيرة إلى نماذج مدمجة وقابلة للنشر تضاهي النماذج اللغوية الكبيرة ذات القدرة على التعلم الصفري.

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea2026-05-12
🤖 AI

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

تُظهر هذه الدراسة أن إعادة تقييم معايير كشف الهلوسة من خلال التحكيم البشري للاستنتاج الذي تولده النماذج اللغوية الكبيرة يكشف أن التوصيفات الأصلية غالباً ما تقلل من تقدير أداء النماذج، مما يشير إلى أن إعادة التقييم بمساعدة النماذج يُنتج معايير أكثر موثوقية للمهام المعرضة للغموض.

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan2026-05-12
💬 NLP

A Computational Operationalisation of Competing Maturational Theories of Syntactic Development via Statistical Grammar Induction

تعمل هذه الورقة على تشغيل نظريات النضج المتنافسة في التطور النحوي حوسبياً باستخدام الاستقراء الإحصائي للقواعد لإثبات أن التفسير "النموّي" (GROWING) القائم على التصاعد من الأسفل إلى الأعلى لاكتساب الفئات يتفوق بشكل ملحوظ على التفسير "الداخلي" (INWARD) في ظل ظروف تعلم متطابقة.

Mila Marcheva, Suchir Salhan, Weiwei Sun2026-05-12
💬 NLP

NARRA-Gym for Evaluating Interactive Narrative Agents

تقدم هذه الورقة NARRA-Gym، وهي بيئة تقييم قابلة للتنفيذ صُممت لتقييم قدرة النماذج اللغوية الكبيرة على الحفاظ على سرد تفاعلي متماسك ومتطور من خلال الإدارة المشتركة لتوليد القصة، والذاكرة، والإيقاع، والتخصيص، مما يكشف عن تباينات كبيرة في الأداء عبر النماذج تتجاوز مجرد الطلاقة البسيطة.

Yue Huang, Yuchen Ma, Jiayi Ye, Wenjie Wang, Zipeng Ling, Xingjian Hu, Yuexing Hao, Zichen Chen, Zhangchen Xu, Yunhong H (…)2026-05-12
🤖 AI

Human-Inspired Memory Architecture for LLM Agents

تقدم هذه الورقة بنية ذاكرة قائمة على أسس بيولوجية لوكلاء النماذج اللغوية الكبيرة (LLM agents) تتميز بست آليات معرفية ومنهجية معايرة اصطناعية، مما يظهر تحسينات كبيرة في دقة الاستبقاء وكفاءة التخزين عبر اختبارات تتبع المشكلات والدردشة الشخصية واسعة النطاق.

Doga Kerestecioglu, Alexei Robsky, Clemens Vasters, Anshul Sharma, Yitzhak Kesselman2026-05-12
🤖 machine learning

PAAC: Privacy-Aware Agentic Device-Cloud Collaboration

يُعد PAAC إطار عمل وكيلٍ واعٍ بالخصوصية يعمل على مواءمة تفكيك المخطط والمنفذ مع الحد الفاصل بين الجهاز والسحابة، وذلك باستخدام رموز نائبة نمطية وسجل حتمي لتحسين الدقة بشكل كبير مع تقليل تسرب البيانات بشكل جذري مقارنة بالنماذج المرجعية الحالية المتطورة.

Liangqi Yuan, Wenzhi Fang, Shiqiang Wang, Christopher G. Brinton2026-05-12
🤖 AI

AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

تقدم الورقة البحثية AgentCollabBench، وهو معيار تشخيصي يكشف أن إخفاقات الأنظمة متعددة الوكلاء تنبع غالباً من اختناقات التواصل الهيكلية ومخاطر سلوكية محددة مثل تدهور التعليمات وانتقال العدوى بالاعتقاد الخاطئ، مما يثبت أن التعاون الموثوق يعتمد على التصميم المعماري أكثر من اعتماده على توسيع ذكاء النموذج وحده.

Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu De (…)2026-05-12
🤖 AI

MIND-Skill: Quality-Guaranteed Skill Generation via Multi-Agent Induction and Deduction

تقدم الورقة البحثية MIND-Skill، وهو إطار عمل متعدد الوكلاء يقوم تلقائياً بتوليد مهارات نماذج لغوية كبيرة عالية الجودة وقابلة لإعادة الاستخدام من خلال دورة استقراء واستنتاج مُحسّنة عبر خسائر نصية (إعادة البناء، والنتيجة، والمعايير) لضمان المتانة والقدرة على التعميم في المهام المعقدة.

Yixuan Li, Mingshu Cai, Ziyang Xiao, Wanyuan Wang, Yanchen Deng, Bo An2026-05-12
🤖 AI

Explanation Fairness in Large Language Models: An Empirical Analysis of Disparities in How LLMs Justify Decisions Across Demographic Groups

تقدم هذه الورقة تصنيف عدالة التفسير (EFT) وتقدم أدلة تجريبية على أن النماذج اللغوية الكبيرة تولد بشكل منهجي تفسيرات متفاوتة الجودة والنبرة والتعقيد عبر المجموعات الديموغرافية، مما يكشف أنه في حين يمكن للتلقين أن يخفف من التفاوتات المرتبطة بالقرار، إلا أن عدم المساواة الأسلوبية تظل قائمة بسبب توزيعات ما قبل التدريب.

Gautam Veldanda2026-05-12