💬 NLP

SecureForge: Finding and Preventing Vulnerabilities in LLM-Generated Code via Prompt Optimization

تقدم الورقة البحثية SecureForge، وهو مسار مؤتمت يعمل على تحسين الأوامر النظامية باستخدام مجموعة بيانات اصطناعية من الأوامر المعززة بالثغرات الأمنية لتقليل العيوب الأمنية في الكود المولد بواسطة النماذج اللغوية الكبيرة بشكل كبير مع الحفاظ على الأداء الوظيفي، محققاً انخفاضاً يصل إلى 48% في الثغرات الأمنية مع قابلية انتقال من نوع "التعلم من المحاولة الأولى" (zero-shot) إلى سيناريوهات العالم الحقيقي.

Houjun Liu, Lisa Einstein, John Yang, Joachim Baumann, Duncan Eddy, Christopher D. Manning, Mykel Kochenderfer, Diyi Yan (…)2026-05-12
💬 NLP

Change My View? The Dynamics of Persuasion and Polarization in Online Discourse

من خلال تحليل المناظرات على موقع "ريديت" باستخدام النماذج اللغوية الكبيرة، تُظهر هذه الدراسة أن مراجعة المعتقدات في الخطاب عبر الإنترنت مدفوعة بالاستراتيجيات العلاقاتية مثل التنازل والتعاطف أكثر من دحض المنطق المباشر، مما يشير إلى أن الاستدلال العام الفعال يتطلب موازنة المحتوى الدليلي مع التأطير التعاطفي.

David Freeborn, Malihe Alikani, Anthony Sicilia2026-05-12
📊 statistics

Queryable LoRA: Instruction-Regularized Routing Over Shared Low-Rank Update Atoms

تقدم هذه الورقة البحثية "Queryable LoRA"، وهي طريقة لضبط المعلمات بكفاءة عالية، تستبدل المهايئات منخفضة الرتبة الثابتة بذاكرة مشتركة وقابلة للاستعلام من ذرات التحديث التي يتم توجيهها عبر آلية الانتباه ويتم تنظيمها بواسطة التعليمات، مما يتيح تكيفاً ديناميكياً وحساساً للسياق يحسن الأداء والاستقرار مقارنة بالأساليب القياسية.

Omatharv Bharat Vaidya, Connor T. Jerzak, Nhat Ho, Chandrajit Bajaj2026-05-12
📊 statistics

A Semantic-Sampling Framework for Evaluating Calibration in Open-Ended Question Answering

تقدم هذه الورقة Sem-ECE، وهو إطار عمل مبتكر يقيم المعايرة في الإجابة على الأسئلة مفتوحة النهايات من خلال أخذ عينات من مخرجات النموذج وتجميعها في فئات دلالية لتوفير مقياس غير منحاز وقوي يتفوق على الأساليب القائمة على التعبير اللفظي وأساليب أخذ العينات الحالية، لا سيما عندما لا تتوفر احتمالات النموذج الداخلية.

Zhanliang Wang, Jiancong Xiao, Ruochen Jin, Shu Yang, Bojian Hou, Li Shen2026-05-12
🤖 AI

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

تقدم هذه الورقة Magis-Bench، وهو معيار مرجعي جديد مستمد من الاختبارات القضائية البرازيلية يقيم 23 نموذجاً من النماذج اللغوية الكبيرة المتطورة في مهام الاستدلال القانوني والكتابة على مستوى القضاة، كاشفاً أن حتى النماذج الأعلى أداءً تواجه صعوبة في تحقيق درجات عالية في صياغة القرارات القضائية المسببة.

Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Ju (…)2026-05-12
💬 NLP

Can Language Models Identify Side Effects of Breast Cancer Radiation Treatments?

تقيم هذه الدراسة سبعة نماذج لغوية كبيرة في تحديد الآثار الجانبية للإشعاع لعلاج سرطان الثدي باستخدام إطار عمل لاختبار الإجهاد، مما يكشف عن حساسيتها للتغييرات في التوثيق وميلها إلى عدم الإبلاغ الكافي عن السميات النادرة أو طويلة الأمد، بينما تثبت أن ربط المخرجات بقوائم منسقة من قبل الأطباء يحسن الموثوقية بشكل كبير لتطبيقات رعاية الناجين.

Natalie Seah, Danielle S. Bitterman, Daphna Spiegel, Thomas Hartvigsen2026-05-12
🤖 AI

LLM-guided Semi-Supervised Approaches for Social Media Crisis Data Classification

تقدم هذه الورقة أول تقييم تجريبي للتعلم شبه المشرف الموجه بنماذج اللغات الكبيرة لتصنيف التغريدات المتعلقة بالأزمات، مما يثبت أن أساليبًا مثل LG-CoTrain تتفوق بشكل كبير على النهج الكلاسيكية في البيئات ذات الموارد المحدودة، ويمكنها نقل معرفة نماذج اللغات الكبيرة إلى نماذج مدمجة وقابلة للنشر تضاهي النماذج اللغوية الكبيرة ذات القدرة على التعلم الصفري.

Jacob Ativo, Bharaneeshwar Balasubramaniyam, Anh Tran, Khushboo Gupta, Hongmin Li, Doina Caragea, Cornelia Caragea2026-05-12
🤖 AI

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

تُظهر هذه الدراسة أن إعادة تقييم معايير كشف الهلوسة من خلال التحكيم البشري للاستنتاج الذي تولده النماذج اللغوية الكبيرة يكشف أن التوصيفات الأصلية غالباً ما تقلل من تقدير أداء النماذج، مما يشير إلى أن إعادة التقييم بمساعدة النماذج يُنتج معايير أكثر موثوقية للمهام المعرضة للغموض.

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan2026-05-12
💬 NLP

A Computational Operationalisation of Competing Maturational Theories of Syntactic Development via Statistical Grammar Induction

تعمل هذه الورقة على تشغيل نظريات النضج المتنافسة في التطور النحوي حوسبياً باستخدام الاستقراء الإحصائي للقواعد لإثبات أن التفسير "النموّي" (GROWING) القائم على التصاعد من الأسفل إلى الأعلى لاكتساب الفئات يتفوق بشكل ملحوظ على التفسير "الداخلي" (INWARD) في ظل ظروف تعلم متطابقة.

Mila Marcheva, Suchir Salhan, Weiwei Sun2026-05-12
💬 NLP

NARRA-Gym for Evaluating Interactive Narrative Agents

تقدم هذه الورقة NARRA-Gym، وهي بيئة تقييم قابلة للتنفيذ صُممت لتقييم قدرة النماذج اللغوية الكبيرة على الحفاظ على سرد تفاعلي متماسك ومتطور من خلال الإدارة المشتركة لتوليد القصة، والذاكرة، والإيقاع، والتخصيص، مما يكشف عن تباينات كبيرة في الأداء عبر النماذج تتجاوز مجرد الطلاقة البسيطة.

Yue Huang, Yuchen Ma, Jiayi Ye, Wenjie Wang, Zipeng Ling, Xingjian Hu, Yuexing Hao, Zichen Chen, Zhangchen Xu, Yunhong H (…)2026-05-12