💬 NLP

QuCo-RAG: Quantifying Uncertainty from the Pre-training Corpus for Dynamic Retrieval-Augmented Generation

يقدم Co-RAG إطار عمل ديناميكي لتوليد النصوص المعزز بالاسترجاع ومستقل عن النموذج، يعمل على الحد من الهلوسة من خلال قياس عدم اليقين عبر إحصائيات متن التدريب المسبق الموضوعية (تكرار الكيانات والتواجد المشترك) عبر تقنية Infini-gram، محققاً مكاسب كبيرة في الأداء عبر نماذج ومعايير متنوعة دون الاعتماد على إشارات النموذج الداخلية غير الموثوقة.

Dehai Min, Kailin Zhang, Tongtong Wu, Lu Cheng2026-05-19
💬 NLP

Lying with Truths: Open-Channel Multi-Agent Collusion for Belief Manipulation via Generative Montage

تقدم هذه الورقة البحثية "المونتاج التوليدي" (Generative Montage)، وهو هجوم تواطؤ معرفي مبتكر حيث تستغل الوكلاء المستقلون نزعات الاستنتاج لدى النماذج اللغوية الكبيرة للتلاعب بالمعتقدات عبر تركيب سرديات مضللة من أدلة حقيقية متاحة علنًا، مما يكشف أن حتى النماذج المتقدمة معرضة بشدة لمثل هذا التلاعب القائم على الحقيقة.

Jinwei Hu, Xinmiao Huang, Youcheng Sun, Yi Dong, Xiaowei Huang2026-05-19
💬 NLP

KASER: Knowledge-Aligned Student Error Simulator for Open-Ended Coding Tasks

تقدم هذه الورقة البحثية KASER، وهو نهج جديد قائم على التعلم التعزيزي يعمل على مواءمة توليد الأخطاء مع معرفة الطالب لمحاكاة أخطاء برمجية متنوعة ودقيقة بفعالية، متفوقاً بذلك على النماذج المرجعية الحالية في كل من التنبؤ بالأخطاء وتنوع الكود البرمجي في مجموعات البيانات الواقعية.

Zhangqi Duan, Nigel Fernandez, Andrew Lan2026-05-19
💬 NLP

Double-Calibration: Towards Reliable LLMs via Calibrating Knowledge and Reasoning Confidence

تقدم الورقة البحثية إطار عمل DoublyCal، الذي يعزز دقة وموثوقية النماذج اللغوية الكبيرة (LLMs) ذات الصندوق الأسود من خلال توظيف نموذج وكيل خفيف الوزن لتوليد أدلة من الرسوم البيانية للمعرفة ذات ثقة مُعايرة، مما يمكّن النموذج اللغوي الكبير من إنتاج تنبؤات مُعايرة جيداً تعود في أصلها إلى عدم اليقين في الأدلة الداعمة.

Yuyin Lu, Ziran Liang, Yanghui Rao, Wenqi Fan, Fu Lee Wang, Qing Li2026-05-19
💬 NLP

UbuntuGuard: A Culturally-Grounded Policy Benchmark for Equitable AI Safety in African Languages

تقدم هذه الورقة UbuntuGuard، وهو أول معيار مرجعي للسلامة قائم على السياسات ومتجذر ثقافياً للغات الأفريقية، والذي يكشف أن نماذج الحماية والمعايير المرجعية الحالية التي تركز على اللغة الإنجليزية تفشل في معالجة المخاطر الاجتماعية والثقافية الفريدة وتحديات ندرة الموارد المتأصلة في السياق الأفريقي بشكل كافٍ.

Tassallah Abdullahi, Macton Mgonzo, Mardiyyah Oduwole, Paul Okewunmi, Abraham Owodunni, Ritambhara Singh, Carsten Eickho (…)2026-05-19
💬 NLP

White-Box Sensitivity Auditing with Steering Vectors

تقترح هذه الورقة إطار عمل للتدقيق في الحساسية بنظام الصندوق الأبيض للنماذج اللغوية الكبيرة، والذي يستفيد من توجيه التنشيط للتلاعب بالمفاهيم الداخلية، مما يكشف عن اعتماد جوهري على السمات المحمية في مهام اتخاذ القرار عالية المخاطر التي غالباً ما تفشل التقييمات القياسية بنظام الصندوق الأسود في اكتشافها.

Hannah Cyberey, Yangfeng Ji, David Evans2026-05-19
💬 NLP

Hunt Instead of Wait: Evaluating Deep Data Research on Large Language Models

تقدم هذه الورقة البحثية "بحث البيانات العميق" (DDR) ومعياره المرجعي المقابل، DDR-Bench، لتقييم الذكاء الاستقصائي للنماذج اللغوية الكبيرة الوكيلية في استخراج الرؤى ذاتياً من البيانات الخام، كاشفةً أنه بينما تُظهر النماذج الرائدة وكالة ناشئة، فإن الاستكشاف الفعال طويل الأمد يتطلب استراتيجيات جوهرية تتجاوز مجرد التوسع أو الهيكلة.

Wei Liu, Peijie Yu, Michele Orini, Yali Du, Yulan He2026-05-19
💬 NLP

Fix the Structural Bottleneck: Context Compression via Explicit Information Transmission

تقدم هذه الورقة ComprExIT، وهو إطار عمل لضغط السياق يعالج الاختناقات الهيكلية في وكلاء النماذج اللغوية الكبيرة (LLM agents) من خلال توظيف نقل معلومات صريح ومنسق عالمياً عبر الطبقات المجمدة، محققاً تحسينات كبيرة في الأداء والكفاءة مقارنة بالطرق الحالية.

Jiangnan Ye, Hanqi Yan, Zhenyi Shen, Heng Chang, Ye Mao, Yulan He2026-05-19
💬 NLP

MentalBench: A DSM-Grounded Benchmark for Evaluating Psychiatric Diagnostic Capability of Large Language Models

تقدم هذه الورقة MentalBench، وهو معيار مرجعي قائم على الدليل التشخيصي والإحصائي الخامس (DSM-5) ويستخدم رسماً بيانياً للمعرفة تم التحقق منه من قبل طبيب نفسي لتقييم قدرات النماذج اللغوية الكبيرة في التشخيص، كاشفةً أنه بينما تتفوق النماذج في استرجاع المعرفة، فإنها تعاني في معايرة الثقة في السيناريوهات السريرية المعقدة والغامضة.

Hoyun Song, Migyeong Kang, Jisu Shin, Jihyun Kim, Chanbi Park, Hangyeol Yoo, Jihyun An, Alice Oh, Jinyoung Han, KyungTae (…)2026-05-19
💬 NLP

Helpful to a Fault: Measuring Illicit Assistance in Multi-Turn, Multilingual LLM Agents

تقدم هذه الورقة STING، وهو إطار عمل ومنهجية تحليل آليين لاختبار الاختراق (red-teaming) لتقييم مدى عرضة وكلاء النماذج اللغوية الكبيرة (LLMs) متعددة الأدوار ومتعددة اللغات للمساعدة غير المشروعة، كاشفةً أن التخطيط العدائي خطوة بخطوة يزيد بشكل كبير من نجاح الهجوم مقارنة بالطرق أحادية الدور، مع تحدي الافتراضات المتعلقة بالتفاوت في الموارد اللغوية فيما يخص الضعف أمام كسر الحماية (jailbreak).

Nivya Talokar, Ayush K Tarun, Murari Mandal, Maksym Andriushchenko, Antoine Bosselut2026-05-19