💬 NLP

Whether LLMs Can Navigate Beliefs and Facts Depends on How You Phrase It

تكشف هذه الورقة أن قدرة النماذج اللغوية الكبيرة على التنقل بين معتقدات المستخدم والحقائق حساسة للغاية للصياغة، حيث إن ميلها الافتراضي للتحقق من صحة الادعاءات غالبًا ما يؤدي بها إلى تجاوز المعتقدات المصرح بها، لا سيما عند استخدام أفعال معرفية محددة.

Quang Minh Nguyen, Luis Frentzen Salim2026-08-19
💬 NLP

BayesPrompt: human readable prompts that make sense

تقدم الورقة البحثية BayesPrompt، وهو إطار عمل للاستدلال البايزي اللاحق يعيد صياغة تحسين الأوامر (prompt optimization) لإنشاء أوامر قابلة للقراءة من قبل البشر بكفاءة، متجاوزاً بذلك عدم وضوح الطرق التقليدية مع إثبات أداء فائق على مجموعات البيانات الواقعية.

Franky Kevin Nando Tezoh, Ali Hussaini Umar, Alessandro Laio, Guido Sanguinetti, Riccardo Rende2026-08-19
💬 NLP

BEAR-Bench: A Bilingual Enterprise and Academic Reasoning Benchmark for Multimodal Models

تقدم هذه الورقة البحثية BEAR-Bench، وهو معيار تقييم ثنائي اللغة (الإنجليزية-الروسية) يتكون من 1,000 سؤال تم تصنيفها بشرياً بناءً على وثائق مؤسسية وأكاديمية غنية بالنصوص لتقييم قدرات الاستدلال المعقدة وموثوقية كشف الهلوسة للنماذج اللغوية الكبيرة متعددة الوسائط، مما يكشف عن فجوات أداء كبيرة حتى بين الأنظمة الأكثر تطوراً.

Liubov Chubarova, Alexandra Kuleshova, Daniil Volkov, Kirill Sultanov, Alexey Zaytsev2026-08-19
💬 NLP

SpeechSense: A Paralinguistic-Focused Dataset for Fine-Grained Speech Sentiment Analysis

تقدم الورقة البحثية SpeechSense، وهو مجموعة بيانات مبتكرة تتميز بتصنيف مكون من 8 فئات للمواقف بين الأشخاص مستمدة من الإشارات النبرية، مما يثبت أن النماذج التي تستفيد من المعلومات الصوتية تتفوق بشكل كبير على النهج المعتمدة على النص فقط في تحليل مشاعر الكلام دقيق التفاصيل.

Shicheng Ma, Wenqian Cui, Irwin King2026-08-19
💬 NLP

Do Large Language Models Play Six Degrees of Separation? Measuring Topological Compression in Long-Context Manifolds

تكشف هذه الورقة أن الطبقات العميقة للنماذج اللغوية الكبيرة تنظم بطبيعتها تمثيلات السياق الطويل في شبكات "العالم الصغير" (Small-World networks) حيث تتقلص المسافات الدلالية إلى ست قفزات أو أقل، وهو توقيع طوبولوجي يميز بفعالية بين الاستدلال الواقعي والهلوسة في عملية التوليد المعزز بالاسترجاع (RAG).

Md. Faiyaz Abdullah Sayeedi2026-08-19
💬 NLP

When Writing Style Drifts: Benchmarking Authorship Verification under Distribution Shifts in Genre, Time and the AI-Era

تقدم هذه الورقة AVShift، وهو أول معيار ألماني لتقييم التحقق من التأليف بشكل منهجي تحت تأثير تحولات التوزيع في النوع والزمن وعصر الذكاء الاصطناائي، كاشفاً أن النماذج اللغوية الكبيرة الضخمة التي تم ضبطها بدقة هي الأفضل في التعميم عبر الأنواع، بينما يؤدي الانحراف الزمني إلى تدهور الأداء بشكل كبير، رغم عدم رصد أي تحول ملموس في عصر الذكاء الاصطناعي.

Lotta Kiefer, Brisca Balthes, Christoph Leiter, Yamen Ajjour, Elena Schmidt, Steffen Eger2026-08-19
💬 NLP

Judge, Retrieve, or Abstain: Uncertainty-Guarded LLM Judging with Provable Risk Guarantees

تقترح هذه الورقة إطار عمل للتحكيم القائم على النماذج اللغوية الكبيرة (LLM) يتميز بالتحكم في المخاطر، حيث يقوم بتوجيه الحالات ديناميكياً بين الأنماط البارامترية والأنماط المعززة بالاسترجاع بناءً على عتبات عدم يقين مُعايرة، مما يضمن بقاء معدل الاكتشاف الخاطئ للأحكام المقبولة دون المستوى المحدد من قبل المستخدم مع تعظيم نطاق التغطية.

Sher Badshah, Ali Emami, Hassan Sajjad2026-08-19
💬 NLP

Chain-of-Experience for Continual LLM Improvement

تقدم هذه الورقة "سلسلة الخبرة" (Chain-of-Experience - CoE)، وهو إطار عمل يُمكّن النماذج اللغوية الكبيرة من التحسن المستمر أثناء عملية الاستدلال عبر تراكم آثار تجريبية تكرارية من التغذية الراجعة الذاتية والبيئية، مما يتفوق باستمرار على النماذج المرجعية ذات الخطوة الصفرية في مهام الرياضيات والبرمجة والمعرفة مع تقليل تكاليف واجهة برمجة التطبيقات (API).

Haoqin Tu, Yunhao Fang, Yizhong Wang, Cihang Xie, Shen Yan2026-08-19
🤖 AI

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

تكشف هذه الورقة عن هشاشة الوكلاء ذاتيي التحسين القائمين على الذاكرة من خلال إثبات أن أداءهم حساس للغاية لتباين التقييم وترتيب المهام بسبب عدم التحديد، مما يدعو إلى بروتوكولات تقييم أكثر صرامة وتعزيز الإشراف البشري.

Qinyuan Ye, Yu Li, Yada Pruksachatkun, Jiaxin Zhang, Chien-Sheng Wu2026-08-19
💬 NLP

Multi-Agent AI System for Radiology Report Structuring and Quality Assurance with Independent Radiologist Evaluation

تُظهر هذه الدراسة أن نظام ذكاء اصطناعي متعدد الوكلاء ومنشور محلياً يقوم بهيكلة تقارير الأشعة بفعالية إلى أقسام تشريحية معيارية ويجري فحوصات لضمان الجودة بأداء إيجابي تم التحقق منه من خلال تقييم أطباء أشعة مستقلين.

Iryna Hartsock, Cesar Lam, Christopher Otteni, Aliya Qayyum, Robert Gatenby, Cyrillo Araujo, Ghulam Rasool2026-08-19