💬 NLP

Latent Fact-Checking: Detecting Misinformation through Activation Engineering

تقدم هذه الورقة البحثية LaFaCt، وهو إطار عمل قابل للتوسع للكشف عن المعلومات المضللة يحدد الأكاذيب من خلال إسقاط تنشيط الرمز الأخير للمدخل على "اتجاه معلومات مضللة" كامن مستمد من هندسة التنشيط التباينية، محققاً أداءً تنافسياً عبر مختلف أحجام النماذج دون الحاجة إلى ضبط دقيق أو استرجاع أدلة خارجية.

Pedro Barcelos, Otávio Parraga, Marcelo M. Mussi, Lucas M. Fraga, Lucas S. Kupssinskü, Rodrigo C. Barros2026-08-11
💬 NLP

EvalConvoLearn: An Open-Source Framework for Evaluating Grounded Learner Simulations in Tutoring Conversations

يقدم هذا البحث EvalConvoLearn، وهو إطار عمل مفتوح المصدر مصمم لتقييم مدى دقة محاكاة المتعلمين القائمة على النماذج اللغوية الكبيرة في محادثات التدريس، وذلك من خلال قياس سلوكيات التعلم وجودة المحادثة مقابل مجموعات بيانات الحوار الأصيلة.

Baptiste Moreau-Pernet2026-08-11
💬 NLP

JaleesBench: Are AI Assistants Good Spiritual Company?

تقدم هذه الورقة JaleesBench، وهو معيار لتقييم المساعدين في الذكاء الاصطناعي بصفتهم "رفقاء صالحين" في السياقات الدينية من خلال قياس الأثر الأخلاقي لنصحهم، مما يكشف أن مطالبات التوجيه البسيطة يمكن أن ترفع النماذج العامة لتضاهي أو تتجاوز الأنظمة المتخصصة والمصقولة في مجالها في الحفاظ على النزاهة الأخلاقية تحت الضغط.

M. Waleed Kadous (iaser.ai, Faith Family Technology Network), Benjamin Olsen (Faith Family Technology Network)2026-08-11
💬 NLP

How sensitive do we want AI to be? Socio-communicative competencies of large language models in healthcare

تقيم هذه الدراسة الكفاءات التواصلية والاجتماعية لثلاثة نماذج لغوية كبيرة (GPT-4o وLlama 3 وCommand R+) في حوارات الرعاية الصحية باستخدام أداة IC-MD، حيث وجدت أنه على الرغم من إظهارها لعدم العدائية، إلا أنها تفتقر إلى الحساسية المتسقة، وعدم التطفل، ومهارات الهيكلة اللازمة للاستخدام الآمن والفعال كمستشارين في مجال الرعاية الصحية.

Dorothee Amelung, Andrew M. Bean, Sabine C. Herpertz, Felix H. Krones, Guy Parsons, Adam Mahdi, Isabella Schneider2026-08-11
📊 statistics

The Judge Knows When It Knows: Calibrated Abstention for LLM-Based A/B-Test Prediction

تُظهر هذه الدراسة أنه بينما لا تستطيع النماذج اللغوية الكبيرة متعددة الوسائط التنبؤ بنتائج اختبارات (A/B) الحقيقية بشكل موثوق من خلال لقطات الشاشة وحدها بسبب انحياز مشترك نحو الملصقات غير الموثوقة، إلا أنها يمكن أن تحقق دقة ذات مغزى من خلال معايرة تنبؤاتها لتحديد والامتناع عن الحالات غير المؤكدة، وهو قصور يحاكي عدم قدرة الخبراء البشريين على التفوق على الصدفة رغم وجود توافق عالٍ بين المقيمين.

Tyler Dooskin, Squoosh Technical Staff2026-08-11
💬 NLP

Unified Hallucination Fuzzing for Multimodal Large Language Models

تقدم هذه الورقة UniHall، وهو معيار موحد للهلوسة وإطار عمل للفحص الذاتي متعدد الوسائط التكيفي (SAMF) يكشف عن تدهور كبير في الأداء ومقايضة بين الفائدة والهلوسة في النماذج اللغوية الكبيرة متعددة الوسائط المتطورة من خلال اختبار الإجهاد الديناميكي والتطوري.

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen (…)2026-08-11
🤖 AI

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

تكشف هذه الورقة أنه بينما يمكن للمجسات الخطية اكتشاف السياق الفاسد في النماذج اللغوية بدقة، إلا أنها تفشل في التنبؤ بموثوقية صحة الإجابة النهائية أو توجيه التدخلات الفعالة في الوقت الفعلي، مما يستلزم استراتيجيات توجيه مدركة للنموذذ ومدركة لنوع الخطأ بدلاً من حل مراقبة واحد يناسب الجميع.

Jyotin Goel, Ipshita Bandyopadhyay, Justin Shenk2026-08-11
🤖 AI

NL2SHACL-Bench: A Benchmark Suite for Natural Language to SHACL Translation

تقدم هذه الورقة البحثية NL2SHACL-Bench، وهي مجموعة معايير مرجعية مبتكرة مصممة لتقييم ترجمة متطلبات اللغة الطبيعية إلى أشكال SHACL، والتي كشفت أنه بينما تستطيع النماذج اللغوية الكبيرة الحالية توليد صيغ SHACL صحيحة نحوياً، إلا أنها لا تزال تواجه صعوبة في إنتاج قيود مكافئة دلالياً للأنماط المنطقية والهيكلية المعقدة.

Yuchen Zhou, Niels Bobet, Maribel Acosta2026-08-11
💬 NLP

Scaling Inherently Interpretable Language Models

تتحدى هذه الورقة المفهوم القائل بأن القابلية للتفسير تمثل مقايضة على حساب القدرة، وذلك من خلال إثبات أن دمج قيود القابلية للتفسير في مسار التدريب يسمح لنماذج مثل Steerling-8B بالتوسع بفعالية، لتصبح أكثر شفافية وتوافقاً مع المفاهيم البشرية مع الحفاظ على أداء تنافسي.

Guide Labs Team, Andreas Madsen, Aya Abdelsalam Ismail, Giang Nguyen, Isaac Plant, Muawiz Chaudhary, Nathaniel Monson, S (…)2026-08-11
💬 NLP

DevIntent: How Much Does LLM-Generated Code Violate Developer Intent?

تقدم هذه الورقة مقياس معدل انتهاك النية (IVR) ومعياراً مقابلاً للكشف عن أنه في حين يجتاز الكود المولد بواسطة النماذج اللغوية الكبيرة الاختبارات المرئية القياسية بشكل متكرر، إلا أنه ينتهك بشكل منهجي نوايا المطورين الضمنية في أكثر من نصف الحالات، مما يشير إلى أن معدلات النجاح الحالية تبالغ في تقدير التوافق بين الكود المولد والنية الحقيقية للمطور بشكل كبير.

Susana Haing, Natan Vidra, Spurthi Setty2026-08-11