💬 NLP

Beyond Questions: Evaluating What Large Language Models (Actually) Know

تقدم هذه الورقة البحثية "ما وراء الأسئلة" (BeQu)، وهو نموذج تقييم جديد للمعرفة المفتوحة يقيم النماذج اللغوية الكبيرة بناءً على المعرفة التي تعبر عنها بشكل طبيعي من خلال الاستدلال المفتوح بدلاً من الأسئلة المحددة مسبقاً، مما يكشف عن رؤى هامة حول قدرات النماذج عبر عوامل مختلفة مثل الحجم وجهد الاستدلال.

Luca Giordano, Simon Razniewski2026-05-27
💬 NLP

JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

تقدم الورقة البحثية JuICE، وهي مجموعة بيانات مرجعية متعددة اللغات مصممة لتقييم حدود النماذج اللغوية الكبيرة المستخدمة كحكام في اكتشاف الأخطاء الثقافية الدقيقة والمنبثقة عن السياق، مما يكشف عن عجز النماذج الحالية عن تحديد الفروق الثقافية "العميقة" التي يدركها المتحدثون الأصليون بسهولة.

Jiho Jin, Junho Myung, Juhyun Oh, Junyeong Park, Rifki Afina Putri, Sunipa Dev, Vinodkumar Prabhakaran, Alice Oh2026-05-27
💬 NLP

Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling

تقدم الورقة البحثية "Recon"، وهي طريقة تعمل على تحسين نمذجة المستخدم من خلال تقييم وتوليف مسارات الاستدلال بناءً على قدرتها على إعادة البناء التنبؤي لأفعال المستخدم، وبذلك تتجاوز التبرير اللاحق غير الفعال لتلتقط مسارات القرار السببية الحقيقية.

Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap, Narges Norouzi, Joseph E. Gonzalez2026-05-27
💬 NLP

PashtoTTS-Bench: automated screening for low-resource non-Latin-script text-to-speech

تقدم هذه الورقة البحثية إطار عمل INSV-A، وهو إطار فحص آلي لتقييم تحويل النص إلى كلام للنصوص ذات الموارد المنخفضة وغير المكتوبة بالخط اللاتيني، وتطبقه في شكل PashtoTTS-Bench لتقييم أنظمة متعددة لتحويل النص إلى كلام في اللغة البشتوية بشكل منهجي باستخدام مقاييس مثل معدل خطأ الكلمات في التعرف الآلي على الكلام، ودقة النص، وتحديد اللغة.

Hanif Rahman2026-05-27
💬 NLP

Prompt Injection Detection is Regime-Dependent: A Deployment-Aware Evaluation with Interpretable Structural Signals

تقدم هذه الورقة تقييماً مدركاً لبيئة النشر يوضح أن أداء كشف حقن الأوامر (prompt injection) يعتمد بشكل كبير على النظام الحاكم وحساس تجاه اختيار العتبة، مما يكشف أنه في حين توفر النماذج القائمة على المحولات (transformer-based models) أقوى النتائج الإجمالية، فإن الإشارات الهيكلية القابلة للتفسير توفر مكاسب ثابتة في سيناريوهات تشغيلية محددة وتسلط الضوء على الفجوة الحرجة بين مقاييس الترتيب والفعالية في العالم الحقيقي.

Akindoyin Akinrele, Shreyank N Gowda2026-05-27
💬 NLP

Share More, Search Less: Collaborative Parallel Thinking for Efficient Test-Time Scaling

تقترح هذه الورقة إطار عمل "التفكير المتوازي التعاوني" (CPT)، وهو إطار عمل لا يتطلب تدريباً يعزز كفاءة التوسع في وقت الاختبار من خلال تمكين فروع الاستدلال المتوازية من مشاركة وإعادة استخدام الاكتشافات الوسيطة في الوقت الفعلي، مما يقلل من الاستكشاف غير الضروري ويحقق توازناً فائقاً بين الدقة وزمن الاستجابة في الاختبارات المرجعية الرياضية.

Xinglin Wang, Hao Lin, Shaoxiong Feng, Peiwen Yuan, Yiwei Li, Jiayi Shi, Yueqi Zhang, Chuyi Tan, Ji Zhang, Boyuan Pan, Y (…)2026-05-27
💬 NLP

Tracing Computation Density in LLMs

تقدم هذه الورقة طريقة s-Trace لتكشف أن النماذج اللغوية الكبيرة تعمل بطريقة نمطية ثنائية المراحل، حيث يوفر رسم بياني فرعي متفرق من الطبقات المبكرة تنبؤاً تقريبياً بناءً على إحصاءات ضحلة، والذي يتم بعد ذلك صقله تدريجياً عبر حسابات أكثر كثافة في الطبقات اللاحقة، مع ارتباط كمية الحوسبة اللازمة بعدم يقين النموذج.

Corentin Kervadec, Iuliia Lysova, Iuri Macocco, Marco Baroni, Gemma Boleda2026-05-27
💬 NLP

ExTax: Explainable Disinformation Detection via Persuasion, Emotion, and Narrative Role Taxonomies

يُعد ExTax إطار عمل مبتكرًا وقابلًا للتفسير للكشف عن التضليل الإعلامي، حيث يوحد 17 بُعدًا من البلاغة الإقناعية، والتلاعب العاطفي، والأدوار السردية ضمن فضاء تصنيفي ليتفوق على النماذج المرجعية الحالية من حيث الدقة والمتانة، مع توفير ملفات تعريف تلاعب قابلة للتدقيق البشري.

Shang Luo, Yingguang Yang, Zhenchen Sun, Yang Liu, Bin Chong, Jingru Chen, Yancheng Chen, Jiayu Liang, Kefu Xu, Hao Peng (…)2026-05-27
💬 NLP

QUACK: Questioning, Understanding, and Auditing Communicated Knowledge in Multimodal Social Deduction Agents

تقدم هذه الورقة QUACK، وهو إطار عمل مفتوح المصدر للاستنتاج الاجتماعي متعدد الوسائط يقوم بمراجعة وكلاء النماذج اللغوية الكبيرة من خلال إعادة بناء مسارات الحقيقة الأرضية للكشف تلقائياً عن الهلوسة، والاتهامات غير المدعومة، والتناقضات بين اللغة والأفعال وقياسها كمياً.

Ye Yuan, Rui Song, Weien Li, Zeyu Li, Haochen Liu, Xiangyu Kong, Changjiang Han, Yonghan Yang, Zichen Zhao, Zixuan Dong (…)2026-05-27
🧬 biology

Beyond Binary: Speech Representations Across the Cognitive Score Hierarchy

تحلل هذه الدراسة 5,754 تسجيلاً صوتياً باللغة الألمانية لتكشف أنه في حين تتفوق تمثيلات التعلم ذاتي الإشراف عموماً على الميزات المصممة يدوياً عند المستويات الإدراكية المنخفضة، فإن الميزات المصممة يدوياً تتفوق في تصنيف الاختلال المعرفي البسيط، حيث تحدد القيود الخاصة بالمهمة ما إذا كانت التمثيلات تعمل كـ "متخصصين" أو "عامين" عبر التسلسل الهرمي لدرجات الإدراك.

Serli Kopar, Roshan Prakash Rane, Christian Mychajliw, Lydia Federmann, Gerhard Eschweiler, Daniela Berg, Sam Gijsen, Pa (…)2026-05-27