💬 NLP

Can Zero-Shot LLMs Predict Child Malnutrition? A Fairness and Temporal Robustness Study

تقيم هذه الدراسة جدوى وعدالة ومتانة النموذج الزمني لاستخدام نموذج GPT-4o-mini بنظام التعلم الصفري للتنبؤ بتقزم الأطفال في بنغلاديش، حيث وجدت أنه على الرغم من تحقيقه دقة مماثلة وحساسية أعلى من خط الأساس الخاضع للإشراف مع أداء مستقر بمرور الوقت، إلا أنه يظهر تفاوتات كبيرة في العدالة عبر فئات الإقامة والثروة تستدعي الحذر قبل النشر في مجال الصحة العامة.

Muhammad Ashad Kabir, Md Ahshanul Haque2026-08-03
💬 NLP

Authorship Verification of Transcribed German-Language Videos

تتناول هذه الورقة التحدي غير المستكشف كفايةً المتمثل في التحقق من هوية المؤلف للغة الألمانية المنطوقة من خلال تقييم عشر طرق على نصوص الفيديو، حيث وجدت أن أساليب الـ n-gram التقليدية القائمة على الحروف والرموز (tokens) تتفوق على النماذج الحديثة القائمة على المحولات (transformers) بدقة تصل إلى 88%.

Oren Halvani, Sophie Titze2026-08-03
💬 NLP

Language Models Agree With Each Other, Not With Readers

تُظهر هذه الورقة أن النماذج اللغوية الكبيرة تُبدي توافقاً داخلياً أعلى بكثير فيما بينها مقارنة بالقراء البشر، مما يكشف أن مخرجات النماذج قد أصبحت متجانسة بفعل تدريبها وبنيتها بدلاً من أن تعكس إجماعاً بشرياً حقيقياً.

Kazuki Nakayashiki, Keisuke Watanabe2026-08-03
💬 NLP

PTP: Previous-Token Prediction based LLM Inversion for Near-Exact Prompt Reconstruction

تقدم هذه الورقة البحثية طريقة PTP، وهي طريقة "الصندوق الأسود" لإعادة بناء المطالبات بدقة تقارب المطابقة عبر تدريب نموذج لغوي عكسي صريح من الصفر باستخدام التنبؤ بالرمز السابق على بيانات اصطناعية تم إنشاؤها بواسطة النموذج اللغوي الكبير المستهدف، متفوقة بذلك على أساليب إعادة البناء الدلالي السابقة في الدقة والقابلية للنقل.

Pirzada Suhail, Nagasai Saketh Naidu, Atanu R Sinha, Amit Sethi2026-08-03
💬 NLP

Studying quantization trade-offs for efficient inference deployment in machine translation

تُقيّم هذه الورقة البحثية مقايضات التكميم (quantization) لنماذج الترجمة الآلية على وحدات معالجة رسومية (GPUs) منفردة، كاشفةً أن الجمع بين استراتيجيات تقسيم المستند إلى أجزاء (document-chunking) وتنسيقات تكميم محددة يُحسّن كفاءة زمن الاستجابة والإنتاجية، مع تسليط الض الضوء على فشل المعايير القياسية في رصد تدهور الجودة في سيناريوهات السياق الطويل، لا سيما بالنسبة لعائلة نماذج EuroLLM الحساسة.

Jim Zhao, Sohir Maskey, Koen Oostermeijer, Douglas Orr, Teryn Jones2026-08-03
💬 NLP

Bridging the Question-Answer Gap in Retrieval-Augmented Generation: Hypothetical Prompt Embeddings

تقدم الورقة البحثية "تضمينات المطالبات الافتراضية" (HyPE)، وهو إطار عمل يقوم بحساب المطالبات الافتراضية مسبقاً أثناء عملية الفهرسة لسد فجوة الأسلوب بين الاستعلامات والمستندات في أنظمة التوليد المعزز بالاسترجاع، مما يؤدي إلى تحسين دقة واستدعاء الاسترجاع بشكل كبير دون إضافة أي تأخير في وقت التشغيل.

Domen Vake, Jernej Vičič, Aleksandar Tošić2026-08-03
💬 NLP

Know It, Act on It: Investigating Memory Utilization in LLM Personalization

تقدم هذه الورقة نموذج تقييم منفصل للكشف عن فجوة كبيرة بين قدرة وكلاء النماذج اللغوية الكبيرة على استرجاع تفضيلات المستخدم وقدرتهم على التصرف بناءً عليها، حيث وجدت أنه بينما تساعد بنيات الذاكرة، إلا أن الاستخدام يظل ضعيفاً بشكل حرج في المجالات عالية المخاطر مثل الصحة والعلاج النفسي.

Zhaoxin Feng, Jianfei Ma, Emmanuele Chersoni2026-08-03
💬 NLP

Evidence-Type Competition: When Can Interventional Data Teach Language Models Causal Direction?

تُظهر هذه الورقة أنه في البيئات الاصطناعية حيث تتعارض الأدلة الرصدية والتدخلية، فإن قدرة النموذج اللغوي على استنتاج الاتجاه السببي لا تتحدد بمزيج بيانات التدريب، بل يتم تبديلها ديناميكيًا بالتشغيل أو الإيقاف بناءً على نوع الأدلة الموجودة في سياق الاستدلال، حيث تعمل الإشارات الرصدية بنشاط على كبح قدرات الاستدلال السببي الكامنة لدى النموذج.

Xining Xun2026-08-03
💬 NLP

ARB: A Matched Authorship-Rewriting Benchmark Dataset for AI-Text Detector Evaluation

تقدم هذه الورقة البحثية معيار "التقييم لإعادة كتابة التأليف" (ARB) لتوضيح أن كواشف النصوص المعتمدة على الذكاء الاصطناعي القياسية، رغم فعاليتها في تحديد النصوص المولدة مباشرة بواسطة النماذج اللغوية الكبيرة، تعاني من انخفاض حاد في الأداء (بواقع 60 إلى 78 نقطة مئوية) عند اكتشاف النصوص التي كتبها بشر ثم أعيدت كتابتها بواسطة نموذج لغوي كبير، مما يكشف عن فجوة حرجة في منهجيات التقييم الحالية.

Gaetano Perrone, Simon Pietro Romano2026-08-03
💬 NLP

FriendBench: Benchmarking Dyadic Familiarity Inference in Humans and Multimodal Large Language Models

تقدم الورقة البحثية "FriendBench"، وهو معيار لقياس مدى القدرة على استنتاج الألفة الثنائية من مقاطع فيديو لكسر الجليد مدتها 20 ثانية، والتي كشفت أنه في حين تضاهي النماذج متعددة الوسائط الرائدة دقة البشر، إلا أنها تعتمد على إشارات مختلفة وتظهر انحيازاً لتصنيف الأزواج كغرباء، بينما يستفيد البشر بشكل فريد من الإشارات السلوكية المرئية التي تتجاوز الكلام.

Jeffrey M. Girard, Jason Z. Zheng, Jacqueline R. Vertino, Antony D'Avirro, Benjamin Peloquin2026-08-03