💬 NLP

APEX-VW: A Document-Level English-Spanish Post-Editing Dataset in the Healthcare Domain

تقدم هذه الورقة APEX-VW، وهو متن جديد للتحرير اللاحق للمستندات من الإنجليزية إلى الإسبانية على مستوى المستند، مستمد من وثائق الأجنحة الافتراضية التابعة لهيئة الخدمات الصحية الوطنية (NHS) وسير عمل برنامج Trados Studio الاحترافي، والمصمم لتعزيز البحث في تطبيع المصطلحات وانتشار التصحيح في بيئات الترجمة المساعدة بالحاسوب الواقعية.

Marie Escribe, Tharindu Ranasinghe, Amal Haddad Haddad, Hansi Hettiarachchi, Damith Premasiri2026-08-11
💬 NLP

DialectS2S: End-to-End Speech Dialogue Modeling for Low-Resource Chinese Dialects

تقدم هذه الورقة البحثية DialectS2S، وهو نموذج حوار صوتي شامل (end-to-end) للهجات الصينية منخفضة الموارد، والذي يستفيد من مسار توليد بيانات قابل للتوسع واستراتيجية تدريب لاحق ذات مرحلتين ذاتية المحاذاة للتغلب على ندرة البيانات وعدم الاتساق الدلالي، مما يحسن بشكل كبير من اتساق اللهجة، وجودة الاستجابة، ووضوح النطق.

Yi Shu, Tianyu Peng, Yingzhuo Deng, Wen Yang, Jun Lin, Changming Xie, Xinyu Yu, Jiajun Zhang2026-08-11
💬 NLP

Commitment Before Realization: When Classifier-Free Guidance Becomes Unnecessary in Masked Diffusion Language Models

تقدم هذه الورقة مفهوم "أفق الالتزام" لتوضيح أن التوجيه الخالي من المصنف في نماذج اللغة الانتشارية المقنعة يكون ضروريًا غالبًا فقط خلال المراحل المبكرة من فك التشفير، مما يسمح بالانتقال إلى النموذج الأساسي بمجرد الالتزام بمسار معين دون المساس بشكل كبير بالامتثال للقيود.

Fan Zhou, Weitian Wang, Tim Van de Cruys2026-08-11
💬 NLP

Wisdom in Unity: The Role of Multilingual Training in Figurative Language Identification in Proverbs

تُثبت هذه الورقة أن الإشراف متعدد اللغات، لا سيما عند دمج الأشكال المجازية المتنوعة مثل الأمثال الثقافية وأمثال المواعظ والأخلاق، يعزز بشكل كبير أداء تحديد اللغة المجازية، ويقترح تحولاً نحو أطر عمل متعددة الأبعاد وقائمة على المفاهيم تتجاوز النهج المتمحور حول الاستعارة.

Rama Alomair, Remas Alsubaie, Walaa Saifalislam, Rima Alsonbul, Mona Alnajjar, Razan Aldossari, Haya Alibrahim, Abeer Al (…)2026-08-11
💬 NLP

DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

تقدم هذه الورقة نظام المناظرة المعزز بالاسترجاع الخاص بفريق DS@GT ARC لمسابقة Touché 2025، والذي يستخدم ستة من النماذج اللغوية الكبيرة الرائدة لتوليد الاستجابات والتقييم، بينما تكشف عن أنه على الرغم من إظهار المقيمين من النماذج اللغوية الكبيرة المتعددة توافقاً داخلياً قوياً، إلا أن هذا الإجماع يفشل في التنبؤ بشكل موثوق بالأداء الرسمي، لا سيما فيما يتعلق بمعيار الجودة (Quality maxim).

Anthony Miyaguchi, Conor Johnston2026-08-11
💬 NLP

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

تقدم هذه الورقة NCP-Bench، وهو معيار يتكون من 100 بيئة سردية صُممت لتقييم اتساق المدى الطويل في القصص التفاعلية، كاشفةً أن حتى النماذج اللغوية الكبيرة المتطورة تعاني بشكل كبير في الحفاظ على حفظ الالتزام المنطقي وسلامة السرد في مواجهة التدخلات غير المقيدة من المستخدم.

Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong2026-08-11
💬 NLP

STEMMA: An Adversarial Multi-Agent Framework for Evaluating Self-Identity Consistency in LLMs

تقدم هذه الورقة STEMMA، وهو إطار عمل تنافسي متعدد الوكلاء ومجموعة من المطالبات المصممة يدويًا لتقييم اتساق الهوية الذاتية في النماذج اللغوية الكبيرة، كاشفةً أن النماذج الطلابية غالبًا ما ترث أنماطًا سلوكية من النماذج المعلمة تؤدي إلى ثغرات في تمثيلاتها لذاتها.

Nuthakki Siva Gopala Krishna, Kanishka Jain2026-08-11
💬 NLP

A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

تقدم هذه الورقة إطار عمل يعتمد على التأسيس والوعي بالتبعية لتقييم الهلوسة على مستوى العلاقات في التلخيص التجريدي، ويتميز بخوارزمية استخراج محسنة ومؤشر هلوسة علاقات (RHI) معياري يفكك الأمانة إلى مكونات قابلة للتفسير من أجل تقييم أكثر استقراراً وتمييزاً للنماذج.

Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala, Naman Kabadi2026-08-11
🤖 AI

Harmful Content Is Not Enough: Continuation Framing Moderates In-Context Emergent Misalignment

تُبين هذه الورقة أنه في حين أن المحتوى الضار ضروري لحدوث عدم المحاذاة الناشئ في سياق الاستخدام، فإن الصياغة المحددة لهذا المحتوى باعتباره استمراراً لسلوك المساعد (بدلاً من مجرد دليل أو مخرجات أداة) هي عامل حاسم يعتمد على النموذج، مما يضاعف بشكل كبير من خطر توليد استجابات ضارة.

Peiyang Liu, Xi Wang, Ziqiang Cui, Di Liang, Wei Ye2026-08-11
💬 NLP

Focus particles and scalar inferences across humans and language models

تبحث هذه الورقة فيما إذا كان البشر والنماذج اللغوية الكبيرة يولدون أحكامًا كمية متسقة لجزئيات التركيز مثل "حتى" و"فقط"، وتجد أنه بينما تتوافق مخرجاتهم غالبًا، إلا أنهم على الأرجح يعتمدون على آليات أساسية مختلفة جوهريًا.

Catherine M. Brousse, Nelu D. Radpour2026-08-11