💬 NLP

Reconstructing Sepsis Trajectories from Clinical Case Reports using LLMs: the Textual Time Series Corpus for Sepsis

تقدم هذه الورقة البحثية مسار عمل يستخدم النماذج اللغوية الكبيرة لاستخراج وتحديد زمن النتائج السريرية من تقارير الحالات الطبية، مما أدى إلى إنشاء مجموعة بيانات نصية زمنية مفتوحة الوصول لمرض الإنتان (Sepsis-3) تُظهر دقة عالية في استعادة الأحداث والترتيب الزمني مقارنة بتدوينات الأطباء.

Shahriar Noroozizadeh, Jeremy C. Weiss2026-05-13
💬 NLP

Learning Adapter Rank via Symmetry Breaking

تقدم هذه الورقة البحثية "التعطيل المتغير منخفض الرتبة" (LRVD)، وهو إطار عمل بايزي يكسر التماثل الدوراني لتقنية LoRA عبر الاستدلال المتغير لتحديد الرتب الفعالة للمهايئ واليقين التنبؤي تلقائياً مع حد أدنى من العبء الإضافي للمعلمات.

Cooper Doyle, Andy Hu, Rebecca Chan, Anna Leontjeva2026-05-13
💬 NLP

A Formal Comparison Between Chain of Thought and Latent Thought

تقدم هذه الورقة تحليلاً رسمياً يوضح أنه في حين أن التفكير الكامن (latent thought) يتيح حوسبة متوازية أكثر كفاءة من "سلسلة الأفكار" (Chain of Thought) المتسلسلة بطبيعتها، فإن الأخيرة تدعم بشكل فريد العد التقريبي وأخذ العينات من خلال فك الترميز العشوائي، مما يوفر إرشادات عملية لاختيار نموذج الاستدلال المناسب بناءً على متطلبات المهمة.

Kevin Xu, Issei Sato2026-05-13
💬 NLP

Coevolutionary Continuous Discrete Diffusion: Make Your Diffusion Language Model a Latent Reasoner

تقترح هذه الورقة البحثية نموذج الانتشار المستمر والمنفصل المتطور (CCDD)، وهو إطار عمل مبتكر يوحد عمليات الانتشار المستمرة والمنفصلة ضمن نموذج واحد للتغلب على تحديات التدريب وفك التشفير التي تواجه الانتشار المستمر، مع الاستفضاء من قدرته النظرية الفائقة في التعبير لتعزيز أداء نمذجة اللغة.

Cai Zhou, Chenxiao Yang, Yi Hu, Chenyu Wang, Chubin Zhang, Muhan Zhang, Lester Mackey, Tommi Jaakkola, Stephen Bates, Di (…)2026-05-13
💬 NLP

Detecting Data Contamination in LLMs via In-Context Learning

تقدم الورقة البحثية CoDeC، وهي طريقة عملية وآلية تكتشف وتحدد كمية تلوث بيانات التدريب في النماذج اللغوية الكبيرة من خلال تحليل كيفية تأثير التعلم في السياق على ثقة النموذج، مع التمييز بين بيانات التدريب المحفوظة والتوزيعات غير المرئية.

Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta2026-05-13
💬 NLP

Towards Fine-Grained Code-Switch Speech Translation with Semantic Space Alignment

تقترح هذه الورقة إطار عمل لترجمة الكلام المدمج باللغات (code-switch) بدقة عالية، يعزز النماذج اللغوية الكبيرة بجهاز عرض من نوع "خليط الخبراء" (Mixture-of-Experts) متخصص لغوياً ونموذج تدريب متعدد المراحل لتحقيق تحسينات كبيرة في الأداء مقارنة بالنماذج الحالية مثل SeamlessM4T.

Yan Gao, Yazheng Yang, Zhibin Lan, Yidong Chen, Min Zhang, Daimeng Wei, Derek F. Wong, Jinsong Su2026-05-13
📊 statistics

MajinBook: An open catalogue of digitally mediated world literature

تقدم هذه الورقة "ماجين بوك" (MajinBook)، وهو فهرس مفتوح يربط البيانات الوصفية من المكتبات الظلية ببيانات "غود ريدز" (Goodreads) لإنشاء متن لغوي عالي الدقة وقابل للقراءة آلياً يضم أكثر من 539,000 كتاب باللغة الإنجليزية تم تداولها رقمياً، مع معالجة التحيزات التقليدية للمتون ومناقشة مشروعية المشروع القانونية للبحث بموجب الأطر التنظيمية في الاتحاد الأوروبي والولايات المتحدة.

Antoine Mazières, Thierry Poibeau2026-05-13
💬 NLP

When the Gold Standard Isn't Necessarily Standard: Challenges of Evaluating the Translation of User-Generated Content

تجادل هذه الورقة بأن تقييم ترجمة المحتوى الذي ينشئه المستخدمون يتطلب أطر عمل مدركة للإرشادات، لأن غياب "معيار ذهبي" واحد للغة غير المعيارية يؤدي إلى تباين في الترجمات المرجعية ويؤثر بشكل كبير على أداء النماذج اللغوية الكبيرة.

Lydia Nishimwe, Benoît Sagot, Rachel Bawden2026-05-13
💬 NLP

RW-Post: Auditable Evidence-Grounded Multimodal Fact-Checking in the Wild

تقدم هذه الورقة RW-Post، وهو معيار مرجعي جديد قابل للتدقيق للتحقق من الحقائق متعدد الوسائط في العالم الحقيقي يربط منشورات وسائل التواصل الاجتماعي بالأدلة والمسارات الاستدلالية التي تحقق منها البشر، إلى جانب خط الأساس AgentFact، للكشف عن فجوات كبيرة في قدرة النماذج الحالية على ربط الادعاءات البصرية بالأدلة بأمانة.

Danni Xu, Shaojing Fan, Harry Cheng, Mohan Kankanhalli2026-05-13
💬 NLP

Evaluating the Pre-Consultation Ability of LLMs using Diagnostic Guidelines

تقدم هذه الورقة EPAG، وهو إطار عمل ومجموعة بيانات مرجعية لتقييم قدرات نماذج اللغات الكبيرة في مرحلة ما قبل الاستشارة مقابل الإرشادات التشخيصية، مما يكشف أن النماذج الصغيرة مفتوحة المصدر والمعدلة بدقة يمكن أن تتفوق على النماذج الرائدة، وأن زيادة التاريخ المرضي لا تؤدي دائمًا إلى تحسين الدقة التشخيصية.

Jean Seo, Gibaeg Kim, Kihun Shin, Seungseop Lim, Hyunkyung Lee, Wooseok Han, Jongwon Lee, Eunho Yang2026-05-13