💬 NLP

ML2B: Benchmarking LLMs on Cross-Lingual ML Pipeline Generation

تقدم هذه الورقة ML2B، وهو أول معيار لتقييم توليد مسارات تعلم الآلة عبر اللغات بواسطة النماذج اللغوية الكبيرة، والذي يستخدم 490 زوجًا من المهام واللغات عبر 14 لغة ليكشف أن تدهور الأداء يعتمد بشكل كبير على المهمة بدلاً من اتباع التسلسلات الهرمية التقليدية للموارد.

Ekaterina Trofimova, Zosia Shamina, Maria Selifanova, Artem Zaitsev, Remi Savchuk, Maxim Minets, Daria Ozerova, Emil Sat (…)2026-07-30
💬 NLP

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

تقدم هذه الورقة البحثية VideoNorms، وهي مجموعة بيانات تضم أكثر من 3,0٠٠ تعليق توضيحي للمعايير الثقافية مستمدة من برامج تلفزيونية أمريكية وصينية تم إنشاؤها من خلال التعاون بين البشر والذكاء الاصطناعي، والتي تكشف أن نماذج الفيديو اللغوية الكبيرة (VideoLLMs) الحالية تعاني بشكل أكبر مع السياقات الثقافية الصينية والأدلة غير اللفظية، مما يسلط الضوء على الحاجة إلى تدريب وتقييم قائمين على أسس ثقافية.

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan2026-07-30
💬 NLP

ARC-Encoder: learning compressed text representations for large language models

تقدم الورقة البحثية ARC-Encoder، وهو مشفر قابل للتكيف يقوم بضغط النصوص إلى تمثيلات مستمرة لاستبدال تضمينات الرموز (token embeddings) في النماذج اللغوية الكبيرة من نوع فك التشفير (decoder LLMs)، محققاً أداءً هو الأفضل في فئته عبر سيناريوهات متنوعة مع تحسين كفاءة الاستدلال بشكل كبير والتعميم عبر نماذج فك تشفير متعددة دون الحاجة إلى تعديلات في البنية.

Hippolyte Pilchen, Edouard Grave, Patrick Pérez2026-07-30
💬 NLP

Large Emotional World Model

تقدم هذه الورقة نموذج العالم العاطفي الكبير (LEWM)، وهو إطار عمل مبتكر يدمج العاطفة البشرية كمتغير حالة أساسي للتنبؤ بالحالات العاطفية والجسدية المستقبلية، مما يظهر تحسينات كبيرة في الأداء في مهام التنبؤ بحالة العالم، وفهم العواطف، ومهام الاستدلال العام.

Changhao Song, Yazhou Zhang, Hui Gao, Chang Yang, Peng Zhang2026-07-30
💬 NLP

DP-MGTD: Privacy-Preserving Machine-Generated Text Detection via Adaptive Differentially Private Entity Sanitization

تقترح الورقة البحثية إطار عمل DP-MGTD، وهو إطار عمل للحفاظ على الخصوصية يستخدم تعقيم الكيانات بخصوصية تفاضلية تكيفية ليس فقط لحماية بيانات المستخدم، بل لتعزيز دقة كشف النصوص المولدة آلياً بشكل غير متوقع من خلال استغلال أنماط حساسية متميزة للضجيج.

Lionel Z. Wang, Yusheng Zhao, Jiabin Luo, Xinfeng Li, Lixu Wang, Yinan Peng, Haoyang Li, XiaoFeng Wang, Wei Dong2026-07-30
💬 NLP

AMEND++\texttt{AMEND++}: Benchmarking Eligibility Criteria Amendments in Clinical Trials

تقدم هذه الورقة AMEND++\texttt{AMEND++}، وهي مجموعة اختبار ومهمة جديدة في معالجة اللغات الطبيعية للتنبؤ بتعديلات معايير الأهلية في التجارب السريرية، إلى جانب استراتيجية تدريب مسبق مدركة للمراجعات تسمى CAMLM تستفيد من التعديلات التاريخية لتحسين دقة التنبؤ ودعم تصميم تجارب أكثر كفاءة.

Trisha Das, Mandis Beigi, Jacob Aptekar, Jimeng Sun2026-07-30
💬 NLP

REFACT: Adaptive Fact Restatement for Compact and Faithful Chain-of-Thought Reasoning

تقدم الورقة البحثية REFACT، وهو إطار عمل تكيفي لإعادة صياغة الحقائق، يعمل على تحسين النماذج اللغوية الكبيرة من خلال مسار تدريب "معلم-طالب" لتوليد تسلسل استدلالي (chain-of-thought) موجز، وأمين، ومرتكز جيداً، وذلك عبر إعادة صياغة الحقائق المصدرية بشكل انتقائي عند الضرورة فقط.

Zhensheng Jin, Xin Dai, Zhenghao Liu, Chaojun Xiao, Huiyuan Xie, Yu Gu, Ge Yu, Maosong Sun2026-07-30
💬 NLP

Large-Scale ChatBot Validation Through Customer Digital Twin Simulations

تقدم هذه الورقة إطار عمل قابلاً للتوسع للتحقق من صحة روبوتات الدردشة لخدمة العملاء القائمة على النماذج اللغوية الكبيرة في المجالات المنظمة مثل الخدمات المصرفية، وذلك باستخدام وكلاء عملاء اصطناعيين عاليي الدقة (توائم رقمية) لمحاكاة تفاعلات متنوعة وضمان السلامة والمتانة والامتثال التنظيمي من خلال الاختبار الآلي والعدائي.

Cristovao Iglesias, Devesh Batra, Alankar Atreya, Stefan Wagner, Robert Hankache, Patrick Sinclair, Giulio Pelosio, Mich (…)2026-07-30
🤖 AI

Position: Evaluation Scores Are Perishable Knowledge Claims

تجادل هذه الورقة بأن درجات التقييم هي ادعاءات معرفية قابلة للتلف وعرضة لـ "تضخم الثقة" عند تجميعها عبر المتوسط، وتقترح بدلاً من ذلك نهج "الحلقة الأضعف" التحفظي الذي يتتبع صراحةً رسمية الدرجة ونطاقها ونافذة صلاحيتها لمنع التصنيفات المضللة.

Sankalp Gilda, Shlok Gilda2026-07-30
💬 NLP

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

تقيم هذه الورقة المقايضات الشاملة في الإشراف على المحتوى من خلال مقارنة استراتيجيات وضع الفلاتر (المدخلات، أو الاستجابة، أو الجمع بينهما) وتقنيات إعادة كتابة الاستجابة، حيث تُثبت أن الحظر المقتصر على الاستجابة فقط يعظم الفائدة بينما يقلل الحظر المشترك من التعرض للمحتوى الضار، وأن إعادة الكتابة يمكن أن تستعيد حركة المرور المحظورة دون زيادة الضرر.

Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges2026-07-30