💬 NLP

Instruction-Guided Poetry Generation in Arabic and Its Dialects

تقدم هذه الورقة مجموعة بيانات ضخمة قائمة على التعليمات باللغة العربية الفصحى ولهجاتها، تُمكّن النماذج اللغوية الكبيرة من توليد الشعر ومراجعته وتحليله بشكل قابل للتحكم وفقاً لمتطلبات مستخدم محددة مثل الأسلوب والقافية.

Abdelrahman Sadallah, Kareem Elozeiri, Mervat Abassy, Rania Elbadry, Mohamed Anwar, Abed Alhakim Freihat, Preslav Nakov (…)2026-05-01
💬 NLP

How Generative AI Disrupts Search: An Empirical Study of Google Search, Gemini, and AI Overviews

تحلل هذه الدراسة التجريبية كيف يزعزع الذكاء الاصطناي التوليدي البحث التقليدي عبر الويب من خلال مقارنة بحث جوجل، ونظرات عامة مدعومة بالذكاء الاصطناعي، وجيمناي، مما يكشف عن اختلافات جوهرية في اختيار المصادر، وانخفاض الاتساق، وتراجع ظهور المواقع التي تحظر زواحف الذكاء الاصطناعي، مع الدعوة إلى أطر عمل مستدامة للإيرادات لدعم المنظومة.

Riley Grossman, Songjiang Liu, Michael K. Chen, Mike Smith, Cristian Borcea, Yi Chen2026-05-01
💬 NLP

ZipCCL: Efficient Lossless Data Compression of Communication Collectives for Accelerating LLM Training

تُعد ZipCCL مكتبة ضغط جديدة غير تلاففية تُسرع تدريب النماذج اللغوية الكبيرة (LLMs) من خلال الاستفطادة من التوزيع القريب من التوزيع الطبيعي لبيانات الاتصال عبر ترميز أسيٍّ مُثبت نظرياً، ونواة معالجة مُحسّنة لوحدات معالجة الرسومات (GPU)، واستراتيجيات تكيفية لتقليل وقت الاتصال بما يصل إلى 1.35 ضعف وتحقيق تسريع في الأداء النهائي بمقدار 1.18 ضعف دون المساس بجودة النموذج.

Wenxiang Lin, Xinglin Pan, Ruibo Fan, Shaohuai Shi, Xiaowen Chu2026-05-01
💬 NLP

Multi-Level Narrative Evaluation Outperforms Lexical Features for Mental Health

تقدم هذه الورقة إطاراً سردياً ثلاثي المستويات وتثبت أن تقييم النماذج اللغوية الكبيرة (LLM) للبنية السردية على المستوى الكلي يتفوق بشكل ملحوظ على السمات المعجمية والدلالية التقليدية في التنبؤ بحالات الصحة النفسية عبر 830 نصاً علاجياً باللغة الصينية، مما يسلط الض الضوء على القيمة التنبؤية الحاسمة لتنظيم الخطاب الشامل فوق الإحصاءات على مستوى الكلمات.

Yuxi Ma, Jieming Cui, Muyang Li, Ye Zhao, Yu Li, Yixuan Wang, Chi Zhang, Yinyin Zang, Yixin Zhu2026-05-01
💬 NLP

Reasoning over Object Descriptions Improves Coreference Resolution in Task-Based Dialogue Systems

تقترح هذه الورقة نهجاً أحادي النمط للاستنتاج في وقت الاختبار يستفيد من النماذج اللغوية الكبيرة لتحليل البيانات الوصفية التفصيلية للأجسام وسجل الحوار، مما يثبت أن هذه الطريقة تحسن بشكل كبير من حل المراجع في أنظمة الحوار القائمة على المهام من خلال تفوقها على النماذج الخاضعة للإشراف في تقييمات التعميم والعبور بين المجالات على مجموعة بيانات SIMMC 2.1.

Oier Ijurco, Oier Lopez de Lacalle2026-05-01
💬 NLP

TwinGate: Stateful Defense against Decompositional Jailbreaks in Untraceable Traffic via Asymmetric Contrastive Learning

يُعد TwinGate إطار عمل دفاعي يعتمد على الحالة ويتميز بزمن انتقال منخفض، حيث يستخدم التعلم التبايني غير المتماثل للكشف بفعالية عن عمليات كسر الحماية التفكيكية في حركة مرور النماذج اللغوية الكبيرة غير القابلة للتتبع عبر تجميع شظايا النوايا الخبيثة مع كبح الإيجابيات الكاذبة، متفوقاً بذلك على النماذج المرجعية الحالية في مجموعة بيانات ضخمة تم إنشاؤها حديثاً تضم أكثر من 3.6 مليون تعليمات.

Bowen Sun, Chaozhuo Li, Yaodong Yang, Yiwei Wang, Chaowei Xiao2026-05-01
💬 NLP

Geometry-Calibrated Conformal Abstention for Language Models

تقترح هذه الورقة "الامتناع المتوافق المعاير هندسيًا" (Geometry-Calibrated Conformal Abstention)، وهو إطار عمل لاحق للتدريب يستفيد من الهندسة التمثيلية لمعايرة ثقة التنبؤ وتمكين النماذج اللغوية من الامتناع انتقائيًا عن الإجابة على الاستعلامات مع ضمانات العينات المحدودة لكل من معدلات المشاركة وصحة الاستجابة، مما يخفف بفعالية من الهلوسة دون الحاجة إلى إعادة التدريب.

Rui Xu, Yi Chen, Sihong Xie, Hui Xiong2026-05-01
💬 NLP

Reliable Answers for Recurring Questions: Boosting Text-to-SQL Accuracy with Template Constrained Decoding

تقدم الورقة البحثية TeCoD، وهو نظام يعمل على تحسين دقة تحويل النص إلى استعلام SQL وتقليل زمن الاستجابة من خلال الاستفادة من أنماط الاستعلام المتكررة لاختيار قوالب قابلة لإعادة الاستخدام وفرضها عبر فك التشفير المقيد بالقواعد النحوية.

Smit Jivani, Sarvam Maheshwari, Sunita Sarawagi2026-05-01
💬 NLP

Models Recall What They Violate: Constraint Adherence in Multi-Turn LLM Ideation

تقدم هذه الورقة البحثية DriftBench، وهو معيار مرجعي يوضح أن النماذج اللغوية الكبيرة غالبًا ما تنتهك القيود الأصلية أثناء التفكير العلمي متعدد الجولات رغم استرجاعها لها بدقة، مما يكشف عن انفصال كبير بين "المعرفة والانتهاك" يستمر حتى مع استخدام نقاط التحقق ويصعب اكتشافه بواسطة الحكام من النماذج اللغوية الكبيرة.

Garvin Kruthof2026-05-01
💬 NLP

Measuring research data reuse in scholarly publications using generative artificial intelligence: Open Science Indicator development and preliminary results

طورت PLOS وDataSeer مؤشراً جديداً قائماً على النماذج اللغوية الكبيرة يكشف عن معدل إعادة استخدام للبيانات البحثية بنسبة 43% في المنشورات العلمية، مما يثبت أن الذكاء الاصطناعي التوليدي يمكنه قياس آثار العلم المفتوح على نطاق واسع ويشير إلى أن الآثار الإيجابية لمشاركة البيانات مستهان بها حالياً.

Lauren Cadwallader, Iain Hrynaszkiewicz, parth sarin, Tim Vines2026-05-01