💻 computer science

Semantic Space of Parts of Speech

تتحدى هذه الورقة الرؤية التقليدية لأجزاء الكلام باعتبارها فئات حاسمة من خلال استخدام تضمينات word2vec والشبكات العصبية لتعيين الكلمات في فضاء دلالي ثلاثي الأبعاد، مما يكشف عن الضبابية المتأصلة وعلاقات الحدود بين أجزاء الكلام عبر خمس لغات.

Jiří Milička, Ivan Kraus, Arnold Stanovský, Anna Vysloužilová, Barbora Štěpánková, Lenka Fárová, Vojtěch Cink, Šárka Doh (…)2026-08-18
🤖 machine learning

Language models suffer from a curse of ambiguity

تحدد هذه الورقة البحثية وتحلل نظرياً "لعنة الغموض" في النماذج اللغوية الكبيرة، مبرهنةً على أن توزيعات التوكن التالي الغامضة هي بطبيعتها أصعب في التعلم بدقة بسبب زيادة المتطلبات من حيث السعة، وأحجام التضمين، وخطوات التدريب، وتضخم ضجيج أخذ العينات، وهو استنتاج تم التحقق من صحته من خلال تجارب اصطناعية وواقعية.

Nicolas Zucchet, Hyun Dong Lee, Scott Linderman2026-08-18
🤖 machine learning

Do Language Models Consistently Encode the Current Year?

تكشف هذه الورقة أن النماذج اللغوية ترمز السنة الحالية بشكل غير متسق، حيث تحافظ على مفهوم "ترابطي" قائم على مرحلة ما قبل التدريب من خلال آليات الاستدعاء الحقائقي التي تقاوم التعديل، بينما يتم تحديث المفهوم "التصريحي" الناتج عن مرحلة ما بعد التدريب بسهولة عبر التلقين، مما يخلق تباعداً جوهرياً يمنع التصحيح المتزامن لكلا المفهومين الزمنيّين.

Suze van Adrichem, Aditi Bhaskar, Diyi Yang, Christopher Potts, Jing Huang2026-08-18
💻 computer science

BengaliMCQ: Automatic Generation and Answer Prediction of Academic Multiple-Choice Questions in a Low-Resource Language

تقدم الورقة البحثية إطار عمل للتعزيز التوليدي المستند إلى الاسترجاع والمدرك للبنية، والذي يعمل على نمذجة الكتب المدرسية البنغالية كرسوم بيانية هرمية لتحسين توليد الأسئلة متعددة الخيارات والتنبؤ بالإجابات بشكل كبير في هذه اللغة ذات الموارد المنخفضة.

Abu Tarabin Surzo, A. K. M. Nihalul Kabir, Sm Azmain Faysal, Ariana Haque Ami, Lawrence Amlan Gomes, Farig Sadeque2026-08-18
💻 computer science

Wiktionary as a Crowdsourced Lexicon for English Dialects

تقيم هذه الورقة "ويكشنري" (Wiktionary) كمعجم يعتمد على التعهيد الجماعي الأخلاقي للهجات الإنجليزية، حيث تثبت من خلال التحليل الوصفي وبيانات وسائل التواصل الاجتماعي أنه يطابق أو يتجاوز تغطية القواميس التقليدية مثل قاموس أكسفورد الإنجليزي (OED) للمتنوعات الإقليمية، مع تسليط الضوء في الوقت ذاته على التحديات الكلية في الموارد اللغوية المستجيبة للهجات.

Sidney Wong2026-08-18
🤖 machine learning

Integrating Persuasion Theory into the Epidemiological Modelling of Health Misinformation Spread on Social Media

تقترح هذه الدراسة إطار عمل ELM-SIRMMM، وهو نموذج وبائي وسلوكي هجين يدمج الإشارات النفسية لنموذج احتمالية التوسع في هيكل مكون من ست حجرات لمحاكاة وتوقع الانتشار الديناميكي للمعلومات المضللة الصحية على وسائل التواصل الاجتماعي عبر مجموعات بيانات متنوعة بدقة أكبر.

Mkululi Sikosana, Sean Maudsley-Barton, Oluwaseun Ajao2026-08-18
🤖 machine learning

BERTopic-Virality Prioritisation: A Scalable Framework for Thematic and Comparative Analysis of COVID-19 and Monkeypox Misinformation on Twitter

تقدم هذه الورقة BERTopic-VP، وهو إطار عمل قابل للتوسع يدمج تجميع التضمين السياقي مع طبقة تحديد الأولويات القائمة على الانتشار وكاشف هجين للمعلومات المضللة لتمكين التحديد المبكر والتحليل المقارن لسرديات المعلومات المضللة الصحية عالية التأثير عبر الأوبئة المختلفة.

Mkululi Sikosana, Sean Maudsley-Barton, Oluwaseun Ajao2026-08-18
🤖 AI

Propaganda Forensics: Recovering the Generation Pipeline of an AI-Driven Influence Campaign

تقدم هذه الورقة PROPAGIA، وهي مدونة جنائية للدعاية الفرنسية المولدة بواسطة الذكاء الاصطناًعي من حملة Storm-1516 لعام 2025، والتي تكشف عن علامات لغوية مميزة للتلاعب، وتفضح تعليمات الأوامر (prompts) المسربة، وتنسب المحتوى إلى مسار عمل يتضمن نماذج من عائلتي Llama 3 وMistral.

Benjamin Icard, Elouan Vuichard, Louis Lefebvre, Lila Sainero, Thomas Girault, Alice Breton, Tanguy Launay, Gauvain Bour (…)2026-08-18
💻 computer science

TaoLive Digital Avatar Agent Technical Report: Training Agents to Evolve with Their Harness

تقدم هذه الورقة البحثية تدريب الوعي بالحزام (HAT)، وهو إطار عمل ثلاثي المراحل يُمكّن وكلاء الصور الرمزية الرقمية المدمجة من التكيف ديناميكيًا مع أحزمة التجارة الإلكترونية المتطورة دون إعادة تدريب، محققًا أداءً فائقًا في الوقت الفعلي ومتانة مقارنة بكل من النماذج الأساسية والنماذج اللغوية الكبيرة العامة.

TaoLive AIGC LLM Team, Yuhan Sun, Wenhao Lin, Yongdong Luo, Yibo Hu, Meiguang Jin, Junfeng Ma, Weihang Pan, Jiaxin Zhao (…)2026-08-18
🤖 AI

KV-Rescue: Recovering Reasoning Language Model KV Eviction Loss via Stepwise Interleaving

يُعد KV-Rescue إطار استدلال خالٍ من التدريب يعمل على التخفيف من فقدان الدقة والتدهور الجامح في نماذج اللغة الاستدلالية تحت ميزانيات طرد ذاكرة التخزين المؤقت (KV-cache) القوية، وذلك عبر تداخل خطوات من نموذج مساعد خفيف الوزن كامل السياق مع النموذج الأساسي واستخدام كاشف آني لإنهاء عمليات التوليد غير المترابطة.

Minsoo Cheong, Woosang Lim, Vincent-Daniel Yun, Sungjoo Yoo2026-08-18