💬 NLP

GPTKB 2.0: Browsing, Querying, and Auditing a Disambiguated LLM-Derived Knowledge Base

تقدم هذه الورقة البحثية GPTKB 2.0، وهو عرض توضيحي قائم على الويب لقاعدة معرفية واسعة النطاق ومُزالة اللبس، مستمدة من نموذج لغوي كبير، تتيح للمستخدمين تصفح واستعلام وتدقيق 38.4 مليون ثلاثية عبر 1.6 مليون كيان معياري مع شفافية كاملة في عملية إزالة اللبس الموجهة بالسياق ومصدر الحقائق.

Yujia Hu, Tuan-Phong Nguyen, Simon Razniewski2026-08-10
💬 NLP

An Agentic Hybrid Top-Down and Bottom-Up Approach to Knowledge Graph Generation

تقترح هذه الورقة مساراً هجيناً وكيلياً يجمع بين التأسيس من الأعلى إلى الأسفل في ويكيداتا (Wikidata) مع التأمل من الأسفل إلى الأعلى لتوليد رسم بياني معرفي للمهارات متعدد اللغات، قابل للتوسع وذاتي الإصلاح، من بيانات الموارد البشرية غير المهيكلة والمشوشة بشكل مستقل.

Emma Jouffroy, Warren Jouanneau, Marc Palyart2026-08-10
💬 NLP

DocMemo: Dynamic Evidence Discovery via Probabilistic Memory-Guided Retrieval for Multi-Modal Document Understanding

يُعد DocMemo إطار عمل موجّه بالذاكرة يعمل على تعزيز فهم المستندات الطويلة من خلال الاستكشاف الديناميكي للأدلة عبر نظام ذاكرة ثلاثي المستويات وتحديث معتقدات بايزي، مما يتغلب على قيود الاسترجاع الساكن وضعف انتشار الحالة عبر الجولات في أساليب تحليل المستندات متعددة الوسائط الحالية.

Hanshu Yao, Janfeng Zhong, Niu Lian, Jinpeng Wang2026-08-10
💬 NLP

Skaling: Chinchilla's Exponents Meet Kaplan's Coupling

تقدم هذه الورقة قانون "سكالينج" (Skaling law)، وهو إطار عمل قياسي معمّم يربط بين سعة النموذج والبيانات من خلال أس تفاعلي واحد لتحسين دقة التنبؤ بالخسارة بشكل كبير وتمكين تخصيص ميزانية الحوسبة بكفاءة في استهلاك الموارد لتدريب النماذج اللغوية واسعة النطاق.

Mathurin Videau, Badr Youbi-Idrissi, David Lopez-Paz, Kartik Ahuja2026-08-10
💬 NLP

Stoicheia: Character-Level Masked Diffusion for Ancient Greek Textual Restoration, Parsing, and Metrical Scansion

إن Stoicheia هو نموذج انتشار مقنع على مستوى الحروف بـ 405 مليون معلمة، تم تدريبه على متن لغة يونانية قديمة منزوهة، يوحد بين ترميم النصوص، والإعراب، والتقطيع العروضي في إطار عمل واحد، محققاً أداءً هو الأفضل حالياً عبر مهام متعددة من خلال التفوق بشكل كبير على الأنظمة السابقة مثل Ithaca وAeneas.

Eric Cullhed, Albin Thörn Cleland2026-08-10
🧬 biology

Artificial Intelligence Can Match Domain Experts in Evidence Extraction and Critical Appraisal of Microbial Oncogenesis Research Publications

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة المتقدمة، ولا سيما GPT-5 وGPT-5 Nano، يمكنها مضاهاة الخبراء المتخصصين في استخراج وتقييم الأدلة لأبحاث التسرطن الميكروبي، مما يدعم استخدامها في التوليف المنهجي القابل للتوسع للأدلة رغم التحديات المستمرة في التقييم المنهجي وتحديد التناقضات.

Kaela Kokkas, Hairong Wang, Richard Klein, Nazir A. Ismail, Natalie Irwin, Mohammad Z. Moonsamy, Kubendran Naidoo, Jerem (…)2026-08-10
💬 NLP

Grammar Engineering Meets LLMs: Development of Cantonese and Irish ParGram Treebanks

تُفصّل هذه الورقة تطوير بنوك شجرية للغتين الكانتونية والأيرلندية ضمن مشروع القواعد المتوازية مع تقييم مدى فائدة النماذج اللغوية الكبيرة متعددة اللغات في هندسة القواعد، حيث وجدت أنه بينما تقدم هذه النماذج قيمة محدودة في اقتراح تحليلات بديلة، فإنها تفتقر حاليًا إلى قدرات التجريد عبر اللغات الضرورية لاستبدال التحقق اللغوي الذي يقوده الخبراء.

Chit-Fung Lam, Elaine Uí Dhonnchadha2026-08-10
💬 NLP

Natural Language Processing Psychometrics

تقدم هذه الورقة "القياس النفسي عبر معالجة اللغات الطبيعية" (NLP Psychometrics)، وهو إطار عمل يستفيد من الذكاء الاصطناعي القابل للتفسير والميزات القائمة على الشبكات المستمدة من الشخصيات الاصطناعية التي تولدها النماذج اللغوية الكبيرة للتنبؤ بنتائج الصحة النفسية بدقة عالية مع تحديد الدوافع اللغوية والنفسية المحددة وراء هذه التنبؤات بشكل صريح.

Edoardo Sebastiano De Duro, Emma Franchino, Massimo Stella2026-08-10
💬 NLP

ResidencyRL: Reinforcement Learning in Simulated Clinical Environments

يقدم ResidencyRL إطار عمل للتعلم التعزيزي يدرب وكلاء الذكاء الاصطناٍ السريري من خلال مواجهات مرضية محاكية متعددة الأدوار مع نماذج لغوية كبيرة خصمية ومكافآت مهيكلة، مما يحسن بشكل كبير دقة التشخيص والسلامة ومهارات التواصل مع إظهار قدرة قوية على التعميم عبر مختلف المعايير السريرية.

Valentin Liévin, Samuel Schmidgall, Tim Strother, Alex Bijamov, Akshay Goel, Anil Palepu, Chunjong Park, Vahid Balazadeh (…)2026-08-10
⚡ electrical engineering

Integrating Human Linguistic Insights into AI: Theory-Driven Representation for Multilingual Text-to-Speech

تُثبت هذه الورقة أن دمج المعجم غير المحدد سماتياً (FUL)، وهو تمثيل فونولوجي قائم على النظرية، في بنية FastSpeech معدلة يتيح توليد كلام متعدد اللغات للنصوص عبر تحويل النص إلى كلام يتسم بالقابلية للتوسع، والتفسير، والجودة العالية للحديث الأصلي، وغير الأصلي، والمختلط لغوياً، حتى مع محدودية بيانات التدريب.

Cong Zhang, Huinan Zeng, Huang Liu, Jiewen Zheng2026-08-07