💬 NLP

MultiGlobeQA: A Multilingual and Globally Diverse Benchmark for Geospatial Reasoning

تقدم الورقة البحثية MultiGlobeQA، وهو معيار متعدد اللغات واسع النطاق يوضح أنه على الرغم من الوصول إلى المعرفة الجغرافية، فإن النماذج اللغوية الكبيرة الحالية تعاني في الحسابات الهندسية والطوبولوجية المطلوبة للاستدلال الجيومكاني، لا سيما في المناطق منخفضة الدخل والمهام التي تتضمن الفهرسة الشبكية أو حساب الأشكال.

Martin Böckling, Elizaveta Nosova, Heiko Paulheim, Andreea Iana2026-08-05
💬 NLP

ANNOTARES: A Dataset for Extracting Logical Structures from German Statutory Texts

تقدم هذه الورقة البحثية ANNOTARES، وهي مجموعة بيانات نصوص قانونية ألمانية جديدة ذات تعليقات توضيحية على مستوى النطاق لتحديد الشروط والنتائج القانونية، وتُظهر أن النماذج القائمة على المحولات (Transformer-based models) تتفوق على النهج الأخرى في استخراج هذه البنى المنطقية.

Ronja Schwarz, Jannik Strötgen2026-08-05
💬 NLP

Logic Before Language: Pre-pretraining on Formal Derivations Fosters Skill Acquisition and Compressibility

تقدم هذه الورقة البحثية Logic-PPT، وهي استراتيجية ما قبل تدريب (pre-pretraining) تستخدم الاشتقاقات الصورية التي تسرع اكتساب مهارات اللغة الطبيعية وتستحث فضاء تمثيل منخفض الرتبة ومركز طيفياً، مما يتيح قدرة فائقة للنموذج على الانضغاط مقارنة بالتهيئة القياسية.

Jo-Ku Cheng, Nikolaos Aletras, Marco Valentino2026-08-05
💬 NLP

HalluTruthQA-4K: A Fine-Grained Corpus and Annotation Process for Arabic Hallucination Detection and Truth Verification

تقدم هذه الورقة HalluTruthQA-4K، وهي مجموعة بيانات عربية دقيقة تتكون من 4,000 حالة سؤال وجواب تم إعدادها من قبل خبراء عبر أربعة مجالات معرفية، وتتميز بتعليقات توضيحية تفصيلية للأخطاء على مستوى الحروف، وأنواع هلوسة هرمية، وتفسيرات مكتوبة بشرياً، وذلك بهدف تطوير كشف الهلوسة والتحقق من الحقائق في نماذج اللغة العربية.

Salah Eddine Bekhouche, Abdessalam Bouchekif, Hichem Telli, Mohammed-En-Nadhir Zighem, Abdenour Hadid2026-08-05
💬 NLP

string2string Studio: An Interactive, In-Browser Platform for String-to-String Algorithms

تقدم الورقة البحثية منصة string2string Studio، وهي منصة مفتوحة المصدر تعمل داخل المتصفح وتستفيد من خوارزميات لغة ++C المجمعة بتقنية WebAssembly لتوفير تحليل سريع ومحلي وقابل للفحص من سلسلة نصية إلى سلسلة نصية عبر مجالات متعددة دون الحاجة إلى رفع البيانات أو تثبيت البرامج.

Mirac Suzgun, James Zou, Stuart M. Shieber, Dan Jurafsky2026-08-05
💬 NLP

WorldCup Arena: Prospective, Leakage-Free Evaluation of Frontier LLMs on a Live Tournament

تقدم هذه الورقة تقييماً خالياً من التسريب لستة نماذج لغوية كبيرة رائدة خلال كأس العالم لكرة القدم 2026، كاشفةً أنه بينما تحقق هذه النماذج دقة بمستوى مكاتب المراهنات في نتائج المباريات، إلا أنها تظهر قيوداً مشتركة مثل الاعتماد المفرط على المرشحين للفوز، وضعف التمايز فيما بينها، والميل إلى التقليل من توقع التعادلات ونتائج محددة للمباريات.

Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi2026-08-05
💬 NLP

SocietyBench: Forecasting Counterfactual Social-World Evolution

تقدم هذه الورقة SocietyBench، وهو معيار مرجعي جديد يقيم قدرة النماذج اللغوية الكبيرة على التنبؤ بتطور العالم الاجتماعي الافتراضي عبر إخفاء هوية الجداول الزمنية للأحداث الواقعية وتحويلها إلى مهام تنبؤ مهيكلة، مما يكشف أن حتى النماذج الرائدة تعاني من صعوبات في كل من المعايرة الاحتمالية والدقة الزمنية عبر أحداث متنوعة.

Zhenran Wang, Zhonghan Bian, Jinsong Li, Zhangyang Qi2026-08-05
💬 NLP

OpenDebateEvidence: A Massive-Scale Argument Mining and Summarization Dataset

تقدم الورقة البحثية OpenDebateEvidence، وهي مجموعة بيانات ضخمة تضم أكثر من 3.5 مليون وثيقة من مجتمع المناظرة التنافسية الأمريكية، والمصممة لتطوير الحجاج الحوسبي والتلخيص التجريدي الحجاجي من خلال تجارب مكثفة مع النماذج اللغوية الكبيرة.

Allen Roush, Yusuf Shabazz, Arvind Balaji, Peter Zhang, Stefano Mezza, Markus Zhang, Sanjay Basu, Sriram Vishwanath, Meh (…)2026-08-04
💬 NLP

Curriculum-Guided Layer Scaling for Language Model Pretraining

تقترح هذه الورقة البحثية "تدرج الطبقات الموجه بالمنهج الدراسي" (CGLS)، وهو إطار عمل للتدريب المسبق كفء من حيث الحوسبة يعمل على مزامنة التراكم التدريجي للطبقات مع زيادة صعوبة البيانات لتعزيز تعميم النموذج وأداء المهام الصفرية في المهام القائمة على المعرفة والاستدلال.

Karanpartap Singh, Neil Band, Ehsan Adeli2026-08-04
💬 NLP

Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models

تقدم هذه الورقة "Self-Correction Bench" للكشف عن "نقطة عمياء" كبيرة حيث تفشل النماذج اللغوية الكبيرة في تصحيح أخطائها الداخلية رغم امتلاكها القدرة على إصلاح أخطاء خارجية مماثلة، وهو قصور ناتج عن فجوات في بيانات التدريب يمكن التخفيف من حدته بشكل كبير من خلال الضبط الدقيق المستهدف أو هندسة الأوامر البسيطة مثل إضافة كلمة "انتظر.".

Ken Tsui2026-08-04