💬 NLP

Institutional Newspapers Pipeline: Deriving billions of high quality tokens from historical newspapers

تقدم هذه الورقة "مسار الصحف المؤسسية" (Institutional Newspapers Pipeline)، وهو نظام معياري وفعال حاسوبياً تم تطويره مع مكتبة بوسطن العامة لمعالجة أكثر من 1.4 مليون مسح ضوئي لصحف تاريخية إلى مجموعة بيانات مفتوحة ومنظمة تحتوي على 16.3 مليار رمز (token) عالي الجودة من خلال سير عمل متعدد الخطوات يتضمن التجزئة، والتعرف الضوئي على الحروف (OCR)، والتحليل النصي المتقدم.

Matteo Cargnelutti, Catherine Brobston, Eben English, Jake Sadow, Kacie Bailey, Greg Leppert, Amanda Watson, Jessica Cha (…)2026-08-20
💬 NLP

Structure, Association, and Decision Value: Representation-Based Difficulty Estimation for Adaptive Inference in African-Language NLI

تُظهر هذه الورقة أن إحصائيات التمثيل الداخلي تفشل في توفير إشارات موثوقة لصعوبة المستوى الخاص بالأمثلة من أجل الاستدلال التكيفي في مهام الاستنتاج اللغوي الطبيعي (NLI) للغات الأفريقية، مما يكشف أن تلوث المعايير المرجعية، وعدم اتساق توسيع النماذج، والتباعد بين مقاييس المنفعة الحسابية المختلفة، يجعل مثل هذه الإشارات غير فعالة لاتخاذ قرارات التوجيه.

Toheeb Ogunade2026-08-20
💬 NLP

Introducing the Privacy-HSD Trade-off: Hate Speech Detection, but not at the Cost of Privacy

تقدم هذه الورقة مفهوم المقايضة بين الخصوصية وكشف خطاب الكراهية، حيث توضح أن أنظمة كشف خطاب الكراهية يمكن أن تنتهك خصوصية المستخدم دون قصد من خلال ترميز هوية المؤلف، وتقترح طرقاً مثل AgnoSpeech لتحقيق التوازن بين الكشف الفعال والحفاظ على الخصوصية.

Stephen Meisenbacher, Vlad Garbuz, Chirill Donos, Maxim Dnestreanschii, Gabriel Creanga, Andreea-Elena Bodea, Thomas Lam (…)2026-08-20
💬 NLP

Grading the Graders: Verification Autonomy Levels (L0-L5) for LLM Reasoning

تقترح هذه الورقة مستويات الاستقلالية في التحقق (VAL)، وهو معيار ميتا (meta-standard) جديد يصنف مخططات التحقق من النماذج اللغوية الكبيرة بناءً على مصدر مواصفاتها وضمانات أحكامها، مما يحل الخلط المنهجي في الأدبيات الحالية عبر التمييز بين الاكتمال القابل للتوصيف شكلياً والصحة المرتكزة تجريبياً.

Yajie Yin2026-08-20
💬 NLP

Institutional Books - Enriched Text: A customizable multilingual open-source pipeline for denoising, deduplicating, and annotating OCR text at scale

تقدم هذه الورقة "النص المثرى" (Enriched Text)، وهو مسار متعدد اللغات مفتوح المصدر وقابل للتخصيص يحافظ على البيانات الوصفية ويسمح بالترشيح الذي يتحكم فيه المستخدم لمجموعة الكتب المؤسسية في مكتبة هارفارد البالغ عددها 983,004 مجلد، وذلك عبر تعليق نص التعرف الضوئي على الحروف (OCR) ببيانات الكشف عن اللغة، وعناقيد إزالة التكرار، ودرجات الجودة، بدلاً من تطبيق معالجة مسبقة عالمية صارمة.

David Lowry-Duda, Matteo Cargnelutti, Catherine Brobston, Salwa Ismail, Greg Leppert, Amanda Watson, Jonathan Zittrain2026-08-20
🤖 AI

What is Missing from AI Post-Training AI: An Empirical Analysis

تجادل هذه الورقة بأنه في حين يمكن لعملاء الذكاء الاصطناعي تنفيذ استراتيجيات تدريب محددة مسبقاً بفعالية، إلا أنهم يفتقرون إلى القدرة المتأصلة على إعادة تقييم ومراجعة استراتيجياتهم عالية المستوى بشكل تلقائي خلال عملية ما بعد التدريب، وهو قصور يستمر رغم التحسينات في الخبرة، والتوجيه البشري، وحوسبة الاستدلال الإضافية.

Joy Jia Yin Lim, Xin Huang, Hao Peng, Yaxi Lu, Xin Cong, Zhong Zhang, Maosong Sun, Yankai Lin2026-08-20
💬 NLP

When Readability and Source Retention Diverge: An Evaluability Gap in AI Translation

تكشف هذه الدراسة أنه في حين أن الترجمات الآلية القابلة للقراءة غالباً ما تخلق "فجوة في القدرة على التقييم" حيث يفشل المستخدمون في إدراك فروق الدقة حتى عندما يكون النص المصدر مرئياً، فإن ثقتهم واستعدادهم للإفصاح عن المعلومات الشخصية يندفعان بقوة أكبر نحو الأداء المهامي المتصور والنسب الأنثروبومورفي (إضفاء الصفة البشرية) أكثر من استبقاء المحتوى الموضوعي.

Chenchen Mao, Hanjing Shi, Haiyan Jia, Emily Wegrzyn, Dominic DiFranzo2026-08-20
💬 NLP

Comment-level Topic Drift Analysis in the Reddit Corpus

تقدم هذه الورقة منهجية جديدة لنمذجة المواضيع الديناميكية القائمة على التضمين، والتي طُبقت على 12.7 مليار تعليق من موقع "ريديت" لقياس الانجراف الدلالي للمواضيع، كاشفةً أن المواضيع المثيرة للجدل سياسياً واجتماعياً تظهر تطوراً اتجاهياً ملحوظاً بمرور الوقت، بينما تظل مجالات مثل الموسيقى والرياضة مستقرة.

Steven Morse, Daniel Runfola, Trenton W. Ford2026-08-20
💬 NLP

ChildSafeAds Shared Task 2026: Commercial Content in Child-Facing YouTube Videos

تقدم مهمة ChildSafeAds المشتركة لعام 2026 مجموعة بيانات تضم 3,360 فيديو من فيديوهات يوتيوب الموجهة للأطفال، مقترنة بنصوص مكتوبة وصفحات مبيعات مرتبطة بها، لتقييم الأنظمة في كشف المحتوى التجاري، وتصنيف المنتجات، وتحديد مخاطر الإفصاح القانوني عبر مستويات متفاوتة من إمكانية الوصول إلى البيانات.

Thales Bertaglia, Catalina Goanta, Gerasimos Spanakis, Gunes Acar2026-08-20
💬 NLP

The Authenticity Gap in Human Evaluation

تجادل هذه الورقة بأن بروتوكولات التقييم البشري القياسية لنمذجة اللغة الطبيعية (NLG) غالباً ما تخفق في رصد التفضيلات الحقيقية بسبب افتراضات معيبة ومحدودية مقياس ليكرت، وتقترح منهجية جديدة لـ "التقييم الاحتمالي على مستوى النظام" (SPA) تنجح في استعادة ترتيب النماذج حيث تفشل الأساليب التقليدية.

Kawin Ethayarajh, Dan Jurafsky2026-08-19