💬 NLP

Repetition over Diversity: High-Signal Data Filtering for Sample-Efficient German Language Modeling

تُثبت هذه الورقة أنه بالنسبة لنمذجة اللغة الألمانية، فإن التدريب المتكرر على مجموعة فرعية صغيرة وعالية الجودة من البيانات المفلترة يتفوق بشكل كبير على التدريب أحادي المرور على مجموعات بيانات أكبر ومتنوعة، مما يتيح تحقيق أداء يضاهي أحدث ما توصل إليه العلم باستخدام عدد أقل بكثير من الرموز (tokens).

Ansar Aynetdinov, Patrick Haller, Alan Akbik2026-05-01
💬 NLP

TopBench: A Benchmark for Implicit Prediction and Reasoning over Tabular Question Answering

تقدم هذه الورقة TopBench، وهو معيار مرجعي جديد مصمم لتقييم النماذج اللغوية الكبيرة في الاستدلال التنبؤي الضمني على البيانات الجدولية، مما يكشف أن النماذج الحالية تعاني في التعرف على القصد وغالباً ما تلجأ إلى عمليات البحث البسيطة بدلاً من استنتاج الإجابات غير الملحوظة من الأنماط التاريخية.

An-Yang Ji, Jun-Peng Jiang, De-Chuan Zhan, Han-Jia Ye2026-05-01
💬 NLP

Mapping the Methodological Space of Classroom Interaction Research: Scale, Duration, and Modality in an Age of AI

تقترح هذه الورقة إطاراً ثلاثي الأبعاد يتكون من النطاق، والمدة، والنمط لرسم المشهد المنهجي لأبحاث التفاعل داخل الفصل الدراسي، موضحاً فائدته من خلال دراسات متباينة، ومناقشة تداعياته في توجيه البحوث المستقبلية وتصميم أدوات الذكاء الاصطناي.

Dorottya Demszky, Edith Bouton, Alison Twiner, Sara Hennessy, Richard Correnti2026-05-01
💬 NLP

On the Proper Treatment of Units in Surprisal Theory

تقترح هذه الورقة إطاراً موحداً لفصل تعريف الوحدات اللغوية عن مناطق التقييم في نظرية المفاجأة، محاججةً بأن عملية التجزئة (tokenization) يجب أن تُعامل كتفصيل تنفيذي وليس كأصل علمي لضمان النمذجة الصريحة والدقيقة للجهد المعالجي البشري.

Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell2026-05-01
💬 NLP

Synthetic Computers at Scale for Long-Horizon Productivity Simulation

تقدم هذه الورقة البحثية "الحواسيب الاصطناعية على نطاق واسع"، وهي منهجية لتوليد بيئات حاسوبية افتراضية واقعية وغنية بالمحتوى لتشغيل محاكاة إنتاجية طويلة الأمد تعمل على تحسين أداء الوكيل بشكل كبير من خلال إشارات تعلم تجريبية غنية، مما يوفر أساساً قابلاً للتوسع للتعلم التعزيزي الوكيل المستقبلي عبر سياقات مهنية متنوعة.

Tao Ge, Baolin Peng, Hao Cheng, Jianfeng Gao2026-05-01
💬 NLP

Is Human-Like Text Liked by Humans? Multilingual Human Detection and Preference Against AI

تتحدى هذه الدراسة المفهوم القائل بأن البشر لا يمكنهم التمييز بين النصوص المولدة بواسطة الذكاء الاصطناعي من خلال إثبات دقة كشف متوسطة بلغت 87.6% عبر 16 مجموعة بيانات متعددة اللغات، مع تحديد الفروق الجوهرية في التجسيد، واللمسة الثقافية، والتنوع، بينما تكشف أيضاً أن البشر لا يفضلون دائماً النصوص المكتوبة بشرياً عندما يكون المصدر غامضاً.

Yuxia Wang, Rui Xing, Jonibek Mansurov, Giovanni Puccetti, Zhuohan Xie, Minh Ngoc Ta, Jiahui Geng, Jinyan Su, Mervat Aba (…)2026-04-30
💬 NLP

TinyR1-32B-Preview: Boosting Accuracy with Branch-Merge Distillation

تقدم الورقة البحثية نموذج TinyR1-32B-Preview، وهو نموذج بـ 32 مليار معلمة تم تطويره عبر نهج تقطير "التفرع والدمج" (Branch-Merge) المبتكر الذي يقوم بتدريب نماذج طالب متخصصة بشكل انتقائي ودمجها لتتفوق بشكل كبير على النظراء المقطرين الحاليين في الرياضيات والبرمجة والعلوم مع مضاهاة أداء نموذج المعلم الأكبر DeepSeek-R1.

Lin Sun, Guangxiang Zhao, Xiaoqi Jian, Yuhan Wu, Weihong Lin, Yongfu Zhu, Qilong Shi, Change Jia, Aomufei Yuan, Yuxuan T (…)2026-04-30
💬 NLP

Through a Compressed Lens: Investigating The Impact of Quantization on Factual Knowledge Recall

تتقصى هذه الورقة البحثية تأثير التكميم على استرجاع المعرفة الواقعية في النماذج اللغوية الكبيرة، كاشفةً أنه بينما يتسبب التكميم عموماً في فقدان المعلومات وتدهور الأداء — لا سيما في النماذج الأصغر — إلا أنه لا يضعف الاسترجاع دائماً ويمكنه أحياناً تعزيزه، حيث أظهرت BitSandBytes أعلى مستوى من الحفاظ على القدرات الأصلية.

Qianli Wang, Mingyang Wang, Nils Feldhus, Simon Ostermann, Yuan Cao, Hinrich Schütze, Sebastian Möller, Vera Schmitt2026-04-30
💬 NLP

Decide less, communicate more: On the construct validity of end-to-end fact-checking in medicine

تجادل ورقة الموقف هذه بأن أنظمة التحقق من الحقائق الشاملة غير ملائمة للمجال الطبي بسبب التحديات الجوهرية في ربط الادعاءات الواقعية بالأدلة العلمية، وتقترح بدلاً من ذلك إعادة تصور التحقق من الحقائق كعملية تواصل تفاعلية.

Sebastian Joseph, Lily Chen, Barry Wei, Michael Mackert, Iain J. Marshall, Paul Pu Liang, Ramez Kouzy, Byron C. Wallace (…)2026-04-30
💬 NLP

LogitSpec: Accelerating Retrieval-based Speculative Decoding via Next Next Token Speculation

تُعد LogitSpec طريقةً قائمة على الاسترجاع للفك التخميني، وهي خالية من التدريب وتعمل بأسلوب "التوصيل والتشغيل"، حيث تُسرع استنتاج النماذج اللغوية الكبيرة عبر الاستفادة من لوجيتات (logits) الرمز الأخير لتخمين الرمز "التالي-التالي"، مما يوسع نطاق الاسترجاع لتحقيق تسريع يصل إلى 2.61 ضعفاً ومعدلات قبول رموز أعلى.

Tianyu Liu, Qitan Lv, Hao Li, Xing Gao, Xiao Sun, Xiaoyan Sun2026-04-30