💬 NLP

SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark

تقدم هذه الورقة SomaliWeb v1، وهو عبارة عن مجموعة نصوص صومالية منقحة نوعياً ومُطلقة للعموم تتكون من حوالي 303 مليون رمز (token) مصحوبة بـ tokenizer من نوع BPE-16K متوافق، وأول معيار مرجعي عام لتحديد اللغة، والذي يكشف أيضاً عن عيوب جوهرية في جودة توزيعات البيانات الصومالية متعددة اللغات الموجودة حالياً.

Khalid Yusuf Dahir2026-05-19
💬 NLP

Multilingual jailbreaking of LLMs using low-resource languages

تُظهر هذه الدراسة أنه في حين تفشل الترجمات أحادية الدور للمطالبات الضارة إلى لغات أفريقية منخفضة الموارد في تجاوز حواجز السلامة في النماذج اللغوية الكبيرة، فإن المحادثات متعددة الأدوار تزيد بشكل كبير من معدلات نجاح عمليات الاختراق، مع تحديد الاختبار الأحمر البشري وجودة الترجمة كعوامل حاسمة في استغلال هذه الثغرات.

Dylan Marx, Marcel Dunaiski2026-05-19
💬 NLP

From Volume to Value: Preference-Aligned Memory Construction for On-Device RAG

تقدم الورقة البحثية إطار عمل EPIC، وهو إطار عمل فعال لعمليات التوليد المعزز بالاسترجاع (RAG) على الأجهزة، والذي يعمل على بناء ذاكرة متوافقة مع التفضيلات لتقليل حجم الفهرسة وزمن الاستجابة بشكل جذري، مع تحسين دقة استجابات الذكاء الاصطناعي المخصصة بشكل كبير في ظل قيود الذاكرة الصارمة.

Changmin Lee, Jaemin Kim, Taesik Gong2026-05-19
💬 NLP

SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning

يقدم SD-Search إطار عمل للتقطير الذاتي المتأخر في الوقت الفعلي (on-policy hindsight self-distillation) يُمكّن وكلاء الاستدلال المعززين بالبحث من توليد إشارات إشراف على مستوى الخطوة داخلياً عبر تدريب نموذج طالب لمحاكاة معلم مشروط بالنتائج المتأخرة، مما يتغلب على قيود تخصيص الائتمان لتعلم التعزيز القائم على مكافأة النتيجة دون الحاجة إلى معلمين خارجيين أو تعليقات توضيبية إضافية.

Yufei Ma, Zihan Liang, Ben Chen, Zhipeng Qian, Huangyu Dai, Lingtao Mao, Xuxin Zhang, Chenyi Lei, Wenwu Ou2026-05-19
💬 NLP

Infini-News: Efficiently Queryable Access to 1.3 Billion Processed Common Crawl News Articles

تقدم الورقة البحثية "Infini-News"، وهي مجموعة أدوات وفهرس شامل يعالج أكثر من 1.3 مليار مقال إخباري من "Common Crawl" مع بيانات وصفية غنية وتحديد للغة، مما يمكّن الباحثين من الاستعلام بكفاءة عن الأرشيف بأكمله بحثاً عن أي أنماط نصية في زمن يقل عن ثانية واحدة.

Ruggero Marino Lazzaroni, Jana Lasser, Kirill Solovev2026-05-19
💬 NLP

Presupposition and Reasoning in Conditionals: A Theory-Based Study of Humans and LLMs

تكشف هذه الدراسة أنه بينما يمكن لنماذج اللغات الكبيرة في بعض الأحيان أن تضاهي التقييمات البشرية في إسقاط الافتراض المسبق في الجمل الشرطية، فإن أداءها غالباً ما ينبع من مطابقة الأنماط السطحية بدلاً من الاستدلال البراغماتي الحقيقي، مما يسلط الضوء على وجود فجوة بين التوافق الإحصائي والكفاءة اللغوية الحقيقية.

Tara Azin, Yongan Yu, Raj Singh, Olessia Jouravlev2026-05-19
💬 NLP

What is Holding Back Latent Visual Reasoning?

تكشف هذه الورقة أن نماذج الاستدلال البصري الكامنة الحالية تفشل في استخدام الرموز البصرية الوسيطة لأن مجموعات البيانات الحالية لا توفر معلومات كافية لجعلها ضرورية، كما أن التنبؤات أثناء الاستدلال غير دقيقة، مما يشير إلى أن التقدم المستقبلي يتطلب كلاً من مجموعات بيانات أكثر إفادة وتوليدًا أفضل للرموز.

André G. Viveiros, Nuno Gonçalves, André F. T. Martins, Matthias Lindemann2026-05-19
💬 NLP

Vector RAG vs LLM-Compiled Wiki: A Preregistered Comparison on a Small Multi-Domain Research

تجد هذه الدراسة المسجلة مسبقاً، والتي تقارن بين نظام استرجاع المعلومات المدعوم بالمتجهات (Vector RAG) والويكي المُعدّ بواسطة النماذج اللغوية الكبيرة (LLM-compiled wikis) لغرض التوليف البحثي متعدد المجالات، أنه في حين تتفوق الويكي في الربط بين الأوراق البحثية ودعم الاستشهاد على مستوى الادعاء، فإن نظام (RAG) أكثر فعالية من حيث التكلفة للبحث عن الحقائق الفردية، مما يثبت عدم وجود بنية واحدة مثالية توازن بين تنظيم الأدلة، ودقة الاستشهاد، والتكلفة التشغيلية.

Theodore O. Cochran2026-05-19
📊 statistics

Continuous Diffusion Scales Competitively with Discrete Diffusion for Language

تقدم هذه الورقة البحثية RePlaid، وهو نموذج لغوي يعتمد على الانتشار المستمر القائم على الاحتمالية، والذي يحقق من خلال المواءمة الهيكلية مع النماذج المنفصلة الحديثة والتدريب الأمثل، قوانين توسع تنافسية، وجودة توليد فائقة، وحدًا جديدًا قياسيًا لـ "الارتباك" (perplexity)، مما يتحدى الفكرة القائلة بأن الانتشار المستمر أقل قابلية للتوسع من النهج المنفصل.

Zhihan Yang, Wei Guo, Shuibai Zhang, Subham Sekhar Sahoo, Yongxin Chen, Arash Vahdat, Morteza Mardani, John Thickstun2026-05-19
💬 NLP

STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics

تقدم هذه الورقة STT-Arena، وهو معيار مرجعي واقعي لتقييم قدرة النماذج اللغوية الكبيرة على التكيف مع الاضطرابات المكانية والزمانية في مهام استخدام الأدوات، مما يكشف عن فجوات أداء كبيرة في النماذج الحالية ويقترح نهج تدريب منقحًا ينتج وكيلًا متخصصًا يتفوق على الأنظمة المتطورة.

Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao2026-05-19