💬 NLP

Large Language Models Are Bad Dice Players: LLMs Struggle to Generate Random Numbers from Statistical Distributions

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة الحالية تفتقر بشكل جوهحي إلى القدرة على توليد أرقام عشوائية من توزيعات احتمالية محددة، حيث تُظهر إخفاقات إحصائية جسيمة في كل من وضعي أخذ العينات المجمعة والمستقلة، مما يؤدي إلى نقل تحيزات منهجية إلى التطبيقات اللاحقة.

Minda Zhao, Yilun Du, Mengyu Wang2026-04-21
💬 NLP

MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense Rewards

يُعد MemBuilder إطار عمل للتعلم التعزيزي يعمل على تعزيز الاتساق الحواري طويل الأمد في النماذج اللغوية الكبيرة من خلال معالجة المكافآت الشحيحة وعزو الذاكرة متعدد الأبعاد عبر التوليد الاصطناعي للأسئلة على مستوى الجلسة والوزن المتدرج المدرك للمساهمة، مما يمكّن نموذجاً بـ 4 مليارات معلمة من التفوق على النماذج المرجعية مغلقة المصدر والأكثر تطوراً.

Zhiyu Shen, Ziming Wu, Fuming Lai, Shaobing Lian, Yanghui Rao2026-04-21
💬 NLP

Enabling Stroke-Level Structural Analysis of Hieroglyphic Scripts without Language-Specific Priors

تقدم هذه الورقة HieroSA، وهو إطار عمل قابل للتعميم يُمكّن النماذج اللغوية الكبيرة متعددة الوسائط من استخراج تمثيلات هيكلية قابلة للتفسير على مستوى الضربات (stroke-level) تلقائياً من صور الرموز الهيروغليفية واللوغاريثمية دون الاعتماد على مسبقات لغوية محددة أو بيانات مصممة يدوياً.

Fuwen Luo, Zihao Wan, Ziyue Wang, Yaluo Liu, Pau Tong Lin Xu, Xuanjia Qiao, Xiaolong Wang, Peng Li, Yang Liu2026-04-21
⚡ electrical engineering

Closing the Modality Reasoning Gap for Speech Large Language Models

تقدم الورقة البحثية TARS، وهو إطار عمل للتعلم التعزيزي يستخدم تصميم مكافأة غير متماثل مع إشارات محاذاة التمثيل والسلوك لسد فجوة الاستدلال بين المدخلات الصوتية والنصية بفعالية في نماذج اللغات الكبيرة الصوتية، محققاً أداءً هو الأفضل في فئته على المعايير المرجعية الصعبة.

Chaoren Wang, Heng Lu, Xueyao Zhang, Shujie Liu, Yan Lu, Jinyu Li, Zhizheng Wu2026-04-21
🔭 astrophysics

Spec-o3: A Tool-Augmented Vision-Language Agent for Rare Celestial Object Candidate Vetting via Automated Spectral Inspection

تقدم الورقة البحثية Spec-o3، وهو وكيل رؤية ولغة مدعوم بالأدوات يستفيد من استراتيجية تدريب ثنائية المراحل واستدلال سلسلة الأفكار متعدد الوسائط لأتمتة عملية فحص الأجرام السماوية النادرة، محققاً أداءً هو الأفضل في فئته وقدرة قوية على التعميم عبر المسوحات مع تفوق ملحوظ على النماذج الحالية للتعلم العميق والنماذج المملوكة لجهات أخرى.

Minghui Jia, Qichao Zhang, Ali Luo, Linjing Li, Shuo Ye, Hailing Lu, Wen Hou, Dongbin Zhao2026-04-21
💬 NLP

Measuring Social Bias in Vision-Language Models with Face-Only Counterfactuals from Real Photos

تقدم هذه الورقة نموذج تقييم مضاد للواقع يعتمد على الوجه فقط، ومجموعة بيانات FOCUS المقابلة، ومعيار REFLECT، وذلك لقياس التحيز الاجتماعي في نماذج الرؤية واللغة بدقة من خلال عزل التأثيرات الديموغرافية عن المربكات البصرية في الصور الواقعية.

Haodong Chen, Qiang Huang, Jiaqi Zhao, Qiuping Jiang, Xiaojun Chang, Jun Yu2026-04-21
💬 NLP

Is Agentic RAG worth it? An experimental comparison of RAG approaches

تقيم هذه الورقة تجريبيًا وتقارن بين نماذج استرجاع المعلومات المعزز (Enhanced RAG) والنماذج الوكيلة (Agentic RAG) عبر سيناريوهات متعددة لتقديم إرشادات عملية حول اختيار التصميم الأكثر فعالية بناءً على مقايضات الأداء والتكلفة.

Pietro Ferrazzi, Milica Cvjeticanin, Alessio Piraccini, Davide Giannuzzi2026-04-21
💬 NLP

Triples and Knowledge-Infused Embeddings for Clustering and Classification of Scientific Documents

تقيم هذه الدراسة مساراً نموذجياً لتجميع وتصنيف الوثائق العلمية باستخدام تضمينات المحولات وثلاثيات (مبتدأ-خبر-مفعول به)، حيث وجدت أنه بينما تعد المعرفة المهيكلة معلوماتية، فإن تمثيلات النصوص المجردة تتفوق باستمرار أو تضاهي المتغيرات المعززة بالمعرفة، مما يشير إلى أن فوائد التعزيز القائم على الثلاثيات تعتمد بشكل كبير على الإعدادات بدلاً من كونها عالمية.

Mihael Arcan2026-04-21
💬 NLP

Alexandria: A Multi-Domain Dialectal Arabic Machine Translation Dataset for Culturally Inclusive and Linguistically Diverse LLMs

تقدم الورقة البحثية "الإسكندرية" (Alexandria)، وهي مجموعة بيانات ضخمة مدفوعة من المجتمع تضم 107 ألف دورة محادثة متوازية بين الإنجليزية واللهجات العربية عبر 13 دولة و11 مجالاً، مع بيانات وصفية دقيقة على مستوى المدن وتصنيفات جندرية، صُممت لتحسين أداء الترجمة الآلية والنماذج اللغوية الكبيرة للهجات العربية المتنوعة.

Abdellah El Mekki, Samar M. Magdy, Houdaifa Atou, Ruwa AbuHweidi, Baraah Qawasmeh, Omer Nacar, Thikra Al-hibiri, Razan S (…)2026-04-21