💬 NLP

Diverse LLMs or Diverse Question Interpretations? That is the Ensembling Question

تُثبت هذه الورقة أنه بالنسبة للإجابة على الأسئلة الثنائية باستخدام النماذج اللغوية الكبيرة، فإن تجميع التفسيرات المتنوعة للأسئلة من نموذج واحد يتفوق باستمرار على تجميع نماذج مختلفة متعددة عند استخدام التصويت بالأغلبية.

Rafael Rosales, Santiago Miret2026-05-21
🤖 machine learning

STM3: Mixture of Multiscale Mamba for Long-Term Spatio-Temporal Time-Series Prediction

تقترح الورقة البحثية إطار عمل STM3، وهو بنية مبتكرة تجمع بين هندسة "م ambitions" (Mamba) متعددة المقاييس وهيكل "خليط من الخبراء" (Mixture-of-Experts) مفكك الارتباط وشبكة سببية رسومية تكيفية لالتقاط التبعيات المكانية والزمانية المعقدة طويلة المدى بكفاءة، محققةً أداءً هو الأفضل في فئته عبر عشر معايير مرجعية واقعية.

Haolong Chen, Liang Zhang, Zhengyuan Xin, Guangxu Zhu2026-05-21
💬 NLP

Measuring and mitigating overreliance to build human-compatible AI

تجادل هذه الورقة بأن قياس وتخفيف الاعتماد المفرط على النماذج اللغوية الكبيرة أمر بالغ الأهمية لمنع الأخطاء عالية المخاطر والتدني المعرفي، وتقترح إطارًا لتوحيد المخاطر، ومعالجة فجوات القياس، وتنفيذ استراتيجيات تضمن أن يعزز الذكاء الاصطناعي القدرات البشرية بدلاً من تقويضها.

Lujain Ibrahim, Katherine M. Collins, Sunnie S. Y. Kim, Anka Reuel, Max Lamparth, Kevin Feng, Lama Ahmad, Prajna Soni, A (…)2026-05-21
🤖 AI

Where Do Tokens Go? Understanding Pruning Behaviors in STEP at High Resolutions

تقترح الورقة البحثية إطار عمل STEP، وهو إطار هجين لتقليل الرموز يجمع بين دمج الرقع الفائقة الديناميكي والتقليم عبر الخروج المبكر بواسطة سياسة شبكة عصبية تلافيفية خفيفة الوزن، مما يحسن بشكل كبير من الكفاءة الحسابية وإنتاجية نماذج "Vision Transformers" في مهام التجزئة الدلالية عالية الدقة مع حد أدنى من فقدان الدقة.

Michal Szczepanski, Martyna Poreba, Karim Haroun2026-05-21
💻 computer science

DeFacto: Counterfactual Thinking with Images for Enforcing Evidence-Grounded and Faithful Reasoning

تقدم الورقة البحثية DeFacto، وهو إطار عمل للاستدلال القائم على التفكير المضاد يستفيد من مسار توجيهي لغوي لتوليد مجموعة بيانات متخصصة، ويستخدم التعلم المعزز القائم على تحسين السياسة من خلال المكافآت المتعددة (GRPO) مع مكافآت متعددة الأوجه لتحسين كل من دقة الإجابة والاتساق المستند إلى الأدلة في النماذج اللغوية متعددة الوسائط بشكل كبير.

Tianrun Xu, Haoda Jing, Ye Li, Yuquan Wei, Jun Feng, Guanyu Chen, Haichuan Gao, Tianren Zhang, Feng Chen2026-05-21
💬 NLP

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

يُعدّ EvalMORAAL إطار عمل شفافاً وقابلاً للتفسير، يقيم التوافق الأخلاقي في 20 نموذجاً لغوياً ضخماً مقابل بيانات استطلاع عالمية، كاشفاً عن ارتباطات قوية إجمالاً ولكن مع فجوة توافق تبلغ 0.21 نقطة بين المناطق الغربية وغير الغربية.

Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri2026-05-21
💻 computer science

InteractScience: Programmatic and Visually-Grounded Evaluation of Interactive Scientific Demonstration Code Generation

تقدم هذه الورقة InteractScience، وهو معيار مرجعي وإطار تقييم هجين مبتكر صُمم لتقييم قدرة النماذج اللغوية الكبيرة على توليد كود العروض التوضيحية العلمية التفاعلية من خلال الجمع بين الاختبار الوظيفي البرمجي والتحليل النوعي القائم على الرؤية البصرية عبر خمسة مجالات علمية.

Qiaosheng Chen, Yang Liu, Lei Li, Kai Chen, Qipeng Guo, Gong Cheng, Fei Yuan2026-05-21
🤖 machine learning

A Free Lunch in LLM Compression: Revisiting Retraining after Pruning

تُثبت هذه الورقة أن إعادة البناء المحلي —وهي طريقة فعالة حاسبياً تعمل على تكييف مجموعات فرعية صغيرة من المعلمات لتتطابق مع تنشيطات النموذج الكثيفة— تُمكّن من التكيف الفعال لما بعد التقليم للنماذج اللغوية الكبيرة، مما يكشف عن نظام "وجبة مجانية" حيث تحقق المعايير البسيطة والتحلل المرن جودة عالية من الندرة دون الحاجة إلى إعادة تدريب شاملة مكلفة.

Moritz Wagner, Christophe Roux, Max Zimmer, Sebastian Pokutta2026-05-21
💻 computer science

FineVision: Open Data Is All You Need

تقدم FineVision أكبر مجموعة بيانات مفتوحة مكونة من 24 مليون عينة من الرؤية واللغة منسقة بدقة، والتي تم إنشاؤها من خلال مسار شبه مؤتمت صارم يوحد أكثر من 200 مصدر مع إشراف بشري للقضاء على التلوث والتكرار، مما يمكن النماذج المدربة على هذه المجموعة من التفوق بشكل كبير على البدائل المفتوحة الحالية.

Luis Wiedmann, Orr Zohar, Amir Mahla, Xiaohan Wang, Rui Li, Thibaud Frere, Leandro von Werra, Aritra Roy Gosthipaty, And (…)2026-05-21
💻 computer science

Principled RL for Flow Matching Emerges from the Chunk-level Policy Optimization

تقدم هذه الورقة البحثية "تحسين سياسة تقسيم المجموعات" (GCPO)، وهو نهج جديد للتعلم المعزز على مستوى المجموعات (chunk-level) يعمل على التخفيف من عدم دقة إسناد الميزة في مطابقة التدفق عبر تجميع الخطوات المتتالية، مما يحقق مكاسب في الأداء تصل إلى 43% نسبيًا مقارنة بأسلوب "تحسين السياسة النسبية للمجموعات" (GRPO) القياسي في مهام توليد النصوص إلى صور.

Yifu Luo, Haoyuan Sun, Xinhao Hu, Penghui Du, Keyu Fan, Bo Li, Sinan Du, Xu Wan, Zhiyu Chen, Bo Xia, Tiantian Zhang, Yon (…)2026-05-21