🤖 AI

SAAS: Self-Aware Reinforcement Learning for Over-Search Mitigation in Agentic Search

تقدم هذه الورقة البحثية إطار عمل SAAS، وهو إطار تعلم تعزيزي ذاتي الوعي يخفف من حدة الإفراط في البحث في أنظمة البحث الوكيلية عبر النمذجة الديناميكية لحدود المعرفة وتطبيق التحسين المرحلي لتقليل التكاليف الحسابية دون التضحية بالدقة.

Yunbo Tang, Chengyi Yang, Shiyu Liu, Zhishang Xiang, Zerui Chen, Qinggang Zhang, Jinsong Su2026-05-29
🤖 machine learning

Data filtering methods for training language models

تقدم هذه الورقة تحليلاً مقارناً بين التعلم الواثق (Confident Learning) ورسم خرائط مجموعة البيانات (Dataset Cartography) للكشف عن أخطاء التصنيف في مجموعات بيانات تصنيف النصوص الروسية، مما يوضح أنه بينما يتفوق كلا الأسلوبين على الإزالة العشوائية، فإن فعاليتهما في تحسين أداء النموذج تعتمد بشكل كبير على حجم مجموعة البيانات ومستويات الضجيج، حيث يحقق التعلم الواثق مكاسب كبيرة في مجموعات البيانات الصغيرة والمشوبة بالضجيج.

Egor Shevchenko, Elena Bruches2026-05-29
🤖 AI

PRAIB: Peer Review AI Benchmark of Behaviour of LLM-Assisted Reviewing

تقدم هذه الورقة PRAIB، وهو إطار عمل مرجعي مبتكر ودراسة تجريبية واسعة النطاق تحلل 11,000 مراجعة مُنشأة آلياً مقابل ملاحظات بشرية للكشف عن تباينات سلوكية جوهرية — مثل الانحياز الإيجابي، والثقة المفرطة، وإغفال نقاط الضعف الذرية — مما يوفر أداة تشخيصية لتحديد الموثوقية الحالية والقيود التي تواجهها النماذج اللغوية الكبيرة في عملية مراجعة الأقران.

Krzysztof Żurawicki, Julia Farganus, Arkadiusz Gaweł, Mateusz Bystroński, Tomasz Jan Kajdanowicz2026-05-29
🤖 AI

Harnessing non-adversarial robustness in large language models

تقترح هذه الورقة إطاراً نظرياً وتجريبياً يوضح أن "إزالة الانحياز من أجل المتانة"، وهي عملية ضبط دقيق بسيطة تستهدف الانحيازات الناجمة عن المطالبات في الوحدات العصبية، يمكن أن تعزز بكفاءة متانة النماذج اللغوية الكبيرة تجاه المطالبات المتشابهة دلالياً والمختلفة نصياً دون الحاجة إلى إعادة تدريب كامل للنموذج بتكلفة باهظة.

Qinghua Zhou, Ellina Aleshina, Andrey Lovyagin, Oleg Somov, Mikhail Seleznyov, Alexander Panchenko, Ivan Oseledets, Elen (…)2026-05-29
🤖 AI

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

تقدم هذه الورقة OmniMatBench، وهو معيار مرجعي متعدد الوسائط تمت معايرته بشرياً ويضم 3,171 مسألة منسقة من قبل خبراء عبر 19 مجالاً فرعياً في علم المواد، مما يكشف عن قيود كبيرة في الاستنتاج لدى النماذج اللغوية الحالية متعددة الوسائط ويضع أساساً لتطوير مساعدين ذكاء اصطناعي موثوقين في البحث العلمي.

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen (…)2026-05-29
📊 statistics

CB-SLICE: Concept-Based Interpretable Error Slice Discovery

تقدم الورقة البحثية CB-SLICE، وهي طريقة لاكتشاف شرائح الخطأ القائمة على المفاهيم تستفيد من نماذج عنق الزجاجة للمفاهيم لتحديد الإخفاقات المنهجية للنماذج من خلال تجميع العينات ذات التنبؤات الخاطئة للمفاهذ المشتركة، مما يوفر تفسيرات أكثر دقة وقابلية للتفسير من النهج الحالية.

Yael Konforti, Mateo Espinosa Zarlenga, Elaf Almahmoud, Mateja Jamnik2026-05-29
🤖 machine learning

HARP: Hadamard-Preconditioned Adaptive Rotation Processor for Extreme LLM Quantization

يقدم HARP معالجًا متعامدًا ثنائي الجانب، مهيكلاً وقابلاً للتعلم، يقوم بتكييف أساس التكميم مع طبقات محددة وبيانات معايرة معينة، مما يحسن دقة تكميم النماذج اللغوية الكبيرة ذات البتات المنخفضة للغاية (2-4 بت) بشكل كبير مقارنة بطرق هادامارد الثابتة مع الحفاظ على كفاءة النشر.

Artur Zagitov, Gleb Molodtsov, Aleksandr Beznosikov2026-05-29
🤖 machine learning

ESPO: Early-Stopping Proximal Policy Optimization

تقترح الورقة البحثية خوارزمية ESPO (تحسين السياسة القريبة بوقف مبكر)، وهي خوارزمية تعلم تعزيزي تعمل على إنهاء مسارات الاستدلال الفاشلة ديناميكيًا للقضاء على الضجيج وتوفير الحوسبة، مما يؤدي إلى تحسين أداء الاستدلال الرياضي في اختبارات معيارية مثل AIME وMATH-500 مع تقليل استخدام الرموز (tokens) بنسبة تزيد عن 20%.

Zihang Li, Rui Zhou, Yingcheng Shi, Wenhan Yu, Zhewen Tan, Zixiang Liu, Zeming Li, Binhua Li, Yongbin Li, Tong Yang, Jie (…)2026-05-29
🤖 AI

Towards Verifiable Multimodal Deep Research: A Multi-Agent Harness for Interleaved Report Generation

تقدم هذه الورقة إطار عمل \textsc{Ptah}، وهو إطار عمل متعدد الوكلاء ينظم التخطيط، وجمع الأدلة مع ذاكرة عمل بصرية، وتوليد التقارير بفرض التحقق لإنتاج تقارير بحث عميق متعددة الوسائط موثوقة، ومخلصة للاقتباسات، ومتداخلة بصرياً.

Chenghao Zhang, Guanting Dong, Yufan Liu, Tong Zhao, Zhicheng Dou2026-05-29
🤖 AI

Evolutionary Dynamics of Cooperation in Next-Generation LLM Agent Systems: A Cross-Provider Empirical Extension

توسع هذه الدراسة معايير نظرية الألعاب التطورية لتشمل أربعة من وكلاء النماذج اللغوية الكبيرة الرائدة من الفترة ٢٠٢٥-٢٠٢٦، كاشفةً أنه في حين تستمر الانحيازات التعاونية عبر معظم النماذج، فإن هوية المزود تؤثر بشكل كبير على نتائج التوازن، كما يظل الصمود أمام الضجيج تحدياً عالمياً رغم التحسينات الجزئية في تكافؤ القدرة الهجومية.

Francisco León Zúñiga Bolívar (Institución Universitaria Colegio Mayor del Cauca)2026-05-29