🤖 AI

Human-Inspired Memory Architecture for LLM Agents

تقدم هذه الورقة بنية ذاكرة قائمة على أسس بيولوجية لوكلاء النماذج اللغوية الكبيرة (LLM agents) تتميز بست آليات معرفية ومنهجية معايرة اصطناعية، مما يظهر تحسينات كبيرة في دقة الاستبقاء وكفاءة التخزين عبر اختبارات تتبع المشكلات والدردشة الشخصية واسعة النطاق.

Doga Kerestecioglu, Alexei Robsky, Clemens Vasters, Anshul Sharma, Yitzhak Kesselman2026-05-12
🤖 machine learning

Continuity Laws for Sequential Models

تُصيغ هذه الورقة البحثية المفهوم ويتحقق منها تجريبياً مفهوم الاستمرارية الزمنية في النماذج المتسلسلة، مبرهنةً على أن نماذج مثل S4 تُظهر سلوكاً مستمراً مستقراً يتماشى مع استمرارية المهام لتحسين الأداء، بينما تكون نماذج مثل Mamba (S6) أكثر حساسية لعملية التجزئة، لتُظهر في النهاية أن الاستفادة من الاستمرارية تُمكّن من استراتيجيات أكثر كفاءة وفعالية لأخذ العينات الزمنية الفرعية.

Annan Yu, Dongwei Lyu, N. Benjamin Erichson2026-05-12
🤖 AI

Log analysis is necessary for credible evaluation of AI agents

تجادل هذه الورقة بأن الاعتماد حصرياً على نتائج النجاح أو الفشل النهائية في معايير تقييم الوكلاء الذكيين يقوض مصداقية التقييم من خلال حجب الطرق المختصرة، والحد من القدرة على التنبؤ بالمنفعة في العالم الحقيقي، وإخفاء السلوكيات الخطيرة، ومن ثم تقترح إطاراً منهجياً لتحليل السجلات مع تصنيف للتهديدات ومبادئ توجيهية لضمان تقييم أكثر صلاحية وأماناً للوكلاء.

Peter Kirgis, Sayash Kapoor, Stephan Rabanser, Nitya Nadgir, Cozmin Ududec, Magda Dubois, JJ Allaire, Conrad Stosz, Mari (…)2026-05-12
🤖 AI

Evaluating Developmental Cognition Capabilities of LLMs

تقدم هذه الورقة اختبار إكمال الجمل التنموي (DSCT) لتقييم قدرة النماذج اللغوية الكبيرة على اكتشاف المراحل المعرفية النمائية بناءً على نظرية روبرت كيغان، حيث وجدت أنه بينما يمكن للنماذج تحديد المراحل المقصودة بدقة في الشخصيات المحاكية وإظهار أنماط نمائية متسقة في مخرجاتها الخاصة، فإن توافقها مع الاستجابات البشرية الحقيقية يظل متوسطاً، مما يسلط الضوء على أن التحدي الرئيسي للذكاء الاصطناعي المدرك للمراحل يكمن في توافر الإشارة النمائية داخل النص المستخلص بدلاً من دقة التصنيف وحدها.

Xiao Xiao, Hayoun Noh, Mar Gonzalez-Franco2026-05-12
🤖 AI

VeriContest: A Competitive-Programming Benchmark for Verifiable Code Generation

تقدم هذه الورقة VeriContest، وهو معيار شامل يضم 946 مسألة من مسائل البرمجة التنافسية بلغة Rust مع Verus، يربط بين الأوصاف اللغوية الطبيعية والمواصفات الرسمية المعتمدة من قبل الخبراء والبراهين القابلة للتحقق آلياً، مما يكشف عن فجوة كبيرة بين قدرات النماذج الحالية في البرمجة وقدرتها على توليد كود برمجي قابل للتحقق.

Zichen Xie, Mrigank Pawagi, Yuxin Liu, Aaditi Rai, Lize Shao, John Berberian Jr., Sicong Che, Wenxi Wang2026-05-12
🤖 AI

MC-RFM: Geometry-Aware Few-Shot Adaptation via Mixed-Curvature Riemannian Flow Matching

تقترح الورقة البحثية إطار عمل MC-RFM، وهو إطار عمل للتكيف بلقطات قليلة وكفاءة في المعلمات، يقوم بنمذجة تحديثات الميزات على منوع ريماني ذي انحناء مختلط لالتقاط كل من الدلالات الهرمية والتباينات البصرية المحلية بشكل أفضل، محققاً أداءً هو الأفضل حالياً عبر مختلف معايير الرؤية الحاسوبية والهياكل الأساسية.

Salim Khazem, Ibrahim Mohamed Serouis, Zakaria Ezzahed2026-05-12
🤖 AI

ZAYA1-VL-8B Technical Report

تقدم الورقة البحثية نموذج ZAYA1-VL-8B، وهو نموذج رؤية ولغة مدمج بنظام "خليط الخبراء" (mixture-of-experts) يضم 9.2 مليار معلمة، يستفيد من محولات LoRA المخصصة للرؤية والانتباه ثنائي الاتجاه لتحقيق أداء منافس أو متفوق على النماذج الأكبر والأحدث في مختلف معايير فهم الرؤية.

Hassan Shapourian, Kasra Hejazi, Olabode M. Sule, Beren Millidge2026-05-12
🤖 AI

Why Retrying Fails: Context Contamination in LLM Agent Pipelines

تقدم هذه الورقة نموذج إعادة التشغيل الملوث بالسياق (CCRM) للقياس الكمي الرسمي لكيفية تسبب محاولات وكلاء النماذج اللغوية الكبيرة (LLM) الفاشلة في تلويث عمليات إعادة المحاولة اللاحقة عبر رفع معدلات الخطأ، مع اشتقاق حدود نظرية لاحتمالات النجاح وأعماق خطوط الأنابيب المثلى التي تم التحقق من صحتها تجريبياً مقابل بيانات SWE-bench الواقعية.

Zhanfu Yang2026-05-12
🤖 machine learning

Uncovering Intra-expert Activation Sparsity for Efficient Mixture-of-Expert Model Execution

تكشف هذه الورقة أن نماذج خليط الخبراء (MoE) المدربة مسبقاً والموجودة حالياً تمتلك بطبيعتها تشتتاً كبيراً في تنشيط الخلايا داخل الخبير الواحد، وهو ما يمكن الاستفادة منه عبر تعديل مسار تنفيذ vLLM لتخطي حسابات الخلايا غير النشطة، مما يحقق تسريعاً يصل إلى 2.5 ضعف في تنفيذ طبقة MoE و1.2 ضعف في السرعة الإجمالية للنظام دون الحاجة إلى أي إعادة تدريب للنموذج أو تعديل للمعلمات.

Jongseok Park, Sunga Kim, Zhenyu Gu, Ion Stoica, Alvin Cheung2026-05-12
🤖 machine learning

Kaczmarz Linear Attention

تقدم الورقة البحثية "انتباه كازمارك الخطي" (KLA)، وهو نموذج معدل من "Gated DeltaNet" يستبدل معامل التحديث الذي تم تعلمه تجريبياً بخطوة كازمارك ذات حجم مُعين نظرياً ومُطبع وفقاً لمعيار المفتاح (key-norm-normalized)، مما يؤدي إلى تفوق في مستويات الحيرة (perplexity)، واستقرار في السياقات الطويلة، وكفاءة في فك التشفير دون تغيير بنية النموذج أو شكل الحالة.

Jiaxuan Zou, Ruifeng Ren, Yong Liu2026-05-12