🤖 AI

Persistent AI Agents in Academic Research: A Single-Investigator Implementation Case Study

تُقيّم هذه الحالة الدراسية وكيل ذكاء اصطناعي مستمرًا مدمجًا في بيئة بحث أكاديمي ذات باحث واحد على مدار 96 يومًا، مما يكشف أن مثل هذه الأنظمة تعتمد بشكل أساسي على الذاكرة المخبئية (cache-dominant)، ويقترح تحولًا في التقييم الاقتصادي من التكلفة لكل رمز (token) إلى التكلفة لكل منتج نهائي مكتمل.

Anas H. Alzahrani2026-05-27
🤖 AI

Knowledge Graphs as the Missing Data Layer for LLM-Based Industrial Asset Operations

تثبت هذه الورقة أن استبدال مخازن المستندات المسطحة بطبقة معرفية مهيكلة يعزز بشكل كبير عمليات الأصول الصناعية القائمة على النماذج اللغوية الكبيرة من دقة 65% إلى دقة تقارب الكمال، وذلك عبر تحويل دور النموذج اللغوي من الاستنتاج بناءً على البيانات الخام إلى توليد استعلامات حتمية مقابل مخطط نمطي.

Madhulatha Mandarapu, Sandeep Kunkunuru2026-05-27
🤖 AI

Strategies for Guiding LLMs to Use Software Design Patterns: A Case of Singleton

تقيم هذه الورقة أربع استراتيجيات للتلقين عبر 13 نموذجاً من النماذج اللغوية الكبيرة في 164 تحدياً بلغة جافا لتحديد أفضل طريقة لتوجيهها في تنفيذ نمط التصميم "Singleton"، حيث وجدت أن التغذية الراجعة الثنائية التكرارية هي المثلى بشكل عام، بينما يمكن للنهج القائم على التعليمات المحددة أن يحقق التزاماً شبه مثالي بالنمط ويحسن وظائف الكود بشكل كبير اعتماداً على النموذج.

Viktor Kjellberg, Farnaz Fotrousi, Miroslaw Staron2026-05-27
🤖 AI

On the Detection of Commutative Factors in Factor Graphs: Necessary and Sufficient Conditions

تصحح هذه الورقة البحثية خللاً جوهرياً في الخوارزمية الرائدة المتبعة حالياً للكشف عن العوامل التبادلية في الرسوم البيانية للعوامل، وذلك من خلال إثبات أن النظرية المركزية القائمة توفر شرطاً ضرورياً فقط وليس كافياً، ومن ثم تقدم خوارزمية مصححة تضمن الكفاءة والصحة معاً.

Malte Luttermann, Ralf Möller, Marcel Gehrke2026-05-27
🤖 machine learning

EEG-FM-Audit: A Systematic Evaluation and Analysis Pipeline for EEG Foundation Models

تقدم الورقة البحثية EEG-FM-Audit، وهو مسار تقييم منهجي يتكون من معايير قياسية مدفوعة بـ ASHA، واختبار استئصال على مستوى النموذج، وسبر أغوار فيزيولوجي عصبي لمعالجة قضايا الشفافية في النماذج التأسيسية لـ EEG، كاشفةً أن النماذج المرجعية الخاضعة للإشراف والمُحسّنة غالباً ما تفوق هذه النماذج أداءً مع توفير رؤى أعمق حول اعتمادها على السمات الفيزيولوجية.

Xianheng Wang, Yige Yang, Damien Coyle2026-05-27
💬 NLP

Reasoning Depth and Environment Complexity: A Controlled Study of RLVR Data Allocation across Logical Reasoning Tasks

تقدم هذه الورقة بيئة اصطناعية محكومة لدراسة التعلم المعزز بمكافآت قابلة للتحقق (RLVR) عبر بُعدين من صعوبة الاستدلال (العمق والتعقيد) وأربع عائلات استدلالية، مما يكشف أن التغطية المشتركة لهذه العوامل والخلط الموحد للبيانات يتفوقان على النهج أحادي المحور أو النهج المرحلي، مع تسليط الضوء في الوقت ذاته على عدم تماثل مستمر يميل نحو الاستنتاج على حساب الاستنباط في النماذج الحالية.

Yihua Zhu, Qianying Liu, Fei Cheng, Jiaxin Wang, Akiko Aizawa, Sadao Kurohashi, Hidetoshi Shimodaira2026-05-27
💬 NLP

Beyond Questions: Evaluating What Large Language Models (Actually) Know

تقدم هذه الورقة البحثية "ما وراء الأسئلة" (BeQu)، وهو نموذج تقييم جديد للمعرفة المفتوحة يقيم النماذج اللغوية الكبيرة بناءً على المعرفة التي تعبر عنها بشكل طبيعي من خلال الاستدلال المفتوح بدلاً من الأسئلة المحددة مسبقاً، مما يكشف عن رؤى هامة حول قدرات النماذج عبر عوامل مختلفة مثل الحجم وجهد الاستدلال.

Luca Giordano, Simon Razniewski2026-05-27
🤖 AI

Neuro-Symbolic Verification of LLM Outputs for Data-Sensitive Domains (extended preprint)

تقترح هذه الورقة بنية تحقق هجينة عصبية-رمزية تجمع بين الاستدلال المنطقي الصوري والتحليل الدلالي العصبي للكشف بفعالية عن الهلوسة وضمان الموثوقية في المحتوى الذي تولده النماذج اللغوية الكبيرة للمجالات عالية المخاطر والحساسة للبيانات، كما تم التحقق من ذلك من خلال انخفاض بنسبة 30% في وقت إنشاء التقارير ومعدلات كشف عالية في نظام تقييم أجهزة طبية في العالم الحقيقي.

Paul Sigloch, Christoph Benzmüller2026-05-27
💬 NLP

JuICE: A Benchmark for Evaluating LLM-Judge in Identifying Cultural Errors

تقدم الورقة البحثية JuICE، وهي مجموعة بيانات مرجعية متعددة اللغات مصممة لتقييم حدود النماذج اللغوية الكبيرة المستخدمة كحكام في اكتشاف الأخطاء الثقافية الدقيقة والمنبثقة عن السياق، مما يكشف عن عجز النماذج الحالية عن تحديد الفروق الثقافية "العميقة" التي يدركها المتحدثون الأصليون بسهولة.

Jiho Jin, Junho Myung, Juhyun Oh, Junyeong Park, Rifki Afina Putri, Sunipa Dev, Vinodkumar Prabhakaran, Alice Oh2026-05-27
💬 NLP

Recon: Reconstruction-Guided Reasoning Synthesis for User Modeling

تقدم الورقة البحثية "Recon"، وهي طريقة تعمل على تحسين نمذجة المستخدم من خلال تقييم وتوليف مسارات الاستدلال بناءً على قدرتها على إعادة البناء التنبؤي لأفعال المستخدم، وبذلك تتجاوز التبرير اللاحق غير الفعال لتلتقط مسارات القرار السببية الحقيقية.

Alan Zhu, Mihran Miroyan, Carolyn Wang, Andrew Zhou, Lisa Dunlap, Narges Norouzi, Joseph E. Gonzalez2026-05-27