💻 computer science

Policy Fragmentation or Institutional Alignment? Institutional Governance of AI in Universities and Business Schools

تحلل هذه الدراسة سياسات الذكاء الاصطناعي عبر مؤسسات التعليم العالي في الولايات المتحدة وتجد عدم توافق ملحوظاً حيث تعطي التوجيهات على مستوى الجامعة الأولوية لتخفيف المخاطر بينما تركز السياسات على مستوى الكليات على الجوانب التربوية، وهي فجوة تبرز بشكل خاص في كليات الأعمال وتعيق دمج أهداف التعلم الخاصة بكل تخصص.

Lydia Manikonda, Dominique Outlaw2026-08-05
💻 computer science

DiagChain: A Diagnostic Benchmark for Evaluating LLM Agents on Evidence-Grounded Attack Chain Reconstruction

تقدم الورقة البحثية DiagChain، وهو معيار تشخيصي يضم 69 سيناريو متنوعًا وإطار عمل ECRAG لتقييم وكلاء النماذج اللغوية الكبيرة (LLMs) في إعادة بناء سلسلة الهجمات القائمة على الأدلة، كاشفةً أنه في حين تعاني النماذج الأكبر من صعوبة في ترتيب الأدلة، تفشل النماذج الأصغر في عملية دمج الأدلة الأساسية، مما يسلط الضوء على الحاجة إلى التقييم المرحلي بدلاً من الدقة الإجمالية.

Xuyang Liu, Yibin Han, Zhenwei Zhang, Kai Chang, Zhiwei Xu, Tian Qiu, Weixian Deng, Jiabao Gao, Xiaolin Peng, Hai Wan, X (…)2026-08-05
💻 computer science

Large language models for partial differential equation workflows

تتناول هذه الورقة كيفية تحويل النماذج اللغوية الكبيرة لسير عمل المعادلات التفاضلية الجزئية من خلال دمج اللغة الطبيعية، والرياضيات الرمزية، والبرمجة عبر صياغة النموذج، وتوليد الحلول، والتحسين، مع تسليط الضوء على التحديات الجوهرية مثل ندرة مجموعات البيانات عالية الجودة والفجوة بين نتائج المحاكاة والتطبيقات الواقعية.

Han Wan, Rui Zhang, Hao Sun2026-08-05
🤖 machine learning

A Theory of Conditional Collapse under Low-Rank Weight-Space Ablations: I. The Single-Block Theory and Synthetic Validation

تؤسس هذه الورقة إطاراً نظرياً مثالياً يثبت أن رقع التنشيط (activation patching) واستئصال فضاء الأوزان (weight-space ablation) ينتجان تفسيرات سببية متباينة لمكونات النموذج، مستنتجةً الشروط الدقيقة لاتفاقهما واختلافهما مع التحقق من صحة هذه التنبؤات من خلال تجارب اصطناعية ونماذج محولات (transformer models) واقعية.

Abdallah Khemais2026-08-05
💻 computer science

Unequal Verdicts: Investigating Gender Bias in LLM-Based Fake News Detection

تكشف هذه الدراسة أن النماذج اللغوية الكبيرة المتطورة تظهر تحيزاً جنسياً كبيراً في كشف الأخبار الزائفة، حيث تنتج أحكاماً متضاربة ومنحازة بشكل منهجي حول صحة المعلومات بناءً فقط على العرض الجندري للمسميات الوظيفية للمتحدثين، مما يقوض موثوقية وعدالة أنظمة التحقق من الحقائق الآلية.

Razieh Chalehchaleh, Reza Farahbakhsh, Noel Crespi2026-08-05
🤖 machine learning

Cross-Layer Interaction under Weight-Space Ablation: A Closed-Form Attention Jacobian Bound and a Test on a Real Pretrained Model

توسع هذه الورقة البحثية الحدود النظرية للتفاعلات بين الطبقات في عملية استئصال فضاء الأوزان عبر اشتقاق حد مغلق الصيغة لجاكوبيان الانتباه تم التحقق منه على نموذج مدرب مسبقاً وحقيقي، وإظهار نتائج تجريبية مختلطة على دائرة تحديد المفعول به غير المباشر الناشئة.

Abdallah Khemais2026-08-05
💻 computer science

Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details

تقدم هذه الورقة مخطط تقييم للعب المشترك عبر التنفيذات لتقييم متانة خوارزميات التنسيق من نوع "الصفر استباقي" (Zero-Shot Coordination) تجاه تفاصيل التنفيذ بشكل منهجي، حيث وجدت أن خوارماية "اللعب الآخر" (Other-Play) الشهيرة، تُعد تقييمات التنفيذ الفردي القياسية بمثابة بديل معقول لهذا الاختبار الأكثر صرامة.

Maksymilian Wolski, Nicholas Hoernle, Johannes Forkel, Jakob Foerster2026-08-05
💬 NLP

How Closely Do LLM Reviews Align with Human Peer Review?

تقيم هذه الدراسة ثلاثة من النماذج اللغوية الكبيرة الرائدة مقابل مراجعات الأقران البشرية لأبحاث مقدمة لـ ICLR 2026، وتجد أنه بينما تستطيع النماذج اللغوية الكبيرة التمييز بشكل عام بين الأوراق المقبولة والمرفوضة، إلا أنها تفشل في محاكاة التمايزات البشرية بين العروض الشفهية والملصقات، وتظهر تحيزات في التقييم خاصة بكل مزود واختلافات موضوعية في تحديد نقاط الضعف.

Abraham Camelo-Guerrero, Jairo Diaz-Rodriguez2026-08-05
💻 computer science

Shielding for Higher-Order Safety

تقدم هذه الورقة إطار عمل مبتكر لتركيب الدرع للأنظمة السيبرانية الفيزيائية يفرض قيود سلامة من رتب عليا تتضمن مشتقات الحالة (مثل السرعة والتعجيل) عن طريق اختزال المشكلة إلى لعبة سلامة ذات حالة محدودة فوق فضاء حالة يعتمد على التاريخ، وتتميز بخوارزمية تكرارية تعمل على تحسين الكفاءة من خلال تقليم المناطق غير الآمنة بناءً على قيود مشتقات مرتبة هرمياً.

Filip Cano, Thomas A. Henzinger, Konstantin Kueffner2026-08-05
💻 computer science

LiveEvalBench: Toward Open-World Evaluation for Web Generation

يقدم LiveEvalBench إطار عمل آلياً يعتمد على الوكلاء، يعيد تعريف تقييم توليد الويب كعملية مراجعة ديناميكية وتشاركية تتضمن أدواراً متخصصة لمعالجة الطبيعة التفاعلية والمتنوعة والمتطورة بسرعة للمصوغات الأمامية، مما يحقق التوافق مع حكم الخبراء البشريين.

Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen2026-08-05