🤖 machine learning

The Hamilton-Jacobi Theory of Deep Learning

تُرسخ هذه الورقة تقابلاً رياضياً دقيقاً بين تدريب التعلم العميق ومعضلات القيمة الأولية لمعادلات هاميلتون-جاكوبي، مما يوحد بنيات الشبكات العصبية، والجبر الاستوائي، والمعادلات التفاضلية الجزئية اللزجة، والتحسين المحدب تحت معلمة تشوه واحدة لاستخلاص رؤى نظرية دقيقة حول التعميم، والمتانة، والإسناد.

Jose Marie Antonio Miñoza, Erika Fille T. Legara, Christopher P. Monterola2026-05-29
🤖 AI

BEAMS: Benchmarking and Evaluating AI for Modeling and Simulation

تضع مبادرة BEAMS معايير مرجعية مفتوحة واختبارات مؤتمتة لتقييم أدوات الذكاء الاصطناعي الخاصة بالنمذجة والمحاكاة، كاشفةً عن أن الأنظمة الحالية تتفوق في المهام النوعية والمناقشة، لكنها لا تزال تواجه صعوبات في الاستدلال السببي والتصحيح الكمي للأخطاء، مما يؤكد الحاجة إلى تطوير ذكاء اصطناعي مسؤول متمحور حول الإنسان.

Sara Metcalf, William Schoenberg2026-05-29
💻 computer science

Measuring Real-World Prompt Injection Attacks in LLM-based Resume Screening

تقدم هذه الورقة أول دراسة منهجية لهجمات حقن الأوامر (prompt injection) في العالم الحقيقي في عمليات فحص السير الذاتية القائمة على النماذج اللغوية الكبيرة (LLM)، حيث حللت 200,000 سيرة ذاتية لتكشف أن ما يقرب من 1% منها يحتوي على حقن مخفي، وأن انتشارها في تزايد، وأن معظمها لا يستخدم تعليمات صريحة.

Mohan Zhang, Yuqi Jia, Zhen Tan, Steven Jiang, Neil Zhenqiang Gong, Tianlong Chen, Dawn Song2026-05-29
🤖 machine learning

FormInv: A Measurement Protocol for Semantic Invariance in Mathematical Reasoning Benchmarks

تقدم هذه الورقة FormInv، وهو بروتوكول قياس يكشف كيف تؤدي عيوب الثبات الدلالي في معايير قياس الاستدلال الرياضي إلى تشويه تصنيفات النماذج، ويكشف عن فجوة حرجة بين الدقة الإجمالية والاتساق الدلالي، مما يثبت أن خيارات تصميم المعايير تحدد ضمنياً أي النماذج تبدو متفوقة.

Nishal Thomas, Noel Thomas2026-05-29
🤖 machine learning

LoRe: Adaptive Interaction-Evaluation Routing with Per-Step Interaction Budgets for Iterative Graph Solvers

تُعد LoRe غلافاً (wrapper) يعمل في وقت الاستنتاج ولا يتطلب تدريباً، يعزز قابلية التوسع للمحللات العصبية القائمة على الانتشار للتحسين التوافقي عبر توجيه تقييمات التفاعل لكل خطوة ديناميكياً إلى الحواف ذات الصراع العالي أو عدم اليقين العالي، مما يحقق تسريعاً كبيراً وتقليلاً في الذاكرة مع الحفاظ على جودة الحل في المشكلات واسعة النطاق مثل MIS وTSP.

Jintao Li, Yong-Yi Wang, Zheng-An Wang, Heng Fan2026-05-29
🤖 machine learning

Label-Free Reinforcement Learning via Cross-Model Entropy

تقترح هذه الورقة البحثية "الاعتلاج عبر النماذج" (Cross-Model Entropy - CME)، وهو إشارة مكافأة للتعلم التعزيزي خالية من الملصقات، تستفيد من لوغاريتم احتمالية حدوث مخرجات النموذج المولد تحت نموذج تحقق مستقل لتمكين التدريب اللاحق الفعال لاتباع التعليمات مفتوحة النطاق دون الاعتماد على ملصقات الحقيقة الأرضية أو التفضيلات البشرية.

Matt Gorbett, Hossein Shirazi2026-05-29
🤖 AI

Practitioner Beliefs and Behaviors in AI-Enhanced Education: DOT Framework Survey Evidence

تستخدم هذه الدراسة مسحاً مستعرضاً لـ 72 من ممارسي التعليم العالي للتحقق من صحة إطار عمل (DOT)، حيث كشفت أنه في حين يحمل التربويون آراءً إيجابية تجاه الذكاء الاصطناعي كأداة دعم تربوي ويؤكدون على الإشراف البشري، فإن ممارسات التنفيذ الحالية لديهم تفتقر غالباً إلى عناصر التصميم المنهجي وتعيقها عوائق مؤسسية مثل محدودية السياسات والتدريب.

David Gibson (Curtin University), M. Elizabeth Azukas (Georgia Institute of Technology), Gerald Knezek (University of No (…)2026-05-29
🤖 AI

Differentiable Belief-based Opponent Shaping

تقترح هذه الورقة طريقة "تشكيل الخصم القائم على الاعتقاد القابل للتفاضل" (D-BOS)، وهي طريقة من الدرجة الأولى تعمل على تحسين استراتيجيات متعددة الوكلاء من خلال التفاضل عبر ديناميكيات اعتقاد "softmax-Bayes" لعدد kk من الخطوات لتشكيل معتقدات الخصوم بشكل طبيعي دون الاعتماد على أهداف خداع محددة مسبقًا، مما يحقق أداءً متفوقًا في الألعاب ذات الأدوار المخفية والدوافع المختلطة مقارنة بالنماذج المرجعية الحالية.

Aarav G Sane, Karthik Sivachandran, Rohan Paleja2026-05-29
🤖 AI

Hallucination Mitigation with Agentic AI, Nested Learning, and AI Sustainability via Semantic Caching

تُثبت هذه الورقة أن مسار العمل متعدد الوكلاء المستوحى من نموذج HOPE والمعزز بالذاكرة، والذي يستخدم التخزين المؤقت الدلالي ومراحل المراجعة التدريجية، يمكنه تقليل هلوسة النماذج اللغوية الكبيرة بشكل كبير، وتحسين الكفاءة التشغيلية عبر خفض استهلاك الطاقة، وتعزيز قابلية التدقيق دون الحاجة إلى إعادة تدريب النموذج.

Diego Gosmar, Deborah A. Dahl2026-05-29
💻 computer science

SCDBench: A Benchmark for LLM-Based Smart Contract Decompilers

تقدم هذه الورقة SCDBench، وهو عبارة عن مجموعة بيانات معيارية ومنهجية تقييم شاملة صُممت لتقييم أدوات إلغاء تجميع العقود الذكية القائمة على النماذج اللغوية الكبيرة (LLMs) بدقة، من خلال الكشف عن أنه في حين يمكن للنماذج الرائدة توليد كود قابل للتجميع، إلا أنها تعاني حالياً في تحقيق الاتساق الدلالي، حيث نجح أفضل نموذج في إلغاء تجميع 42 عقداً فقط من أصل 600 عقد من العقود الحقيقية.

Kaihua Qin, Dawn Song, Arthur Gervais2026-05-29