🤖 AI

No Universal Signal Predicts Sample-Level LLM Regression under Version Updates

تستقصي هذه الورقة كيفية التنبؤ بتراجعات الأداء على مستوى العينات في النماذج اللغوية الكبيرة المحدثة من خلال مقارنة الإشارات أحادية النموذج والإشارات عبر الإصدارات عبر ستة معايير، لتجد أنه لا توجد إشارة واحدة فعالة عالمياً، ولكن يمكن للأنماط المعتمدة على المهام أن توجه الممارسين في اختيار الإشارات المناسبة لتنفيذ آلية تراجع انتقائية تقوم بتوجيه العينات عالية المخاطر إلى إصدارات النماذج السابقة.

Jia Sheng, Yiwei Lu2026-08-17
🤖 AI

Evaluating Agentic Learning Harness Capabilities Without Labels via the Scaling Hypothesis

تقترح هذه الورقة وتتحقق من إطار عمل للتقييم الخالي من الملصقات (label-free) لأدوات التعلم المستمر الوكيلية (agentic continual learning) في مجال الأمن السيبراني، مبرهنةً على أن قياس تقارب نموذج الطالب نحو نموذج معلم أقوى عبر تصحيحات متفرقة يعمل كبديل موثوق للتحسن الحقيقي في الأداء عند عدم توفر معايير مرجعية مصنفة.

Aryan Luthra, Kshitij Jain, Siddharth Arya, Bobby Filar, Anna Bertiger2026-08-17
🤖 AI

SemPlan: Benchmarking Structured Semantic Planning for LLM-Based Queries over Enterprise Data

يُقيّم معيار SemPlan أربعة نهج معمارية لترجمة استعلامات اللغة الطبيعية إلى عمليات بيانات مؤسسية قابلة للتنفيذ، كاشفاً أنه في حين يحقق التخطيط الدلالي المهيكل (A3) أعلى درجة من صحة الإجابة، لا يوجد معمار واحد يحسن جميع المقاييس عالمياً، حيث يُظهر كل منها مقايضات متميزة بين الدقة، والامتثال للسياسات، والتكلفة، والاستقرار.

Bruno Santos Teixeira2026-08-17
🤖 AI

How Compliant is Sepsis Treatment? An Expert-Guided Neuro-symbolic Pipeline for Generating Clinical Compliance Insights

تقدم هذه الورقة مساراً عصبياً-رمزياً موجهاً من قبل الخبراء يجمع بين النماذج اللغوية الكبيرة للتقييس الدلالي ونظام استدلال ضبابي من نوع "سوغينو" لتقييم الامتثال السريري لبروتوكولات حملة نجاة من الإنتان، مما يكشف عن فجوات كبيرة في توقيت المضادات الحيوية ومراقبة اللاكتات عبر 2,438 حالة إنتان في مجموعة بيانات MIMIC-IV.

Himanshu Tripathi, Kaushik Roy, Subash Neupane, Shahram Rahimi2026-08-17
📈 economics

Algorithm Design and Physician Liability

تحلل هذه الورقة كيف تؤثر قواعد المسؤولية القانونية الأمريكية المتعلقة بالتفاوت الخوارزمي على خيارات التصميم لدى شركات الذكاء الاصطناعي وسلوكيات الاعتماد لدى الأطباء، كاشفةً أنه في حين يمكن لمثل هذه القواعد أن تقلل في البداية من استخدام الذكاء الاصطناعي للمرضى المحرومين، إلا أنها قد تحفز الشركات في نهاية المطاف على تحسين العدالة، في حين أن فرض دقة متساوية عبر المجموعات يمكن أن يضر بشكل مفارق بكلتا الفئتين من خلال تشويه حوافز الاستثمار والاستخدام.

Shujie Luan, Shubhranshu Singh, Tinglong Dai2026-08-17
🤖 AI

Your Probabilistic JEPA Is Secretly a Hidden Markov Model: A State-Space Interpretation of Joint-Embedding Predictive Learning

تثبت هذه الورقة أن نماذج التضمين المشترك الاحتمالية (JEPA) تكافئ جوهرياً نماذج ماركوف المخفية من خلال إثبات بنيتها الحسابية المشتركة المتمثلة في الاستدلال، والانتشار، والانبعاث، وتقدم متغير "ماركوف-سلسلة JEPA" لتوفير تفسير مبدئي لفضاء الحالة مع اتساق دقيق متعدد الآفاق.

Yongchao Huang2026-08-17
🤖 AI

Reward Machines for Signal Temporal Logic

تقترح هذه الورقة نهجاً جديداً قائماً على الأوتوماتا يقوم ببناء أوتوماتا متبادلة زمنية من مواصفات المنطق الزمني للإشارات لتوليد مكافآت ماركوفية لتعلم التعزيز، مما يتغلب بفعالية على مشكلات توسع فضاء الحالة التي تعاني منها الطرق التقليدية القائمة على المتانة ويحقق معدلات أعلى في إرضاء السياسة.

Alper Kamil Bozkurt, Shangtong Zhang, Yuichi Motai2026-08-17
🤖 AI

Exploring ESC Winners with Nested Diagrams

تقدم هذه الورقة ConceptFlow، وهي مكتبة بلغة بايثون لتحليل المفاهيم الصورية (Formal Concept Analysis) تقوم بإنشاء مخططات خطية متداخلة وتفاعلية للكشف عن العلاقة بين أنماط التصويت والخصائص الموسيقية في الفائزين بمسابقة يوروفيجن للأغنية من عام 1975 إلى عام 2025.

Anurag Sharma, Marcel Nöhre, Gerd Stumme2026-08-17
🤖 machine learning

From BERT to Frontier Agents: Eight Years of Language-Model Progress, the Collapse of the Capability-Cost Curve, and the Rise of Task-Targeted Models

تستعرض هذه الورقة التطور الممتد لثماني سنوات للنماذج اللغوية من "BERT" إلى الوكلاء المتخصصين في الطليعة بحلول عام 2026، مسلطة الضوء على تحسن سنوي بمقدار ستة أضعاف في قدرات البرمجة، وانهيار دراماتيكي في تكاليف الاستدلال كما يجسده نموذج "GPT 5.6 Luna" منخفض التكلفة، والتحول نحو النماذج المستهدفة للمهام والتي تتفوق في مجالات محددة مثل برمجة الواجهات الأمامية، وإدارة المستودعات، وعمليات الطرفية.

Pranav Kumar Kaliaperumal2026-08-17
🤖 AI

Learning to Assemble Novel Structures with Unfamiliar Parts under Semantic Constraints

تقدم هذه الورقة بنية عصبية رمزية تمكن الوكيل من تعلم وتجميع هياكل جديدة بكفاءة تحت قيود دلالية غير مسبوقة، وذلك من خلال دمج التواصل باللغة الطبيعية لتلك القيود مع الملاحظات البصرية وعروض المهام.

Jonghyuk Park, Alex Lascarides, Subramanian Ramamoorthy2026-08-17