📊 statistics

Distributionally Robust Transfer Learning with Structurally Missing Covariates, with Application to Cross-National Cardiac Arrest Prediction

تقدم هذه الورقة DRUM، وهو إطار عمل للتعلم الانتقالي المتين توزيعياً يعمل على تحسين أداء التنبؤ في الحالة الأسوأ للنماذج السريرية المنشورة في مجموعات سكانية مستهدفة ذات متغيرات مصاحبة مفقودة هيكلياً ولا توجد لها نتائج مصنفة، مما يظهر دقة معايرة وتصنيف متفوقة في التنبؤ بتوقف القلب عبر الدول مقارنة بالطرق الحالية.

Siqi Li, Chuan Hong, Ziye Tian, Benjamin Sieu-Hon Leong, Koshi Nakagawa, Hideharu Tanaka, Sang Do Shin, Khuong Quoc Dai (…)2026-05-26
🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

تقدم هذه الورقة دراسة تجريبية لـ 57 من أدوات تقييم تعلم الآلة التي تحدد مرحلة التوصيف باعتبارها المصدر الرئيسي للتحديات التشغيلية، وتصنف 16,560 مشكلة حسب السبب الجذري لتكشف أن الميزات غير المنفذة، وفجوات التوثيق، ونقص التحقق من المدخلات تشكل أكثر من 60% من المشكلات، وتؤسس لقاعدة معاملة هندسة التقييم كفرع متميز من فروع هندسة البرمجيات.

Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan2026-05-26
🤖 machine learning

Agent-ToM: Learning to Monitor Autonomous LLM Agents via Theory-of-Mind Reasoning

تقدم الورقة البحثية Agent-ToM، وهو إطار عمل للتعلم من أجل المراقبة يستفيد من استدلال نظرية العقل ومسار (الاستنتاج-التحقق-التنقيح) للكشف عن السلوكيات الخبيثة المستترة في الوكلاء المستقلين القائمين على النماذج اللغوية الكبيرة عبر استنتاج المعتقدات والنوايا الخفية، متفوقاً بذلك على النماذج المرجعية الحالية المتطورة في مجال المراقبة.

Nesreen K. Ahmed, Nima Nafisi2026-05-26
💻 computer science

Identifying and Mitigating Systemic Measurement Bias in Production LLM Inference Benchmarks

تحدد هذه الورقة أن أدوات القياس المرجعي التي تعتمد على عملية واحدة وتقنية asyncio تُدخل تحيزاً نظامياً في قياسات تقييم النماذج اللغوية الكبيرة (LLM) في بيئات الإنتاج بسبب اختناقات في طوابير الانتظار من جهة العميل ناتجة عن قفل المفسر العالمي (GIL) في لغة بايثون، وتقترح إطار عمل متعدد العمليات إلى جانب مقياس جديد يُسمى NTPOT لتمكين التوصيف الدقيق للأداء عالي التزامن.

Ashok Chandrasekar, Jason Kramberger2026-05-26
💻 computer science

Beyond Final Answers: Auditing Trajectory-Level Hallucinations in Multi-Agent Industrial Workflows

تقدم هذه الورقة Trajel، وهو مجموعة بيانات وإطار تقييم يدقق في الهلوسات على مستوى المسار في تدفقات العمل الصناعية متعددة الوكلاء من خلال تصنيف خمسة أنواع متميزة من الإخفاقات، مما يثبت أن المعايير المرجعية الحالية تغفل الأخطاء الوسيطة الحرجة وأن الكشف القائم على التصنيف والواعي للمسار ضروري لنشر الوكلاء بشكل أكثر أماناً.

Harshada Badave, Santosh Borse, Andrea Gomez, Harshitha Narahari, Sara Carter, Vishwa Bhatt, Aishani Rachakonda, Shuxin (…)2026-05-26
💻 computer science

GIBLy: Improving 3D Semantic Segmentation through an Architecture-Agnostic Lightweight Geometric Inductive Bias Layer

تقدم الورقة البحثية GIBLy، وهي طبقة خفيفة الوزن ومستقلة عن البنية الهندسية، تدمج الأولويات الهندسية القابلة للتعلم في نماذج التجزئة ثلاثية الأبعاد لتحسين الأداء والقدرة على التعميم بشكل كبير مع حد أدنى من العبء الحسابي.

Diogo Lavado, Alessandra Micheletti, Clàudia Soares2026-05-26
💻 computer science

Improving Labeling Consistency with Detailed Constitutional Definitions and AI-Driven Evaluation

تقترح هذه الورقة سير عمل مدفوعاً بالذكاء الاصطناعي يستخدم النماذج اللغوية الكبيرة الرائدة لإنشاء "دساتير" مفصلة تغطي الحالات الحدية لفئات الإشراف على المحتوى، مما يثبت أن هذا النهج يتفوق بشكل كبير على الملحظين البشريين في اتساق ودقة التصنيف مع تقليل الخلاف بين النماذج بمقدار يصل إلى 57 ضعفاً.

Konstantin Berlin, Adam Swanda2026-05-26
💻 computer science

Safety-Oriented Routing Analysis of Mixtral MoE Under Benign and Harmful Prompts

تحلل هذه الورقة سلوك التوجيه لنموذج Mixtral 8x7B-Instruct تحت تأثير المطالبات الحميدة والضارة، كاشفةً أن تنشيط الخبراء المرتبط بالسلامة هو تنشيط دقيق، ومعتمد على العمق، وموزع بدلاً من أن يهيمن عليه مجموعة ثابتة من الخبراء، مع إثبات أن التدخلات القائمة على التدرج أكثر فعالية من تلك القائمة على التنشيط في تقليل الاستجابات الضارة.

Md Nurul Absar Siddiky2026-05-26
💻 computer science

ChaosBench-Logic v2: Evaluating LLM Logical Reasoning over Dynamical Systems at Scale

تقدم الورقة البحثية ChaosBench-Logic v2، وهو معيار واسع النطاق وبروتوكول تقييم CARE المصمم للكشف عن إخفاقات الاستدلال المنطقي الحرجة في النماذج اللغوية الكبيرة فيما يتعلق بالأنظمة الديناميكية، حيث وجدت أنه بينما تؤدي النماذج بشكل متوسط في الاستنتاج الصوري، فإنها تعاني بشكل كبير في انتقالات النظام وتظهر ارتباطاً عكسياً منهجياً في أسئلة التفرع.

Noel Thomas2026-05-26
🤖 AI

Adaptive Human-AI Coordination via Hierarchical Action Disentanglement

تقترح هذه الورقة البحثية "فك الارتباط الجوهري للأفعال" (IAD)، وهو إطار عمل للتعلم التعزيزي الهرمي العميق يستخدم المكافآت الجوهرية لتعلم تسلسلات أفعال متميزة ومدركة للشريك، مما يتيح تنسيقاً قوياً وتكيفياً بين الإنسان والذكاء الاصطناعي عبر شركاء متنوعين وغير مرئيين في مجال Overcooked-AI.

Adnan Ahmad, Bahareh Nakisa, Mohammad Naim Rastgoo2026-05-26