💬 NLP

Evaluation Awareness in Language Models Has Limited Effect on Behaviour

تُظهر هذه الدراسة أن الوعي بالتقييم اللفظي في نماذج الاستدلال الكبيرة له تأثير ضئيل على سلوكها الفعلي عبر اختبارات الأمان والمواءمة والاستدلال، مما يشير إلى أن المعدلات العالية لهذا الوعي لا ينبغي تفسيرها تلقائياً كدليل على التلاعب الاستراتيجي أو التلاعب بالمواءمة.

Amelie Knecht, Lucas Florin, Thilo Hagendorff2026-05-08✓ Author reviewed
📊 statistics

Tuning Derivatives for Causal Fairness in Machine Learning

تقدم هذه الورقة إطار عمل جديداً للعدالة السببية مصمماً خصيصاً للسمات المحمية المستمرة من خلال صياغة التكافؤ الإحصائي والتنبئي عبر المشتقات الجزئية المحددة بالمسار، مما يتيح بناء متنبئات عادلة توازن بين الاستقلال عن المسارات التمييزية والحفاظ على التأثيرات التجارية المشروعة.

Filip Edström, Guilherme W. F. Barros, Tetiana Gorbach, Xavier de Luna2026-05-08
💬 NLP

Who and What? Using Linguistic Features and Annotator Characteristics to Analyze Annotation Variation

تقدم هذه الورقة أول تحليل واسع النطاق لأربع مجموعات بيانات للكشف عن اللغة الضارة لإثبات أن التفاعلات بين خصائص المقيّمين والخصائص اللغوية تُعد حاسمة لفهم تباين التوسيم، مع الكشف في الوقت ذاته عن أن أنماط التأثير تختلف بشكل كبير عبر مجموعات البيانات، مما يستوجب الحذر من التعميمات الواسعة.

Maximilian Maurer, Maximilian Linde, Gabriella Lapesa2026-05-08
🤖 machine learning

Gaming the Metric, Not the Harm: Certifying Safety Audits against Strategic Platform Manipulation

تُثبت هذه الورقة أن مقاييس السلامة القياسية قابلة للتلاعب بطبيعتها من قِبل المنصات الاستراتيجية التي تسعى لتحسين الدرجات بدلاً من تقليل الضرر الفعلي، وتقترح طريقة اعتماد "الغلاف الدلالي" التي تظل صامدة أمام هذا التلاعب عبر تعيين أسوأ درجة ممكنة ضمن الفئة المتكافئة دلالياً لكل متغير محتوى.

Florian A. D. Burnat, Brittany I. Davidson2026-05-08
🤖 machine learning

A Benchmark for Strategic Auditee Gaming Under Continuous Compliance Monitoring

تقدم هذه الورقة معياراً وإطاراً رسمياً لتحليل التلاعب الاستراتيجي من جانب الجهات الخاضعة للتدقيق في ظل المراقبة المستمرة للامتثال، مما يكشف عن القيود المتأصلة في تصميمات التدقيق الثابتة ويوضح كيف يمكن للاستراتيجيات التكيفية استغلال الفجوات الزمنية في التغطية ودقة التفاصيل.

Florian A. D. Burnat, Brittany I. Davidson2026-05-08
📈 economics

Scaling the Queue: Reinforcement Learning for Equitable Call Classification Capacity in NYC Municipal Complaint Systems

تقترح هذه الورقة إطار عمل للتعلم المعزز متمحور حول العدالة لأنظمة الشكاوى البلدية في مدينة نيويورك، يعمل كموجه ذكي لتحسين قدرة تصنيف المكالمات عبر ستة مجالات لوزارة المباني من خلال تعظيم الإنتاجية، وتقليل الأخطاء، والحد بفعالية من التفاوتات التاريخية في الخدمة القائمة على العرق والدخل.

Irene Aldridge, Ellie Bae, Siddhesh Darak, Nicholas Donat, Akhil Fernando-Bell, Bella Ge, Nicholas Goguen-Compagnoni, Is (…)2026-05-08
💬 NLP

Algospeak, Hiding in the Open: The Trade-off Between Legible Meaning and Detection Avoidance

تقدم هذه الورقة إطاراً رسمياً ومجموعة بيانات لتحليل المقايضة بين قابلية الكشف وقابلية الاستيعاب في استراتيجيات التهرب بـ "لغة الخوارزميات" (Algospeak)، مع تحديد عتبة "تعديل الفهم بالأغلبية" لقياس مدى تأثير التغييرات اللغوية على كل من الفهم البشري وكشف الذكاء الاصطناي.

Jan Fillies, Ronald E. Robertson, Jeffrey Hancock2026-05-08
💻 computer science

What is Human in Judgment? Comparing Automation Bias and Algorithm Aversion Between the United States Military Academy and the General Public

تقارن هذه الدراسة بين الانحياز للأتمتة والنفور من الخوارزميات بين طلاب الأكاديمية العسكرية بالولايات المتحدة والجمهور العام، وتجد أن التعليم العسكري يعزز ثقةً أكثر دقة في أنظمة دعم القرار القائمة على الذكاء الاصطناعي، مما قد يقلل من مخاطر الخطأ وسوء التقدير في النزاعات المستقبلية.

Lauren Kahn, Michael C. Horowitz, Laura Resnick Samotin2026-05-07
🤖 machine learning

Investigating Trustworthiness of Nonparametric Deep Survival Models for Alzheimer's Disease Progression Analysis

تتناول هذه المقالة مدى موثوقية نماذج البقاء العميق غير المعلمية لتطور مرض الزهايمر من خلال كشف التحيزات الكبيرة ضد الفئات المهمشة واقتراح مقياسين جديدين للعدالة لقياس ومعالجة حالات عدم المساواة هذه.

Jacob Thrasher, Kaitlyn Heintzelman, Peter Martone, David Kotlowski, Binod Bhattarai, Donald Adjeroh, Prashnna Gyawali2026-05-07