💬 NLP

Annotator Positionality as Signal: Psychometric Weighting for Anti-Autistic Ableism Detection

تقدم هذه الورقة إطار تقييم بوزن سيكومتري يعطي الأولوية لمنظورات المقيّمين التوحديين للكشف عن كيفية قيام النماذج اللغوية الكبيرة، وبشكل متكرر، بتصنيف اللغة المستعادة خطأً على أنها متحيزة ضد ذوي الإعاقة والاعتماد على مطابقة الكلمات المفتاحية السطحية بدلاً من الفروق السياقية الدقيقة عند تقييم التحيز ضد التوحد.

Naba Rizvi, Harper Strickland, Saleha Ahmedi, Nedjma Ousidhoum2026-05-27
🤖 AI

From Static Context to Calibrated Interactive RL: Mitigating Distribution Shift in Multi-turn Dialogue with Aligned Simulator

تقترح هذه الورقة البحثية "التعلم المعزز التفاعلي المعاير" (Calibrated Interactive RL)، وهو إطار عمل موحد يخفف من حدة انزياح التوزيع التراكمي في الحوارات متعددة الأدوار من خلال مواءمة المحاكيات مع أنماط التفاعل البشري، محققاً بذلك أداءً هو الأفضل حالياً مقارنة بالسياق الثابت والنماذج المرجعية التفاعلية غير المعايرة.

Xiaohua Wang, Jiakang Yuan, Zisu Huang, Muzhao Tian, Changze Lv, Kaitao Song, Tao Chen, Xiaoqing Zheng2026-05-27
📊 statistics

Confounder Detection via Treatment Intent: A New Observational Study Design

تقدم هذه الورقة تصميم دراسة رصدية مبتكر يُسمى "كشف المربكات عبر نية العلاج"، والذي يستفيد من مقارنات الخبراء لأزواج المرضى المتطابقين لاستنباط المربكات غير المرصودة، ويتحقق من فعاليته في تحديد التحيزات الخفية في السجلات الصحية الإلكترونية لوحدات العناية المركزة باستخدام الملاحظات النصية السريرية كبديل لمعرفة الأطباء.

Drago Plecko, Patrik Okanovic, Torsten Hoefler, Elias Bareinboim2026-05-27
🤖 machine learning

When Does Deep RL Beat Calibrated Baselines? A Benchmark Study on Adaptive Resource Control

تقدم هذه الورقة RLScale-Bench، وهو معيار قابل للتكرار يوضح أن أداة التوسع التلقائي القائمة على القواعد والمعايرة بشكل صحيح تتفوق باستمرار على ست خوارزميات رئيسية للتعلم التعزيزي العميق في كفاءة التكلفة عبر أعباء عمل متنوعة، مما يتحدى الافتراض بأن التعلم التعزيزي العميق متفوق بطبيعته في التحكم التكيفي في الموارد.

Guilin Zhang, Chuanyi Sun, Kai Zhao, Shahryar Sarkani, John Fossaceca2026-05-27
🤖 AI

Uniboost: Global Coordination with Value Alignment for Fair and Efficient Traffic Allocation

يُعد Uniboost إطار عمل موحداً لتخصيص حركة المرور لأنظمة التوصية واسعة النطاق، حيث يعزز العدالة والكفاءة من خلال تقديم آلية محاذاة القيمة اللاحقة لمعايرة درجات النموذج مع الدلالات التجارية، ونموذج تعزيز خطي مستقل لفصل مخططات الوزن المعقدة.

Ge Fan, Nan Zhao, Kai Meng, Cong Luo, Yang Fu, Huiping Chu, Jialin Liu, Yuning Jiang, Bo Zheng2026-05-27
💬 NLP

LURE: Live-Usage Replay Evaluations for Reducing Evaluation Awareness

تقدم الورقة البحثية LURE، وهي طريقة تعزز صلاحية معايير سلامة الذكاء الاصطناعي من خلال بناء تقييمات واقعية شبيهة ببيئات النشر عبر إعادة تشغيل مسارات التفاعل الوكيلية، مما يخفف من مشكلة تغيير النماذج لسلوكها بسبب الوعي بالتقييم.

Igor Ivanov, David Demitri Africa2026-05-27
🤖 AI

Cross-scale Aligned Supervision for Training GANs

تقدم هذه الورقة البحثية نموذج CAT (المحول المتوافق عبر المقاييس)، وهو إطار عمل جديد لتدريب شبكات الخصومة التوليدية (GAN) يعالج مشكلة عدم محاذاة المسار عبر المقاييس من خلال إضافة تنظيم الاتساق لمحاذاة المخرجات الوسيطة مع الصورة النهائية، محققاً أداءً رائدًا في الاستدلال بخطوة واحدة على مجموعة بيانات ImageNet-256.

Sangeek Hyun, MinKyu Lee, Jae-Pil Heo2026-05-27
💬 NLP

Verus-SpecGym: An Agentic Environment for Evaluating Specification Autoformalization

تقدم هذه الورقة Verus-SpecGym، وهي بيئة ومعيار تقييمي (benchmark) لوكيل ذكاء اصطناعي لتقييم قدرة النماذج اللغوية الكبيرة على ترجمة المشكلات البرمجية غير الرسمية إلى مواصفات رسمية دقيقة للتحقق من لغة Rust، كاشفةً أنه في حين تُظهر النماذج الرائدة بوادر واعدة، إلا أن مخرجاتها تظل هشة وعرضة لأخطاء دقيقة غالباً ما تغفل عنها أدوات التقييم القياسية المعتمدة على النماذج اللغوية الكبيرة.

Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis Limperg, Cedric Flamant, Kanna Shimizu, Bryan Parn (…)2026-05-27
💬 NLP

Towards Error-Free EHRs: Reasoning-Intensive Consistency Verification Between Clinical Notes and Structured Tables in Electronic Health Records

تقدم هذه الورقة EHR-ReasonCon، وهو معيار جديد مُصنف من قبل خبراء للتحقق من الاتساق المكثف في الاستدلال بين الملاحظات السريرية والجداول المهيكلة في السجلات الصحية الإلكترونية، إلى جانب EHR-Inspector، وهو إطار عمل قائم على النماذج اللغوية الكبيرة يحقق أداءً رائدًا من خلال الاستفادة من الاستدلال الزمني وأدوات استكشاف الجداول للتغلب على قيود المطابقة السطحية.

Yeonsu Kwon, Jiho Kim, Junseong Choi, Paloma Rabaey, Minseo Kim, Sujeong Im, Jeewon Yang, Jun-Min Lee, Sangji Lee, Jiwon (…)2026-05-27
🤖 machine learning

Diffuse to Detect: Generative Diffusion Models for Unsupervised IC Anomaly Detection

تقترح هذه الورقة أول إطار عمل غير خاضع للإشراف للكشف عن الشذوذ في الدوائر المتكاملة، والذي يستفيد من محول الانتشار (Diffusion Transformer) على بيانات اختبار مضغوطة ومجزأة (tokenized) لتحقيق أداء يضاهي أحدث ما توصل إليه العلم في تحديد العيوب الكامنة النادرة دون الحاجة إلى أمثلة مصنفة أو هندسة ميزات يدوية.

Yuxuan Yin, Chen He, Todd Jacobs, Jialei He, Boxun Xu, Robert Jin, Peng Li2026-05-27