🤖 machine learning

Agentic-imodels: Evolving agentic interpretability tools via autoresearch

تقدم هذه الورقة نماذج Agentic-imodels، وهو إطار عمل للبحث الذاتي يعمل على تطوير نماذج انحدار متوافقة مع scikit-learn ومُحسّنة من حيث دقة التنبؤ وقابلية التفسير الموجهة للوكلاء، مما يثبت أن النماذج المصممة لتكون "قابلة للمحاكاة" من قبل النماذج اللغوية الكبيرة تعزز بشكل كبير أداء علوم البيانات الوكيلية في المهام اللاحقة.

Chandan Singh, Yan Shuo Tan, Weijia Xu, Zelalem Gero, Weiwei Yang, Michel Galley, Jianfeng Gao2026-05-06
💻 computer science

Reproducing Complex Set-Compositional Information Retrieval

تكشف دراسة إعادة الإنتاج هذه أنه بينما تتفوق المسترجعات العصبية على الأساليب المعجمية في معيار QUEST للاستعلامات التركيبية للمجموعات المعقدة، فإنها تفشل في التعميم على معيار LIMIT+ المنضبط، مما يكشف عن اعتمادها على الاختصارات الدلالية بدلاً من استيفاء القيود الحقيقي، ويسلط الضوء على الاستقرار الفائق للأساليب الجبرية المتفرقة مع زيادة العمق التركيبي.

Vincent Degenhart, Dewi Timman, Arjen P. de Vries, Faegheh Hasibi, Mohanna Hoveyda2026-05-06
💻 computer science

MCJudgeBench: A Benchmark for Constraint-Level Judge Evaluation in Multi-Constraint Instruction Following

تقدم هذه الورقة MCJudgeBench، وهو معيار مرجعي جديد مصمم لتقييم حكام النماذج اللغوية الكبيرة (LLM) على مستوى القيود من أجل اتباع التعليمات متعددة القيود، مما يكشف أن الأداء العام للحكم لا يضمن الموثوقية عبر فئات تسميات محددة أو الاستقرار ضد الاضطرابات.

Jaeyun Lee, Junyoung Koh, Zeynel Tok, Hunar Batra, Ronald Clark2026-05-06
💻 computer science

The Counterexample Game: Iterated Conceptual Analysis and Repair in Language Models

تتقصى هذه الورقة ما إذا كان بإمكان النماذج اللغوية الحفاظ على التحليل المفاهيمي الفلسفي من خلال دورات متكررة من الأمثلة المضادة والإصلاح، حيث وجدت أنه بينما يمكنها الانخراط في هذه العملية، فإن الحلقة تعطي بسرعة عوائد متناقصة تتميز بزيادة الإطناب دون تحسن في الدقة، وميل النماذج إلى القبول المفرط للأمثلة المضادة غير الصالحة مقارنة بالمحكمين البشر.

Daniel Drucker, Kyle Mahowald2026-05-06
🤖 machine learning

Transformers with Selective Access to Early Representations

تقدم هذه الورقة SATFormer، وهو متغير من نموذج Transformer يعامل إعادة استخدام التمثيل المبكر كمسألة استرجاع عبر توظيف بوابة تعتمد على السياق للوصول الانتقائي إلى إسقاطات القيم في الطبقة الأولى، مما يحقق أداءً وكفاءة متفوقين مقارنة بطرق المتبقيات الثابتة مع الحفاظ على إنتاجية النموذج الأساسي.

Skye Gunasekaran, Téa Wright, Rui-Jie Zhu, Jason Eshraghian2026-05-06
💻 computer science

Feature-Augmented Transformers for Robust AI-Text Detection Across Domains and Generators

تُثبت هذه الورقة أن نماذج المحولات المعززة بالميزات، وتحديداً نموذج DeBERTa-v3 المعزز بميزات لغوية قائمة على الانتباه، تحقق كشفاً قوياً للنصوص المولدة بواسطة الذكاء الاصطناعي عبر مجالات ونماذج توليد متنوعة تحت بروتوكول العتبة الثابتة، متفوقة بشكل كبير على كل من بنيات المحولات السابقة والنماذج المرجعية ذات التعلم الصفري.

Mohamed Mady, Johannes Reschke, Björn Schuller2026-05-06
💻 computer science

Logical Consistency as a Bridge: Improving LLM Hallucination Detection via Label Constraint Modeling between Responses and Self-Judgments

تقترح هذه الورقة إطار عمل LaaB، وهو إطار عمل مبتكر يعمل على تحسين كشف الهلوسة في النماذج اللغوية الكبيرة من خلال سد الفجوة بين عدم اليقين العصبي الضمني والأحكام الذاتية الرمزية الصريحة عبر عملية حكم ميتا (meta-judgment) تعمل على مواءمة إشارات الرؤية المزدوجة عبر قيود الاتساق المنطقي.

Hao Mi, Qiang Sheng, Shaofei Wang, Beizhe Hu, Yifan Sun, Zhengjia Wang, Hengqi Zeng, Yang Li, Danding Wang, Juan Cao2026-05-06
💻 computer science

EQUITRIAGE: A Fairness Audit of Gender Bias in LLM-Based Emergency Department Triage

تُراجع دراسة EQUITRIAGE خمسة نماذج لغوية كبيرة في ما يقرب من 375,000 سيناريو لفرز الحالات في أقسام الطوارئ، وتكشف أن جميع النماذج تظهر تحيزاً جنسياً بمعدلات انقلاب تتجاوز 5%، مما يثبت أن مقاييس العدالة مثل التكافؤ الجماعي، والثبات المقابل للواقع، والمعايرة هي خصائص متميزة تتطلب تدقيقاً خاصاً بكل نموذج قبل النشر السريري.

Richard J. Young, Alice M. Matthews2026-05-06
💻 computer science

Rethinking Reasoning-Intensive Retrieval: Evaluating and Advancing Retrievers in Agentic Search Systems

تتناول هذه الورقة البحثية أوجه القصور في التقييم والتدريب الحاليين لعمليات الاسترجاع كثيفة الاستدلال في أنظمة البحث الوكيلية من خلال تقديم معيار BRIGHT-Pro متعدد الجوانب ومتن RTriever-Synth، اللذين يُمكّنان معاً من تطوير نموذج RTriever-4B الذي يتفوق بشكل كبير على المسترجعات الحالية عند تقييمه بموجب بروتوكولات وكيلية واقعية.

Yilun Zhao, Jinbiao Wei, Tingyu Song, Siyue Zhang, Chen Zhao, Arman Cohan2026-05-06
🤖 machine learning

Safety and accuracy follow different scaling laws in clinical large language models

تقدم الورقة إطار عمل SaFE-Scale ومعيار RadSaFE-200 لإثبات أن سلامة النماذج اللغوية الكبيرة السريرية ليست نتاجاً سلبياً لعملية التوسع، بل هي خاصية تعتمد على عملية النشر حيث تساهم الأدلة عالية الجودة بشكل كبير في تقليل الأخطاء الخطيرة، في حين تفشل عمليات الاسترجاع القياسية وزيادة الحوسبة في تكرار مكاسب السلامة هذه.

Sebastian Wind, Tri-Thien Nguyen, Jeta Sopa, Mahshad Lotfinia, Sebastian Bickelhaup, Michael Uder, Harald Köstler, Gerha (…)2026-05-06