💬 NLP

Institutional Prestige as Geographic Bias in Large Language Models: Evidence from Three Factorial Experiments with Bootstrap Confidence Intervals

من خلال ثلاث تجارب عاملية تضمنت 4,320 استدعاءً لواجهة برمجة التطبيقات عبر أربعة نماذج لغوية كبيرة، تُظهر هذه الدراسة أن الهيبة المؤسسية ومكان النشر يمارسان تأثيرات تمييزية أقوى بكثير على تقييمات المرشحين من العرق المرتبط باسم المتقدم أو الأصل الجغرافي، مع وجود "تأثير إنقاذ" يُظهر أن المنشورات ذات التأثير العالي يمكن أن تعوض بشكل غير متناسب انخفاض الهيبة المؤسسية.

Maikel Leyva-Vazquez, Florentin Smarandache2026-08-20
💬 NLP

Same Facts, Different Updates: Inference Setup Shapes LLM Behavior in Medical Allocation

تُظهر هذه الورقة أن النماذج اللغوية الكبيرة تُبدي تحولات غير متسقة وتعتمد على السياق في قرارات تخصيص الموارد الطبية عند تقديم معلومات جديدة عن المريض، مما يسلط الضوء على الحاجة الماسة إلى هندسة سياقية دقيقة ودراسات سلوكية قبل نشر النماذج اللغوية الكبيرة في عمليات اتخاذ القرار الحساسة.

Spencer Gibson, Tyler Crosse, Magnus Saebo, Achyutha Menon, Eyon Jang, Diogo Cruz2026-08-20
🤖 AI

Emergence of Agentic AI: A Review on Evolution, Background, Working Principles, Applications, Adoption Factors, and Future Research Directions

تتناول هذه المراجعة المنهجية بشكل شامل تطور الذكاء الاصطناعي الوكيل (Agentic AI) وبنيته وتطبيقاته وعوامل تبنيه، مع تحديد التحديات الراهنة واقتراح إطار عمل لتوجهات البحوث المستقبلية لتوجيه الباحثين والممارسين.

AKM Bahalul Haque, Al Amin Islam Ridoy, Mohammad Rayhan, Ivan Porres2026-08-20
💻 computer science

Global Index on Responsible AI 2026 : Conceptual Framework and Methodology

تحدد هذه الورقة المنهجية الخاصة بالطبعة الثانية من المؤشر العالمي للذكاء الاصطناعي المسؤول (GIRAI)، والذي يقيم الحوكمة الوطنية عبر خمسة أبعاد موضوعية باستخدام إطار عمل مرجح مكون من 38 مؤشراً ونظام عقوبات للذكاء الاصطناعي ذي المخاطر غير المقبولة، بناءً على بيانات جُمعت من 135 دولة لتسهيل المقارنة بين الدول وتحديد فجوات التنفيذ.

Fola Adeleke, Rachel Adams, Ayantola Alayande, Daniela Benavente, Ana Florido, Nicolás Grossman, Leah Junck2026-08-20
🤖 AI

Safety Alignment Illusion: The Cross-Lingual Safety Gap in LLMs

تقدم هذه الورقة البحثية INCLUDE، وهو معيار متعدد اللغات لتقييم التحيزات الاجتماعية والثقافية المتمحورة حول الهند عبر ست لغات، مما يكشف أن محاذاة السلامة الحالية المتمحورة حول اللغة الإنجليزية في النماذج اللغوية الكبيرة تخلق فجوة سلامة حرجة عابرة للغات، حيث تظهر المخرجات غير الإنجليزية، لا سيما باللغة البنغالية وفي النماذج مغلقة المصدر، تحيزاً أعلى بكثير من نظيراتها الإنجليزية.

Namya Bhatnagar2026-08-20
🤖 AI

Improving Rural Medication Safety with AI: A Scoping Review

تُظهر هذه المراجعة النطاقية لاثنتي عشرة دراسة أن تقنيات الذكاء الاصطناعي، مثل تعلم الآلة وأنظمة دعم القرار السريري، تقلل بشكل كبير من الأخطاء الدوائية وتعزز السلامة عبر جميع مراحل الرعاية الصحية الريفية، على الرغم من مواجهة تحديات تتعلق بالبنية التحتية والتمويل وتدريب الموظفين.

Jeong-ah Kim, Muhammad Ashad Kabir, Daniel Terry, Maryam Rouhi2026-08-20
🤖 AI

FraudBench: Stress-Testing Policy-Grounded Banking Agents Against Adaptive Fraud

تقدم هذه الورقة FraudBench، وهو معيار اختبار تنفيذي مبتكر صُمم لاختبار قدرة الوكلاء المصرفيين القائمين على السياسات تحت الضغط في مواجهة سيناريوهات احتيال تكيفية ومعتمدة على التاريخ، وذلك عبر محاكاة التفاعلات الديناميكية بين الوكلاء والمتصلين ذوي النوايا الخبيثة عبر حالات حسابية متغيرة ووثائق سياسات داخلية.

Dheeraj Mohandas Pai, Lu Xian2026-08-20
💻 computer science

Entropy-Constrained Adaptive Stochastic Quantization

تقدم هذه الورقة إطار عمل "الكمية العشوائية التكيفية المقيدة بالإنتروبيا" (ECASQ)، وهو إطار عمل مبتكر يعمل على تحسين قيم الكمية التكيفية بشكل مشترك لتقليل متوسط مربع الخطأ تحت قيود الإنتروبيا وعدم الانحياز، مما يوفر حلاً أمثلاً للبرمجة الديناميكية وتقريباً عالي الكفاءة وصديقاً لوحدات معالجة الرسومات مع ضمانات نظرية قوية.

Ran Ben Basat, Yaniv Ben-Itzhak, Michael Mitzenmacher, Shay Vargaftik2026-08-20
💻 computer science

TokenPowerSandbox: Evidence-Gated CPU-First Screening for Energy-Aware LLM Serving

يُعد TokenPowerSandbox إطار عمل للفحص القائم على الأدلة والأولوية للمعالجة المركزية (CPU-first)، والذي يجمع بين الإسقاط القابل للتفسير والتحري المحدود عبر وحدة معالجة الرسومات (GPU) لتحقيق دقة عالية في التنبؤ بالطاقة لخدمة النماذج اللغوية الكبيرة (LLM)، مع إظهار حدود نماذج الطاقة صراحةً في اعتماد أداء زمن الاستجابة.

Chenxu Niu2026-08-20
💬 NLP

When Do LLMs Actually Help? Evaluating LLMs as Data Quality Annotators

تُقيّم هذه الدراسة النماذج اللغوية الكبيرة (LLMs) كأدوات لتصنيف جودة البيانات، وتجد أنها بينما لا تقدم ميزة تذكر مقارنة بالنماذج المرجعية البسيطة القائمة على القواعد في المهام التي تعتمد على إشارات معجمية قوية مثل مطابقة الكيانات، إلا أنها تتفوق بشكل كبير على تلك النماذج المرجعية في المهام التي تتطلب معرفة خلفية مثل اكتشاف الخطأ في تسمية العلامات التجارية، مع إظهار اتساق عالٍ عبر عمليات التشغيل المتكررة.

Praphulla Lal Shrestha2026-08-20