💬 NLP

In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores

تجادل هذه الورقة بأن عدالة النماذج اللغوية الكبيرة يجب أن تُقيّم من خلال سلوك المحادثة متعدد الوكلاء في سياقه الطبيعي بدلاً من اختبارات المعايير القياسية، مقدمةً إطار عمل "MAC-Fairness" للكشف عن بصمات سلوكية مستقرة وخاصة بكل نموذج، والتي تحجبها عدم الموثوقية الهيكلية للاختبارات القائمة على الأوامر التقليدية.

Zeyu Tang, Sang T. Truong, Deonna Owens, Shreyas Sharma, Yibo Jacky Zhang, Brando Miranda, Sanmi Koyejo2026-05-14
💻 computer science

Career Mobility of Planning Alumni in the United States: Evidence from Professional Profile Data using Large Language Models

تحلل هذه الدراسة أكثر من 130,000 من خريجي التخطيط في الولايات المتحدة باستخدام نماذج لغوية كبيرة لاستخراج بيانات "لينكد إن"، كاشفةً أن أنماط المسار المهني غير المحدود، والتحركات الجانبية الاستراتيجية، والتنقل الجغرافي، والشبكات المهنية القوية هي المحركات الرئيسية للارتقاء الوظيفي، بينما تلعب المهارات التقنية وإتقان الذكاء الاصطناعي أدواراً أكثر محدودية في التقدم للمناصب العليا.

Yan Wang, Su Jeong Jo2026-05-14
💻 computer science

No One Knows the State of the Art in Geospatial Foundation Models

تجادل هذه الورقة بأن مجتمع النماذج التأسيسية الجيومكانية (GFM) يفتقر إلى معيار واضح لأفضل الحالات الراهنة بسبب عدم اتساق معايير التقييم والبيانات وإصدارات النماذج، وتقترح ستة توقعات ملموسة لإرساء المعايير المجتمعية اللازمة للمقارنة الهادفة والتقدم.

Isaac Corley, Nils Lehmann, Caleb Robinson, Gabriel Tseng, Anthony Fuller, Hamed Alemohammad, Evan Shelhamer, Jennifer M (…)2026-05-14
🤖 machine learning

Do Fair Models Reason Fairly? Counterfactual Explanation Consistency for Procedural Fairness in Credit Decisions

تقدم هذه الورقة إطار عمل "اتساق التفسير المضاد للواقع" (CEC)، المصمم للكشف عن "التحيز الإجرائي الخفي" في نماذج قرارات الائتمان والتخفيف من حدته، وذلك من خلال ضمان حصول الأفراد ذوي النتائج المتشابهة على تفسيرات متسقة، وهو بُعد حاسم من أبعاد العدالة الذي تغفله المقاييس القياسية القائمة على النتائج.

Gideon Popoola, John Sheppard2026-05-14
💬 NLP

Simulating Students or Sycophantic Problem Solving? On Misconception Faithfulness of LLM Simulators

تكشف هذه الورقة أن محاكيات الطلاب الحالية القائمة على النماذج اللغوية الكبيرة تفشل في الحفاظ على مفاهيم خاطئة متماسكة أثناء التفاعلات، حيث تظهر بدلاً من ذلك نزعة "تملقية" لتصحيح الإجابات بشكل عشوائي بغض النظر عن صلة التغذية الراجعة، لكنها تثبت أن إخلاص هذه المفاهيم الخاطئة يمكن تحسينه بشكل كبير من خلال مسار تدريب لاحق متخصص يتضمن الضبط الدقيق الخاضع للإشراف والتعلم التعزيزي.

Heejin Do, Shashank Sonkar, Mrinmaya Sachan2026-05-14
🔬 physics

A Framework for institutional change in the age of AI

تقترح هذه الورقة إطار عمل جديد للتغيير المؤسسي في التعليم العالي لمجالات العلوم والتكنولوجيا والهندسة والرياضيات (STEM) يعالج التحديات الفريدة للذكاء الاصطناوي التوليدي من خلال الانتقال من نماذج الاعتماد التقليدية إلى نهج مرن يرتكز على ستة أبعاد — تشمل الأدوات والأشخاص — ويؤكد على الاستقصاء المحلي، والتركيز التربوي، والشراكة التعاونية للتنقل عبر حالة عدم اليقين الحقيقية.

David Perl-Nussbaum, Noah D. Finkelstein2026-05-14
💬 NLP

Mechanism Plausibility in Generative Agent-Based Modeling

تقدم هذه الورقة "مقياس المعقولية الآلية"، وهو إطار عمل مكون من أربعة مستويات يميز بين الكفاية التوليدية للنموذج ومعقوليته الآلية من خلال دمج محاكاة الوكلاء القائمة على النماذج اللغوية الكبيرة مع فلسفة العلوم لتقييم مدى قدرة هذه النماذج على تفسير الأنشطة المنظمة التي تنتج الظواهر الاجتماعية بشكل أفضل.

Patrick Zhao, David Huu Pham, Nicholas Vincent2026-05-14
📊 statistics

RISED: A Pre-Deployment Safety Evaluation Framework for Clinical AI Decision-Support Systems

تقدم الورقة البحثية إطار عمل RISED، وهو إطار شامل لسلامة ما قبل النشر يقيم أنظمة الذكاء الاصطناعي السريري عبر خمسة أبعاد هي: الموثوقية، والشمولية، والحساسية، والعدالة، وقابلية النشر، وذلك للكشف عن الإخفاقات الحرجة التي تغفل عنها مقاييس الدقة الإجمالية وضمان نشر قوي وعادل وممكن تشغيلياً.

Rohith Reddy Bellibatlu2026-05-14
💬 NLP

When Do LLMs Generate Realistic Social Networks? A Multi-Dimensional Study of Culture, Language, Scale, and Method

تُظهر هذه الدراسة أن النماذج اللغوية الكبيرة تُنشئ شبكات اجتماعية واقعية تتشكل خصائصها البنيوية وتحيزاتها الديموغرافية بشكل كبير من خلال تصميم الأوامر، والتأطير الثقافي، واللغة، وحجم النموذج، مما يكشف أن هذه الخيارات التقنية تعمل كمتغيرات سوسيولوجية جوهرية بدلاً من كونها مجرد تفاصيل تنفيذية.

Sai Hemanth Kilaru, Sriram Theerdh Manikyala, Raghav Upadhyay, Sri Sai Kumar Ramavath, Srivika Nunavathu, Dalal Alharthi2026-05-14
💻 computer science

Not All Anquan Is the Same: A Terminological Proposal for Chinese Computer Science and Engineering

تجادل هذه الورقة لصالح تحول اصطلاحي في علوم وهندسة الحاسوب الصينية للتمييز بين "الأمن" (anbao) و"السلامة" (anquan)، وذلك لمعالجة الغموض المفاهيمي الناتج عن دمجهما الحالي في المعايير، وتحليل المخاطر، والتعاون بين التخصصات.

Xingyu Zhao2026-05-14