💻 computer science

Evaluation in the Age of AI: Output as Evidence of Learning

تجادل هذه الورقة بأن الاعتماد الواسع النطاق للذكاء الاصطناعي في التعليم العالي يستلزم تحولاً جذرياً في استراتيجيات التقييم من تقييم المخرجات النهائية إلى التأكيد على عمليات التعلم، وذلك لمعالجة عدم التوافق بين المقاييس التقليدية والفهم الحقيقي مع الحفاظ على استقلالية الطالب.

Md Zarzees Uddin Shah Chowdhury, Samin Rahman Khan2026-08-25
🤖 AI

Proxy reliance in large language model decisions is uncalibrated to predictive evidence

تكشف هذه الورقة أن النماذج اللغوية الكبيرة تُظهر اعتماداً غير معاير على السمات الوكيلة في اتخاذ القرار، حيث تفشل غالباً في مواءمة استخدامها للأدلة مع الحقيقة الجوهرية، وتُظهر أن التقييمات القياسية القائمة على الدقة وتغييرات الملصقات الديموغرافية البسيطة غير كافية للكشف عن هذه الانحيازات الدقيقة.

Zengqing Wu, Chuan Xiao2026-08-25
💬 NLP

Expectations and Practices around AI Disclosure in CS Research

تتقصى هذه الورقة عدم التوافق بين سياسات الإفصاح الحالية عن الذكاء الاصطناعي وتوقعات الباحثين في علوم الحاسوب، كاشفةً أنه في حين يعطي الباحثون الأولوية للإفصاح عن استخدام الذكاء الاصطنا dalam المهام منخفضة المشاركة مثل تصميم الأبحاث، فإن ممارسات الإفصاح الفعلية تبالغ في الإبلاغ عن الاستخدامات الأقل أهمية مثل المساعدة في الكتابة، مما يوصي بضرورة مواءمة السياسات بشكل أفضل مع هذه التوقعات.

Arati Mohapatra, Danish Pruthi2026-08-25
💻 computer science

Enabling Organisational Change Through Ground-Up Initiatives: A Case Study from the STFC Scientific Computing Department

تقدم هذه الورقة دراسة حالة من قسم الحوسبة العلمية في STFC تفصل كيف نجحت استراتيجية استدامة وُضعت من الصفر، طُورت عبر مراقبة الانبعاثات والتعليم للمستخدمين وأفضل الممارسات، في تحويل بنيتها التحتية للبحوث الرقمية لتتماشى مع أهداف المملكة المتحدة للوصول إلى صافي انبعاثات صفري، وتعمل كنموذج للمنظمات المماثلة.

Jessica Huntley, David McDonagh2026-08-25
💬 NLP

Who Do Language Models Think Is Competent? A Mechanistic Analysis of Occupational Bias

تكشف هذه الورقة أن النماذج اللغوية غالباً ما تحتفظ بانحيازات تمثيلية داخلية فيما يتعلق بكفاءة المستخدم بناءً على الخصائص الديموغرافية مثل النوع الاجتماعي والعرق، حتى عندما تبدو مخرجاتها الملحوظة غير منحازة، مما يثبت أن التقييمات السلوكية وحدها غير كافية للكشف عن أوضاع الفشل الكامنة هذه.

Keren Fuentes, Aaron Mueller2026-08-24
💬 NLP

Exploratory As-Analyzed No-Detection of Culturally-Marked Predicate-Triggered PII Amplification in a Synthetic-English RAG Probe: A Predicate-Resource-Confounded Audit

تُدقق هذه الدراسة الاستكشافية نظام استرجاع معزز بالتوليد (RAG) باللغة الإنجليزية اصطناعي عبر أربع مجموعات ثقافية، وتجد عدم وجود دليل ذي دلالة إحصائية على أن الاستعلامات المحملة بالصور النمطية تزيد من تسريب المعلومات الشخصية مقارنة بالاستعلامات المحايدة، رغم أن المؤلفين يحذرون من أن نتائجهم تمثل "عدم اكتشاف" وليس إثباتاً لعدم وجود تأثير نظراً لمحدودية حجم العينة والعوامل المربكة مثل آثار صدى المطالبة (prompt-echo artifacts).

Yanhang Li, Zhichao Fan, Zexin Zhuang2026-08-24
💬 NLP

Ansari: A Retrieval-Grounded Islamic AI Assistant -- Architecture, Deployment, and Lessons from 140,000 Conversations

تقدم هذه الورقة "أنصاري"، وهو مساعد ذكاء اصطناعي إسلامي مُنشر ومعتمد على الاسترجاع، يعمل على الحد من التزييف الواقعي وعدم توافق القيم من خلال الإجابة بصرامة على الأسئلة بناءً على نصوص دينية موثقة مع الاستشهاد بها، مما يظهر أداءً فائقاً في الاختبارات المعيارية الإسلامية ويقدم دروساً بالغة الأهمية لنشر نماذج اللغات الكبيرة الحساسة للعقيدة.

M Waleed Kadous, Amr Elsayed, Abdullah Al Nahas, Ashraf Haress2026-08-24
💻 computer science

Six misconceptions about large language models: A minimal model and diagnostic taxonomy

تقترح هذه الورقة نموذج عمل أدنى للأنظمة اللغوية الكبيرة بناءً على أربعة تمايزات رئيسية لتشخيص وتصحيح ستة مفاهيم خاطئة شائعة، مما يقدم مجموعة أدوات تشخيصية تتجاوز ثنائية "عقل الببغاء" لتحسين تقييم القدرات، وتصميم الأنظمة، والحوكمة.

Zhicheng Lin2026-08-24
💻 computer science

From Urban Mobility to Epidemic Dynamics: A Mixture-of-Experts Framework with Preference Alignment for Policy Scenario Simulation

تقدم هذه الورقة UrbanShare-MoE-PA، وهو إطار عمل قائم على البيانات على مستوى الوكيل يستخدم بنية "خليط من الخبراء" مع محاذاة التفضيلات لترجمة سياسات التدخل غير الصيدلانية إلى مسارات واقعية للتنقل والنشاط، مما يتيح عمليات محاكاة أكثر دقة لديناميكيات الأوبئة والمفاضلات في الأنشطة.

Yun Ye, Arsalan Dezhkam, Junyuan Liu, Xinglei Wang, Tao Cheng2026-08-24
🤖 AI

FlavourBench: Ranking Frontier Language Models with Executable Culinary Ground Truth

يقدم FlavourBench معياراً مؤتمتاً لتصنيف النماذج اللغوية الرائدة في المهام المتعلقة بفنون الطهي عبر استخدام نظام إصدارات لإنشاء درجات حقيقية قابلة للتنفيذ لجميع محافظ المكونات الممكنة، مما يقضي على تحيز الحكام والبيانات المفقودة مع توفير مقارنات قوية إحصائياً عبر 27 نموذجاً.

Josef Chen, Erim Hayretci2026-08-24