💻 computer science

Archetypes or ability? Clustering for modelling student mathematical competence

من خلال تطبيق أساليب التجميع على مجموعة بيانات ضخمة من نتائج امتحانات الطلاب في المملكة المتحدة، تتحدى هذه الدراسة الافتراض القائل بأن الكفاءة الرياضية تتكون من مجموعات مهارية منفصلة ومتسلسلة، حيث وجدت بدلاً من ذلك أن القدرة العامة هي العامل المهيمن، مع إثبات أن النماذج القابلة للتفسير يمكنها تحقيق أداء تنافسي للتعلم الشخصي.

Benjamin Mawdsley, Tom Quilter, Richard Turner, Sarah Jackson, Paul Edwards2026-07-30
💻 computer science

The Age of AI Agents Demands A New Scientific Paradigm To Sustain Trustworthy Science

تجادل هذه الورقة بأن صعود وكلاء أبحاث الذكاء الاصطناعي المستقلين يستلزم نموذجاً جديداً للتحقق العلمي يركز على تدفقات العمل القابلة للملاحظة، والتدقيقات القابلة للتوسع، والإسناد الواضح، وذلك لمنع حدوث فراغات في المساءلة والحفاظ على الثقة في العلم.

Belinda Mo2026-07-30
💰 quantitative finance

The Human Utility Factor: A Computable Welfare Metric That Reframes AI Governance as a Constrained Optimisation Problem

تقدم هذه الورقة "عامل المنفعة البشرية" (HUF)، وهو مقياس رفاهية قابل للتفاضل يعيد صياغة حوكمة الذكاء الاصطناًعي كمسألة تحسين مقيدة من خلال قياس المقايضات بين الأتمتة، وإعادة التوزيع، والتوظيف لتحديد العتبات السياساتية التي تمنع عدم الاستقرار الاجتماعي والاقتصادي رغم الامتثال التنظيمي.

Sivasathivel Kandasamy2026-07-30
💻 computer science

AI Security Priorities: A Field-Wide Agenda

تقدم هذه الورقة أجندة متعددة القطاعات وذات أولوية للنهوض بأمن الذكاء الاصطناعي، منظمة في أربعة محاور رئيسية ومستمدة من مقابلات وورش عمل مع خبراء، لتوجيه الاستثمار والعمل المنسق في حماية أنظمة الذكاء الاصطناعي وبنيتها التحتية مع تجاوز وتيرة اعتمادها لسرعة الجاهزية الأمنية.

Gil Gekker, Rachel Steratore, Everett Smith, Asher Brass-Gershovich, Varun Gandhi, Nicole Nichols, Vijay Bolina, Buck Sh (…)2026-07-30
💻 computer science

SimpleWikiSearch: A Clean Offline Wikipedia Environment for Agentic Search

تقدم هذه الورقة SimpleWikiSearch، وهي بيئة ويكيبيديا غير متصلة بالإنترنت محددة بالكامل وقابلة لإعادة الإنتاج، مع بناء صريح للمتن، وأكوام استرجاع، وعقود أدوات مصممة لتوحيد تقييم أنظمة البحث الوكيلية من خلال عزل متغيرات البيئة عن أداء الوكيل.

Guanming Xiong, Penghui Zhang2026-07-30
💻 computer science

A Reference-Free Score for Detecting Silent Reasoning Failures in Large Language Models

تقدم هذه الورقة "درجة إخلاص الاستدلال للإجابة" (RAFS)، وهي مقياس تشخيصي غير معتمد على مرجع مصمم للكشف عن حالات فشل الاستدلال الصامت في النماذج اللغوية الكبيرة من خلال تقييم المصداقية المحلية، والاستقرار، والاتساق المنطقي لآثار الاستدلال الرياضي بشكل مستقل عن دقة الإجابة النهائية.

Vivek Shukla, Varun Shukla, Atul, Divya Mishra, Mehul Kumar Das2026-07-30
💻 computer science

Try Again, Don't Look Back: Blind Resampling Outperforms Self-Repair in Small Code Models

تُظهر هذه الورقة أنه بالنسبة لنماذج الأكواد الصغيرة، يتفوق إعادة أخذ العينات الأعمى (إعادة المحاولة دون تغذية راجعة) على طرق الإصلاح الذاتي القياسية أو يضاهيها مع استخدام عدد أقل بكثير من الرموز (tokens)، لأن التكييف على محاولة النموذج الفاشلة الخاصة به يجعل النموذج "يرتكز" على الخطأ الأصلي بدلاً من الاستفادة بفعالية من التغذية الراجعة للتنفيذ.

Yuvraj Verma2026-07-30
🤖 AI

Even More Deception: Objective Misalignment in Mixed-Motive LLM Multi-Agent Systems

تتقصى هذه الورقة عدم توافق الأهداف في الأنظمة متعددة الوكلاء المدعومة بالنماذج اللغوية الكبيرة باستخدام لعبة "الذئب"، كاشفةً أنه بينما يطور الوكلاء المخترقون استراتيجيات استدلال داخلية متميزة لمتابعة أهداف متضاربة، فإن هذه التكيفات الخداعية تظل غير مرئية إلى حد كبير في تواصلهم العلني، مما يؤدي في النهاية إلى تقويض النتائج الجماعية في البيئات العدائية.

Marylou Fauchard, Florian Carichon, Margarida Carvalho, Golnoosh Farnadi2026-07-30
🤖 AI

When benchmark inferences do not compose: Projectibility in AI evaluation

تجادل هذه الورقة بأن الاستنتاجات الصحيحة لمعايير الذكاء الاصطناعي لا تترجم تلقائياً إلى ادعاءات تبعية مبررة بسبب عدم التوافق في النهايات والافتراضات والارتباطات، وتقترح إطار عمل "تدقيق القابلية للإسقاط" لتشخيص هذه الروابط المنطقية غير المدعومة.

Brett Reynolds2026-07-30
🤖 AI

GuideSkill: Evolving Executable LLM Agent Skills for Guideline-Grounded Clinical Reasoning

يقدم GuideSkill إطار عمل غير مرتبط بنموذج محدد يقوم بتجميع المبادئ التوجيهية للممارسة السريرية في وظائف تشخيصية قابلة للتنفيذ، والتي يتم صقلها لاحقاً من خلال بيانات الحالات لتعزيز دقة النماذج اللغوية الكبيرة وتغطية مهاراتها في الاستدلال السريري بشكل كبير دون الحاجة إلى تحديثات في النموذج الأساسي.

Lang Cao, Yuhao Shen, Tianyang Luo, Simo Du, Hao Peng, Yue Guo2026-07-30