🤖 machine learning

Synthetic Persona Pretraining: Alignment from Token Zero

تقدم هذه الورقة البحثية "التدريب المسبق للشخصية الاصطناعية" (SPP)، وهي طريقة تدمج التأملات الشخصية المتوافقة مع القيم مباشرة في مرحلة التدريب المسبق لغرس شخصية المساعد المنشودة من الرمز صفر، مما يثبت أن هذا التدخل المبكر يحسن بشكل كبير من الالتزام بالدستور، والمتانة ضد الاختراق، والاتساق الأخلاقي مقارنة بنهج المحاذاة في مرحلة ما بعد التدريب.

Julian Minder, Viktor Moskvoretskii, Raghav Singhal, Difan Jiao, Andy Arditi, Shaobo Cui, Yiderigun Borjigin, Kartik Bal (…)2026-08-14
💻 computer science

Toward a Gricean Retreat: Probing LLMs for Knowledge Boundaries and Referent Specificity

تكشف هذه الورقة أنه في حين تمتلك النماذج اللغوية الكبيرة إشارات داخلية تشير إلى كل من حدود معرفتها وخصوصية المراجع القادمة، إلا أنها تفشل في التوفيق بين هذه الإشارات أثناء التوليد، مما يؤدي بها إلى فبركة تفاصيل محددة حول كيانات مجهولة بدلاً من التراجع إلى ادعاءات عامة أكثر أماناً كما يفعل المتحدث المتعاون وفقاً لمبدأ غرايس.

Dananjay Srinivas, Saksham Khatwani, Maria Pacheco2026-08-14
🤖 machine learning

LittleLearner: Language Models Under Pedagogically Controlled Knowledge Exposure

تقدم هذه الورقة LITTLELEARNER، وهو نموذج لغوي بـ 5 مليارات معلمة تم تدريبه على مجموعة بيانات LITTLECURRICULUM المنسقة والمكونة من 88 مليار رمز من المواد التعليمية للمرحلة الابتدائية في الولايات المتحدة، لإنشاء بيئة تجريبية (sandbox) مقيدة نمائيًا تتيح دراسة محكومة لكيفية اكتساب النماذج للمعرفة واستخدامها ضمن حدود منهجية محددة بوضوح.

Fanfei Li, Jana Zeller, Manuel Prada-Corral, Thaddäus Wiedemer, Prasanna Mayilvahanan, Ryan Cotterell, Wieland Brendel2026-08-14
💻 computer science

QuoteBench: How Matched Scores Can Hide Command-Path Failures

تقدم الورقة البحثية QuoteBench، وهو معيار مرجعي يوضح أن درجات التنفيذ المتطابقة في وكلاء البرمجة المعتمدين على النماذج اللغوية الكبيرة غالبًا ما تحجب إخفاقات جسيمة في توليد الأوامر ناتجة عن تسلسل مسار التنفيذ وتحليله، مما يكشف أن تصنيفات النماذج وأداءها يعتمدان بشكل كبير على تكوينات نشر محددة بدلاً من القدرات الجوهرية.

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang2026-08-14
💻 computer science

AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

تقدم AutoDesign إطار عمل لتحسين الحزام الميتا (meta-harness) يُمكّن وكيل البرمجة من تحسين قدراته التصميمية بشكل تكراري من خلال التغذية الراجعة طويلة الأمد، محققاً أداءً هو الأفضل في فئته في تحويل الأوراق الأكاديمية إلى ملصقات، ومتفوقاً بذلك على الأنظمة التجارية مثل Claude Design.

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao (…)2026-08-14
🤖 AI

Joint AP Probing and Scheduling: A Contextual Bandit Approach

تتناول هذه الورقة تحدي استقصاء وجدولة الروابط اللاسلكية غير المعروفة بشكل مشترك من خلال نمذجة المشكلة كإطار عمل جديد لـ "المقامر السياقي مع الاستقصاء" (CBwP)، واقتراح خوارزمية فعالة ذات حدود ندم مثبتة لمعدلات بيانات برنولي.

Tianyi Xu, Ding Zhang, Parth H. Pathak, Zizhan Zheng2026-08-13
🤖 AI

Online Learning for Adaptive Probing and Scheduling in Dense WLANs

تتناول هذه الورقة تحسين معدل النقل في الشبكات المحلية اللاسلكية (WLANs) ذات الموجات المليمترية (mmWave) الكثيفة من خلال اقتراح خوارزميات مشتركة لاستقصاء الروابط والجدولة توازن بين كسب المعلومات وتكاليف الإرسال، مقدمةً حلول تقريبية غير متصلة بالإنترنت ونهج "المندل السياقي" (contextual-bandit) المتصل بالإنترنت مع حدود ندم مثبتة تم التحقق منها بواسطة بيانات من العالم الحقيقي.

Tianyi Xu, Ding Zhang, Zizhan Zheng2026-08-13
💬 NLP

ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation

تقدم الورقة البحثية ReXrank، وهو لوحة متصدر عامة وإطار تقييم معياري يتميز بمجموعة بيانات ReXGradient واسعة النطاق ومقاييس متعددة لتقييم ومقارنة نماذج الذكاء الاصطناعي موضوعياً لتوليد تقارير الأشعة السينية للصدر بشكل آلي.

Xiaoman Zhang, Hong-Yu Zhou, Xiaoli Yang, Oishi Banerjee, Julián N. Acosta, Mohammed Baharoon, Josh Miller, Ouwen Huang (…)2026-08-13
💬 NLP

Explainability in Practice: A Survey of Explainable NLP Across Various Domains

تقدم هذه الدراسة مراجعة شاملة لمعالجة اللغات الطبيعية القابلة للتفسير (XNLP) عبر سبعة مجالات حيوية، حيث تحلل المتطلبات الخاصة بكل مجال، وتقارن بين أساليب التفسير، وتقترح بروتوكول تقييم ثنائي المستويات لسد الفجوة بين المقاييس التقنية والقابلية للتطبيق في العالم الحقيقي.

Hadi Mohammadi, Robert A. Bagheri, Anastasia Giachanou, Daniel L. Oberski2026-08-13
🤖 AI

On Benchmarking Human-Like Intelligence in Machines

تجادل هذه الورقة بأن نماذج تقييم الذكاء الاصطناعي الحالية تفشل في قياس القدرات المعرفية الشبيهة بالبشر بدقة بسبب مشكلات مثل الملصقات غير الموثقة والمهام غير الصالحة بيئيًا، وتقترح خمس توصيات ملموسة لإجراء تقييم معياري أكثر صرامة بناءً على دراسة تقييم بشري لتسعة معايير قائمة.

Lance Ying, Katherine M. Collins, Lionel Wong, Ilia Sucholutsky, Ryan Liu, Adrian Weller, Tianmin Shu, Thomas L. Griffit (…)2026-08-13