💬 NLP

AI University: An LLM-Powered Learning Assistant for Engineering---A Finite Element Method Case Study

تقدم هذه الورقة "جامعة الذكاء الاصطناعي" (AI-U)، وهو إطار عمل يجمع بين النماذج اللغوية الكبيرة الضبطية الدقيقة وبين التوليد المعزز بالاسترجاع لإنشاء مساعدي تعلم تكيفي مخصصين لمقررات دراسية محددة، مما يثبت من خلال دراسة حالة لطريقة العناصر المحدودة أن هذا النهج يتفوق بشكل كبير على النماذج الأساسية والنماذج ذات الأوزان المغلقة من حيث التوافق مع المواد التعليمية وتفضيلات المستخدم.

Mostafa Faghih Shojaei, Rahul Gulati, Benjamin A. Jasperson, Shangshang Wang, Simone Cimolato, Manas Vardhan, Dangli Cao (…)2026-08-25
💬 NLP

Effects of Theory of Mind and Prosocial Beliefs on Steering Human-Aligned Behaviors of LLMs in Ultimatum Games

تُظهر هذه الدراسة أن تزويد النماذج اللغوية الكبيرة بالقدرة على استدلال "نظرية العقل" يعزز بشكل كبير من توافقها مع المعايير البشرية، واتساق اتخاذ القرار، ونتائج التفاوض في "ألعاب الإنذار"، لا سيما عند دمج ذلك مع معتقدات محددة تدعم الرفاه الاجتماعي.

Neemesh Yadav, Yihuai Lan, Shan Dong, Mai Hieu Hien, Palakorn Achananuparp, Jing Jiang, Ee-Peng Lim2026-08-25
🤖 machine learning

Scaling Electronic Health Record Foundation Models for Population Health Management

تقدم هذه الورقة نموذجاً تأسيسياً للسجلات الصحية الإلكترونية قابلاً للتوسع، تم تدريبه مسبقاً على مليارات الأحداث الطبية عبر مواقع متعددة من أكثر من 5 ملايين مريض في الولايات المتحدة وتايوان، والذي يُظهر أداءً فائقاً وقدرة على التعميم في التنبؤ بـ 11 مرضاً مزمناً مقارنة بالنماذج الحالية من خلال الاستفضاء من إطار عمل موحد لمحاذاة الرموز وتوسيع النطاق الأمثل للحوسبة.

Liwen Sun, Hao-Ren Yao, Ophir Frieder, Xiang Qian, Chenyan Xiong2026-08-25
💬 NLP

Safety-Aligned Weights Are Not Enough: Refusal-Teacher-Guided Finetuning Enhances Safety and Downstream Performance under Harmful Finetuning Attacks

تقترح هذه الورقة إطار عمل للضبط الدقيق الموجه بمعلم الرفض (Refusal-Teacher-guided finetuning)، والذي يعمل على تحسين كل من السلامة وأداء المهام اللاحقة في ظل هجمات الضبط الدقيق الضارة، وذلك من خلال تدريب النماذج الأساسية مباشرةً باستخدام توجيهات السلامة، بدلاً من الاعتماد على التهيئة الضعيفة التي توفرها الأوزان المتوافقة مسبقاً.

Seokil Ham, Yubin Choi, Yujin Yang, Seungju Cho, Younghun Kim, Changick Kim2026-08-25
💬 NLP

A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs

تقدم هذه الورقة STReason، وهو إطار عمل معياري يجمع بين النماذج اللغوية الكبيرة وأدوات التحليل المكاني الزماني لتفكيك الاستعلامات المعقدة إلى برامج قابلة للتنفيذ، مما يتيح استدلالاً متعدد المهام دقيقاً وخالياً من الهلوسة ومخرجات تفسيرية طويلة دون الحاجة إلى ضبط دقيق خاص بمهمة معينة.

Kethmi Hirushini Hettige, Jiahao Ji, Cheng Long, Shili Xiang, Gao Cong, Jingyuan Wang2026-08-25
💬 NLP

MixLoRA-DSI: Dynamically Expandable Mixture-of-LoRA Experts for Rehearsal-Free Generative Retrieval over Dynamic Corpora

يُعد MixLoRA-DSI إطار عمل جديد للاسترجاع التوليدي الخالي من إعادة التدريب (rehearsal-free)، والذي يستخدم استراتيجية توسيع تعتمد على كشف القيم المتطرفة (OOD) على مستوى الطبقات لإضافة خبراء التكيف منخفض الرتبة (LoRA) بشكل انتقائي، مما يتيح نمواً في المعلمات تحت خطي وتكاليف تدريب منخفضة عند تحديث النماذج مع المجموعات النصية الديناميكية.

Tuan-Luc Huynh, Thuy-Trang Vu, Weiqing Wang, Trung Le, Dragan Gašević, Yuan-Fang Li, Thanh-Toan Do2026-08-25
💬 NLP

Text-ADBench: Text Anomaly Detection Benchmark Based on LLM Embeddings

تقدم هذه الورقة Text-ADBench، وهو معيار شامل للكشف عن الشذوذ في النصوص يستفيد من التضمينات المستمدة من نماذج لغوية متنوعة لإثبات أن جودة التضمين هي المحرك الأساسي للأداء، بينما لا تقدم النهج القائمة على التعلم العميق أي ميزة على الخوارزميات التقليدية الضحلة عند استخدام التضمينات المشتقة من النماذج اللغوية الكبيرة.

Feng Xiao, Jicong Fan2026-08-25
⚡ electrical engineering

TELEVAL: A Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios

تقدم هذه الورقة البحثية TELEVAL، وهو معيار صيني واسع النطاق مصمم لتقييم نماذج اللغة المنطوقة من حيث الدقة الدلالية والملاءمة التفاعلية في الإعدادات المشروطة صوتيًا، مما يكشف أن النماذج الحالية تعاني من صعوبة في التعامل مع التباين الصوتي وغالبًا ما تقع في "فخ الوصف" (Caption Trap) حيث تقوم بوصف الصوت بدلاً من التفاعل بشكل طبيعي.

Zehan Li, Hongjie Chen, Qing Wang, Yuxin Zhang, Jing Zhou, Hang Lv, Mengjie Du, Yaodong Song, Jie Lian, Jian Kang, Jie L (…)2026-08-25
💬 NLP

Omni-SafetyBench: A Benchmark for Safety Evaluation of Audio-Visual Large Language Models

تقدم هذه الورقة Omni-SafetyBench، وهو أول معيار موازٍ شامل يضم 23,328 حالة اختبار سمعية بصرية ومقاييس متخصصة للكشف عن الثغرات الأمنية الخطيرة وعدم الاتساق عبر الوسائط في النماذج اللغوية الكبيرة متعددة الوسائط الحالية.

Leyi Pan, Zheyu Fu, Yunpeng Zhai, Shuchang Tao, Sheng Guan, Shiyu Huang, Lingzhe Zhang, Zhaoyang Liu, Bolin Ding, Felix (…)2026-08-25
💬 NLP

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

تقترح هذه الورقة إطار تقييم تشخيصي بشري السمات يتألف من أبعاد الذكاء العقلي (IQ)، والذكاء العملي (PQ)، والذكاء العاطفي (EQ)، والذكاء القيمي (VQ)، والذي يربط تقييم النماذج اللغوية الكبيرة بمراحل خط الإنتاج التدريبي لسد الفجوة بين درجات الاختبارات المعيارية والمنفعة في العالم الحقيقي.

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary (…)2026-08-25