💬 NLP

Text-ADBench: Text Anomaly Detection Benchmark Based on LLM Embeddings

تقدم هذه الورقة Text-ADBench، وهو معيار شامل للكشف عن الشذوذ في النصوص يستفيد من التضمينات المستمدة من نماذج لغوية متنوعة لإثبات أن جودة التضمين هي المحرك الأساسي للأداء، بينما لا تقدم النهج القائمة على التعلم العميق أي ميزة على الخوارزميات التقليدية الضحلة عند استخدام التضمينات المشتقة من النماذج اللغوية الكبيرة.

Feng Xiao, Jicong Fan2026-08-25
🔬 physics

RetroDFM-R: Reasoning-Driven Retrosynthesis Prediction with Large Language Models via Reinforcement Learning

يُعد RetroDFM-R نموذج لغة كبيرًا معززًا بالتعلم التعزيزي يعمل على تحسين التنبؤ بالتخليق الرجعي الكيميائي من خلال الجمع بين الدقة العالية والاستدلال الشفاف خطوة بخطوة، مما يعالج أوجه القصور في القدرة على التعميم والتفسير مع التفوق على النماذج المرجعية الرائدة في المعايير القياسية.

Situo Zhang, Hanqi Li, Lu Chen, Zihan Zhao, Xuanze Lin, Zichen Zhu, Danyu Luo, Bo Chen, Xin Chen, Kai Yu2026-08-25
⚡ electrical engineering

TELEVAL: A Benchmark Designed for Spoken Language Models in Chinese Interactive Scenarios

تقدم هذه الورقة البحثية TELEVAL، وهو معيار صيني واسع النطاق مصمم لتقييم نماذج اللغة المنطوقة من حيث الدقة الدلالية والملاءمة التفاعلية في الإعدادات المشروطة صوتيًا، مما يكشف أن النماذج الحالية تعاني من صعوبة في التعامل مع التباين الصوتي وغالبًا ما تقع في "فخ الوصف" (Caption Trap) حيث تقوم بوصف الصوت بدلاً من التفاعل بشكل طبيعي.

Zehan Li, Hongjie Chen, Qing Wang, Yuxin Zhang, Jing Zhou, Hang Lv, Mengjie Du, Yaodong Song, Jie Lian, Jian Kang, Jie L (…)2026-08-25
💬 NLP

Beyond Benchmarks: LLM Evaluation with an Anthropomorphic and Lifecycle-oriented Roadmap

تقترح هذه الورقة إطار تقييم تشخيصي بشري السمات يتألف من أبعاد الذكاء العقلي (IQ)، والذكاء العملي (PQ)، والذكاء العاطفي (EQ)، والذكاء القيمي (VQ)، والذي يربط تقييم النماذج اللغوية الكبيرة بمراحل خط الإنتاج التدريبي لسد الفجوة بين درجات الاختبارات المعيارية والمنفعة في العالم الحقيقي.

Jun Wang, Ninglun Gu, Kailai Zhang, Pengyong Li, Yelun Bao, Jin Yang, Xu Yin, Liwei Liu, Zijiao Zhang, Yihuan Liu, Gary (…)2026-08-25
🤖 AI

Beyond Benchmarking: Scenario-Based Evaluation of Large Language Models for Personalized Learning

تقترح هذه الورقة إطار عمل للتقييم القائم على السيناريوهات يتجاوز المعايير التقليدية لتقييم السلوكيات التربوية للنماذج اللغوية الكبيرة في التعلم الشخصي، وذلك من خلال تحليل دقة التشخيص وتوليد التوجيه عبر دراسة حالة للدروس الخصوصية لما بعد الفصل الدراسي، والتي تم تقييمها عبر ذكاء اصطناعي خارجي ونمذجة برادلي-تيري.

Bo Yuan, Jiazi Hu2026-08-25
💬 NLP

GraphMed-LT: Patient-Specific Graph Memory with Latent Clinical Thought Refinement for Multi-Turn Medical Conversations

يُعد GraphMed-LT إطار عمل مبتكر للمحادثات الطبية متعددة الأدوار، حيث يقوم ببناء ذاكرة رسومية خاصة بالمريض وتُحدث بشكل تدريجي من خلال ثلاثيات سريرية، ويعمل على صقلها عبر التغذية الراجعة للحالة الخفية لوكيل طبي قابل للتدريب، مما يتغلب على قيود الأدلة المجزأة ويحسن دقة التشخيص بشكل كبير عبر مختلف التخصصات الطبية.

Zhaohan Meng, Zaiqiao Meng, Siwei Liu, Hao Xu, Ke Yuan, Iadh Ounis2026-08-25
🤖 AI

AdaR: A Framework for Equipping LLMs with Adaptive Reasoning

يعزز إطار عمل AdaR متانة وقدرة النماذج اللغوية الكبيرة على التعميم في الاستدلال الرياضي من خلال تدريبها باستخدام التعلم المعزز على استعلامات مُخلّقة تلقائياً ومتكافئة منطقياً لمعاقبة الارتباطات الزائفة وتشجيع الاستدلال التكيفي.

Zhejian Lai, Xiang Geng, Zhijun Wang, Yang Bai, Jiahuan Li, Rongxiang Weng, Jingang Wang, Xuezhi Cao, Xunliang Cai, Shuj (…)2026-08-25
⚡ electrical engineering

Mitigating Sample-Level Imbalance via Probabilistic Separation for Adaptive Multimodal Fusion

تقترح هذه الورقة إطار عمل مبتكر يخفف من عدم التوازن في الأنماط على مستوى العينات في التعلم متعدد الوسائط من خلال استخدام مقياس فجوة النمط ونموذج الخليط الغاوسي لفصل العينات احتماليًا إلى مجموعات فرعية متوازنة وغير متوازنة، مما يتيح عملية تدريب ديناميكية من مرحلتين تعيد تخصيص أولويات التحسين بشكل تكيفي وتعمل على تنقية البيانات لتحقيق أداء فائق.

Zhiwen Yu, Zhaocheng Liu, Xiaoqing Liu, Huanqiang Zeng, C. L. Philip Chen2026-08-25
🤖 AI

SlideGen: Collaborative Multimodal Agents for Scientific Slide Generation

تقدم هذه الورقة البحثية SlideGen، وهو إطار عمل لوكيل متعدد الوسائط تعاوني يحول الأوراق العلمية إلى شرائح عرض تقديمية جيدة الهيكلة من خلال تنسيق التخطيط السردي، والتأسيس متعدد الوسائط، وتكوين التخطيط، مع اقتراح مقياس جديد للكثافة المدركة للهندسة لتقييم التوازن البصري والفعالية.

Xin Liang, Zhilin Zhang, Xiang Zhang, Haoran Su, Yiwei Xu, Siqi Sun, Chenyu You2026-08-25
💬 NLP

An Empirical Study on Preference Tuning Generalization and Diversity Under Domain Shift

تقدم هذه الورقة دراسة تجريبية منهجية تُظهر أنه في حين أن استراتيجيات التكيف القائمة على التوسيم الزائف تخفف بفعالية من تدهور الأداء الناتج عن انزياح النطاق في النماذج اللغوية المضبوطة بالتفضيلات، إلا أنها تتسبب في الوقت ذاته في حدوث انهيار النمط، مما يكشف عن مقايضة جوهرية بين التعميم والتنوع.

Constantinos Karouzos, Xingwei Tan, Nikolaos Aletras2026-08-25