💻 computer science

When AI Is Your Pastor: A Benchmark for Theological Triage and Pastoral Guidance in Large Language Models

تقدم هذه الورقة FMG-Bench، وهو معيار مرجعي يتكون من 120 سيناريو مصمم لتقييم وتحسين أداء النماذج اللغوية الكبيرة في الفرز اللاهوتي المسيحي والإرشاد الرعوي، مما يثبت أن التعليمات المهيكلة تعزز بشكل كبير السلوكيات الحرجة المتعلقة بالسلامة مثل التعرف على الحالات التي يكون فيها الإحالة البشرية ضرورية.

Alex Chao2026-08-14
💻 computer science

On Measuring Semantic Preservation in Legal Ontology Learning

تقترح هذه الورقة وتتحقق من صحة إطار تقييم جديد يقيس الفقدان الدلالي في تعلم الأنطولوجيا القانونية من خلال مقارنة أداء النماذج اللغوية الكبيرة في المهام على الوثائق المصدرية مقابل التمثيلات المهيكلة، مما يكشف أن الحفاظ على الدلالات يتباين بشكل كبير اعتماداً على الاقتران المحدد بين النماذج اللغوية وطرق تعلم الأنطولوجيا.

Albert Sadowski, Jarosław A. Chudziak2026-08-14
💻 computer science

AnchorSIPS: A Synthetic Dataset and Evaluation Resource for Evidence-Supported Psychosis-Risk Symptom Measurement

تقدم هذه الورقة AnchorSIPS، وهي مجموعة بيانات اصطناعية مكونة من 10,000 مقابلة مهيكلة لمخاطر الذهان مع أهداف قياس مستندة إلى النصوص، صُممت للتغلب على عقبات الوصول إلى البيانات وتقييم قدرة نماذج الذكاء الاصطناعي على إجراء تقييم وتشخيص للأعراض مدعوم بالأدلة.

Guilherme C. Oliveira, Stephanie Fong, Zimu Wang, Clarice Lee, Xiangyu Zhao, Duy Khoa Pham, Duong Nhu, Yiwen Jiang, Jiah (…)2026-08-14
💻 computer science

Thought-Aware KV Cache Compaction for Reasoning via Adaptive Attention Matching

تقترح الورقة البحثية "مطابقة الانتباه الواعية بالتفكير" (TAM)، وهي طريقة مبتكرة لضغط ذاكرة التخزين المؤقت لـ KV، تستفيد من الهيكل الهرمي لسلسلة التفكير من خلال تخصيص الميزانية التكيفي وحماية الرموز المحورية لتقليل استخدام الذاكرة بشكل كبير مع الحفاظ على الدقة أو تحسينها مقارمًا بالضغط الموحد.

Yang Liu, Bin Chong, Chongyang Zhang, Hao Zheng, Jiayu Liang, Xu Kefu2026-08-14
💻 computer science

Can Spectral-Clipping Enable Better Learning While Forgetting Less for Low-Rank Adaptation?

تقترح هذه الورقة البحثية طريقة SCLoRA، وهي طريقة جديدة للتكيف منخفض الرتبة (Low-Rank Adaptation) تستفيد من عملية القص الطيفي (spectral clipping) على المكونات المنفردة ذات المعلمات لتكييف المكونات الصغرى الخاصة بالمهمة بشكل انتقائي مع الحفاظ على المعرفة الأساسية سابقة التدريب، مما يؤدي إلى تحسين الأداء في المهام اللاحقة والحد من النسيان الكارثي.

Hyowon Wi, Noseong Park2026-08-14
💻 computer science

Vision-Language Models are Fragile Multilingual Associators

تقدم هذه الورقة المعيار المرجعي M2^2BIND لتوضيح أن نماذج الرؤية واللغة تظهر ترابط مفاهيم هشاً يعتمد على اللغة، وينهار بشكل كبير في الإعدادات متعددة اللغات عبر العائلات والخطوط المختلفة، مما يتحدى افتراض اتساق الأداء عبر اللغات المتنوعة.

Ritabrata Chakraborty, Rajatsubhra Chakraborty, Shivakumara Palaiahnakote, Angelo Cangelosi, Umapada Pal2026-08-14
💻 computer science

From Refuse to Richness: Rubric Rewards for Long-Form Hallucination Reinforcement Learning

تتناول هذه الورقة البحثية المقايضة بين التأسيس (grounding) والشمولية في التوليد طويل النص من خلال اقتراح إطار عمل للتعلم التعزيزي قائم على معيار النقاط الرئيسية، والذي يحقق -عند دمجه بشكل ناعم مع مكافآت التأسيس والصلة- توازناً متفوقاً بين الدعم الواقعي وتغطية المعلومات الشاملة مقارنة بالأساليب الحالية.

Yudong Wang, Zhe Yang, Wenhan Ma, Rang Li, Qibin Yang, Weimin Xiong, Jiangshan Duo, Liang Zhao, Zhifang Sui2026-08-14
💻 computer science

The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models

تقدم هذه الورقة CulShield، وهو أول معيار مرجعي يمتد عبر 77 دولة وأكثر من 2,000 محظور ثقافي لتقييم سلامة النماذج اللغوية الكبيرة فيما يتعلق بالمحظورات الثقافية، كاشفةً عن "فجوة معرفية سلوكية" كبيرة حيث تمتلك النماذج المعرفة الثقافية لكنها تفشل في تطبيقها في التفاعلات الضمنية المعتمدة على السياق.

Ying He, Sihang Jiang, Xingzhou Chen, Zhouhong Gu, Yiwei Gu, Minggui He, Shimin Tao, Hongxia Ma, Yanghua Xiao2026-08-14
💻 computer science

Are Large Language Models Reliable Reviewers? A Benchmark for Error Detection in Financial Documents

تقدم هذه الورقة FinED-Bench، وهو أول معيار لتقييم اكتشاف الأخطاء المالية عبر ثلاثة مستويات من التعقيد المعرفي، والذي يكشف أنه بينما تعاني النماذج اللغوية الكبيرة الحالية في هذه المهمة الحرجة، فإن الضبط الدقيق الخاضع للإشراف يمكن أن يعزز أداءها بشكل كبير.

Ying He, Zhouhong Gu, Zhecheng Hu, Yubo Zhou, Hao Shen, Jiaqing Liang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao (…)2026-08-14
💻 computer science

Predicting consumer-technology ownership without a diffusion history

تُظهر هذه الورقة أن السمات المُدركة للتقنيات الاستهلاكية، والتي تم تقييمها من قِبل كل من البشر والنماذج اللغوية الرائدة، يمكن أن تُحسن بشكل كبير التنبؤ بانتشار الملكية مقارنة بالأساسات المعتمدة على عمر الإطلاق، وإن كانت هذه الميزة تتضاءل في التوقعات قصيرة المدى حيث تظل اتجاهات الملكية ثابتة.

Irina Vartanova, Niels Selling, Jennifer Viberg Johansson, Pontus Strimling2026-08-14