💬 NLP

Less Is More: Cognitive Load and the Single-Prompt Ceiling in LLM Mathematical Reasoning

تقدم هذه الورقة دراسة منهجية لهندسة الأوامر البرمجية (prompt engineering) للاستدلال الرياضي الصوري في مسابقة SAIR Equational Theories، كاشفةً عن "سقف الأمر الواحد" حيث تستقر الدقة عند حوالي 60-79% بسبب عدم قابلية التقرير الرياضي والقيود الخاصة بالنماذج، رغم تحقيق تحسن قدره 19.5 نقطة مئوية عن الخط المرجعي باستخدام أمر محسن بحجم 2,252 بايت.

Manuel Israel Cazares2026-04-22
🤖 machine learning

Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams

تُثبت هذه الورقة أن النية الضارة في النماذج اللغوية الكبيرة هي سمة يمكن استردادها هندسياً وفك تشفيرها خطياً، وهي موجودة عبر بنيات وهياكل مواءمة متنوعة، بما في ذلك النماذج التي تم تجريدها (abliterated models)، والتي يمكن اكتشافها بدقة عالية باستخدام استراتيجيات سبر محددة، بينما تكشف أن مقاييس الكشف مثل AUROC قد تبالغ في تقدير السلامة التشغيلية.

Isaac Llorente-Saguer2026-04-22
💬 NLP

Disparities In Negation Understanding Across Languages In Vision-Language Models

تقدم هذه الورقة أول معيار متعدد اللغات تم التحقق منه بشرياً لفهم النفي في نماذج الرؤية واللغة، مما يكشف أنه بينما تعمل طرق التصحيح مثل SpaceVLM على تحسين الأداء، فإن فعاليتها تتباين بشكل كبير عبر اللغات المتنوعة تصنيفياً، مما يسلط الض الضوء على الفوارق الحرجة في كيفية تفاعل الخصائص اللغوية مع عدالة النموذج.

Charikleia Moraitaki, Sarah Pan, Skyler Pulling, Gwendolyn Flusche, Kumail Alhamoud, Marzyeh Ghassemi2026-04-22
💬 NLP

A Mechanism and Optimization Study on the Impact of Information Density on User-Generated Content Named Entity Recognition

تحدد هذه الورقة انخفاض الكثافة المعلوماتية كسبب جذري لانهيار الأداء في التعرف على الكيانات المسماة في المحتوى الناتج عن المستخدمين والمتميز بالضجيج، مقدمةً "تحليل طيف الانتباه" لتقدير "تتلمذ الانتباه" الناتج عن ذلك، وتقترح "وحدة تحسين الوعي بالنافذة" (WOM) المستقلة عن النموذج لتعزيز الكثافة الدلالية بشكل انتقائي، مما يحقق نتائج رائدة في معايير مجموعات بيانات المحتوى الناتج عن المستخدمين.

Jiang Xiaobo, Dinghong Lai, Song Qiu, Yadong Deng, Xinkai Zhan2026-04-22
💬 NLP

Superficial Success vs. Internal Breakdown: An Empirical Study of Generalization in Adaptive Multi-Agent Systems

تكشف هذه الدراسة التجريبية أن الأنظمة متعددة الوكلاء التكيفية تعاني من الإفراط في الملاءمة الطوبولوجية والتنسيق الوهمي، حيث تحقق دقة سطحية بينما تفشل في التعميم عبر المجالات أو الحفاظ على التفاعلات الداخلية المثالية، مما يسلط الضوء على الحاجة الملحة لبروتوكولات تقييم تمنح الأولوية للتعميم على مجرد الصحة.

Namyoung So (Department of Computer Science, Hanyang University, Seoul, Republic of Korea), Seokgyu Jang (Department of (…)2026-04-22
💬 NLP

Assessing Capabilities of Large Language Models in Social Media Analytics: A Multi-task Quest

تقدم هذه الورقة أول تقييم شامل لنماذج اللغات الكبيرة الحديثة عبر ثلاث مهام أساسية في تحليلات وسائل التواصل الاجتماعي — التحقق من الهوية، وتوليد المنشورات، واستنتاج سمات المستخدم — باستخدام مجموعة بيانات تويتر جُمعت حديثاً للحد من انحياز البيانات وإرساء معايير مرجعية قابلة لإعادة الإنتاج.

Ramtin Davoudi, Kartik Thakkar, Nazanin Donyapour, Tyler Derr, Hamid Karimi2026-04-22
💬 NLP

AlignCultura: Towards Culturally Aligned Large Language Models?

تقدم هذه الورقة AlignCultura، وهو مسار عمل يتكون من مرحلتين يقوم ببناء مجموعة بيانات CULTURAX بناءً على التصنيف الثقافي لليونسكو لتقييم وتحسين المواءمة الثقافية للنماذج اللغوية الكبيرة بشكل منهجي، مما يثبت أن النماذج التي تم ضبطها ثقافياً تعزز بشكل كبير أداء النفع، وعدم الضرر، والأمانة (HHH) مع تقليل الإخفاقات الثقافية.

Gautam Siddharth Kashyap, Mark Dras, Usman Naseem2026-04-22
💬 NLP

RARE: Redundancy-Aware Retrieval Evaluation Framework for High-Similarity Corpora

تقدم هذه الورقة RARE، وهو إطار تقييم استرجاع مدرك للزيادة في المعلومات يعالج أوجه القصور في معايير الأسئلة والأجوبة الحالية في المجموعات النصية شديدة التشابه من خلال تفكيك المستندات إلى حقائق ذرية وتعزيز توليد البيانات القائم على النماذج اللغوية الكبيرة باستخدام CRRF، مما يكشف في النهاية عن فجوات كبيرة في المتانة في أدوات الاسترجاع الحالية من خلال معيار RedQA الجديد عبر المجالات المالية والقانونية وبراءات الاختراع.

Hanjun Cho, Jay-Yoon Lee2026-04-22
💬 NLP

Cell-Based Representation of Relational Binding in Language Models

تُثبت هذه الورقة أن النماذج اللغوية الكبيرة ترمز لربط العلاقات على مستوى الخطاب من خلال فضاء فرعي منخفض الأبعاد، شبيه بالشبكة يُسمى "التمثيل الربطي القائم على الخلايا"، حيث يمكن فك تشفير أزواج (الكيان-العلاقة) خطياً وتعتبر ضرورية سببياً للاستدلال العلاقاتي الدقيق.

Qin Dai, Benjamin Heinzerling, Kentaro Inui2026-04-22
💬 NLP

Product-of-Experts Training Reduces Dataset Artifacts in Natural Language Inference

تقترح هذه الورقة طريقة تدريب تعتمد على "حاصل ضرب الخبراء" (Product-of-Experts) تعمل بفعالية على تقليل الاعتماد على الآثار الناتجة عن مجموعات البيانات في نماذج الاستدلال اللغوي الطبيعي من خلال خفض وزن الأمثلة المنحازة، مما يحقق إزالة انحياز كبيرة مع حد أدنى من الخسارة في الدقة الإجمالية.

Aby Mammen Mathew2026-04-22