💬 NLP

Towards More Standardized AI Evaluation: From Models to Agents

تجادل هذه الورقة بأنه مع تطور أنظمة الذكاء الاصطناعي من نماذج ثابتة إلى وكلاء ديناميكيين، يجب أن ينتقل التقييم من الاعتماد على المعايير المرجعية الثابتة التي عفا عليها الزمن والدرجات الإجمالية إلى صيرورة قياس مستمرة لبناء الثقة، قادرة على حوكمة السلوكيات غير الحتمية على نطاق واسع.

Ali El Filali, Inès Bedar2026-02-23
💬 NLP

The Statistical Signature of LLMs

تُظهر هذه الورقة أن الضغط غير الفاقد للبيانات يعمل كمقياس بسيط ومستقل عن النموذج للتمييز بين النصوص المولدة بواسطة النماذج اللغوية الكبيرة والكتابة البشرية من خلال كشف انتظام هيكلي وقابلية ضغط أعلى، رغم أن هذه القدرة على التمييز تتضاءل في بيئات التفاعل المجزأة وصغيرة النطاق.

Ortal Hadad, Edoardo Loru, Jacopo Nudo, Niccolò Di Marco, Matteo Cinelli, Walter Quattrociocchi2026-02-23
💬 NLP

Click it or Leave it: Detecting and Spoiling Clickbait with Informativeness Measures and Large Language Models

تقدم هذه الورقة نموذجاً هجيناً للكشف عن العناوين المضللة (clickbait) يجمع بين تضمينات النماذج المحولة (transformer-based embeddings) و15 ميزة إخبارية مستوحاة لغوياً، محققاً درجة F1 بنسبة 91% باستخدام خوارزمية XGBoost مع تعزيز قابلية التفسير للتنبؤ من خلال الإشارات اللغوية البارزة.

Wojciech Michaluk, Tymoteusz Urban, Mateusz Kubita, Soveatin Kuntur, Anna Wroblewska2026-02-23
💬 NLP

Information-Theoretic Storage Cost in Sentence Comprehension

تقترح هذه الورقة مقياساً مستمراً، محايداً نظرياً، ومعتمداً على نظرية المعلومات لتكلفة التخزين مشتقاً من النماذج اللغوية العصبية لقياس عبء الذاكرة العاملة في فهم الجمل، مبرهنةً على صحته من خلال الاسترداد الناجح لعدم التماثل في المعالجة المعروف، والارتباط مع المقاييس التقليدية القائمة على القواعد، والتنبؤ بأوقات القراءة في مجموعات بيانات طبيعية واسعة النط scale.

Kohei Kajikawa, Shinnosuke Isono, Ethan Gotlieb Wilcox2026-02-23
💬 NLP

Simplifying Outcomes of Language Model Component Analyses with ELIA

تقدم هذه الورقة ELIA، وهو تطبيق ويب تفاعلي يسد فجوة الوصول في مجال التفسير الآلي من خلال دمج تقنيات التحليل المتقدمة مع التفسيرات اللغوية الطبيعية المولدة بواسطة الذكاء الاصطناعي، مما يُمكّن غير المتخصصين من فهم مكونات النماذج اللغوية المعقدة بفعالية من خلال واجهة استكشافية متمحورة حول المستخدم.

Aaron Louis Eidt, Nils Feldhus2026-02-23
💬 NLP

Analyzing and Improving Chain-of-Thought Monitorability Through Information Theory

تستخدم هذه الورقة نظرية المعلومات لتحديد حدود إمكانية مراقبة "سلسلة الأفكار" (CoT)، مقترحةً طريقتين للتدريب — تعتمدان على النموذج المثالي (oracle-based) وتعظيم المعلومات المتبادلة الخالية من الملصقات (label-free mutual information maximization) — تعملان بشكل منهجي على تحسين دقة المراقبة مع منع تدهور سلسلة الأفكار والتخفيف من حدة استغلال المكافأة (reward hacking).

Usman Anwar, Tim Bakker, Dana Kianfar, Cristina Pinneri, Christos Louizos2026-02-23
💬 NLP

VeriSoftBench: Repository-Scale Formal Verification Benchmarks for Lean

تقدم هذه الورقة VeriSoftBench، وهو معيار قياسي على مستوى المستودعات يضم 500 التزام بإثبات لغة Lean 4 من مشاريع التحقق من البرمجيات مفتوحة المصدر، كاشفةً أن النماذج اللغوية الكبيرة الحالية تعاني في الانتقال من الإعدادات الرياضية إلى الإعدادات المتمحورة حول الكود، ومسلطةً الضوء على التأثير الحاسم للتبعية بين الملفات على نجاح أتمتة الإثبات.

Yutong Xin, Qiaochu Chen, Greg Durrett, Işil Dillig2026-02-23
💬 NLP

Vichara: Appellate Judgment Prediction and Explanation for the Indian Judicial System

إن "فيتشارا" (Vichara) هو إطار عمل مبتكر صُمم للتنبؤ بالأحكام القضائية الهندية وتفسيرها من خلال تفكيك وثائق القضايا إلى نقاط قرار مهيكلة وتوليد تفسيرات مستوحاة من منهجية (IRAC)، محققاً أداءً رائداً وقدرة عالية على التفسير عبر نماذج لغوية كبيرة متعددة.

Pavithra PM Nair, Preethu Rose Anish2026-02-23
💬 NLP

Validating Political Position Predictions of Arguments

تقدم هذه الورقة إطار عمل للتحقق ثنائي المقياس يجمع بين التوسيم البشري النقطي والزوجي لتقييم تنبؤات الموقف السياسي بواسطة النماذج اللغوية بفعالية، مما يثبت أنه بينما تكون التنبؤات الفردية ذاتية، فإن التصنيفات الترتيبية المستمدة منها تحقق توافقًا عاليًا مع الأحكام البشرية وتسمح بإنشاء قاعدة معرفية واسعة النطاق ومحققة للمجادلة في الخطاب السياسي.

Jordan Robinson, Angus R. Williams, Katie Atkinson, Anthony G. Cohn2026-02-23
💬 NLP

Subgroups of U(d)U(d) Induce Natural RNN and Transformer Architectures

تقترح هذه الورقة إطاراً بديهياً موحداً يشتق بنيات الشبكات المتكررة والمحولات من المجموعات الجزئية المغلقة لـ U(d)، مبرهنةً من خلال التجارب على مهام نمذجة اللغة أن النماذج التي تستخدم فضاءات حالة متعامدة (O(d)) مع خلط في المماس الخطي تحقق أداءً تنافسياً في ظل إعدادات متطابقة المعلمات.

Joshua Nunley2026-02-23