💬 NLP

A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation

تقدم هذه الورقة البحثية Principle-Bench، وهو معيار مرجعي جديد يغطي الدقة، ومتانة إعادة الصياغة، والمتانة الخصومية، والمعايرة لتقييم أنظمة "النموذج اللغوي الكبير كحكم" (LLM-as-judge) في التنظيم القائم على المبادئ، مما يكشف عن معاناة النماذج الحالية من ثغرات "مسرح الامتثال" حيث يؤدي حشو الكلمات المفتاحية الخصومي بشكل جذري إلى خفض الأداء ويسلط الضوء على الحاجة الماسة إلى آليات تقييم معايرة وقابلة للتدقيق.

Dipankar Sarkar2026-08-17
💬 NLP

Local and Global Regimes of Geometric Complexity in Language Model Representations

تكشف هذه الورقة أن العلاقة بين التنوع المعجمي والأبعاد الجوهرية في تمثيلات النماذج اللغوية تمر بانعكاس متوقع يعتمد على المقياس، مما يثبت أن الأبعاد الجوهرية ليست مقياساً مباشراً للتعقيد، بل تعكس مبدأً تنظيمياً أساسياً للبيانات اللغوية.

Arwa Osman, Marco Baroni, Iuri Macocco2026-08-17
🤖 AI

Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

تقدم هذه الورقة بروتوكول المداولة على الفرضيات المتنوعة (DHD) لإثبات أن الرسائل غير الصحيحة في أنظمة الاستنتاج متعددة الوكلاء غالباً ما تمتلك "قيمة مسار" كبيرة من خلال مساعدة الحلّالين اللاحقين، مما يثبت أن صحة الإجابة وحدها معيار غير كافٍ لتصفية اتصالات الوكلاء.

Chih-Hsuan Yang, Anjir Ahmed Chowdhury, Cheng-Hau Yang, Weijian Zheng, Fernando Llorente, Xiaolong Ma, Xinyang Li, Eliu (…)2026-08-17
🤖 AI

LLMs Don't Pay for the Jump

تجادل هذه الورقة بأن النماذج اللغوية الكبيرة لا يمكنها القيام بالاستدلال الاستنباطي الحقيقي لأن استنتاج المحولات ذات الأوزان الثابتة، على عكس الاختراقات العلمية التاريخية التي كانت مدفوعة بالتكلفة المادية للخطأ المعرفي، يفتقر إلى آلية تترتب فيها تكاليف ثيرموديناميكية على مثل هذه الأخطاء لفرض المراجعة المفاهيمية.

Paras Balani, Subhrakanta Panda2026-08-17
💬 NLP

Information Satisfaction: A Reader-Centered Axis for Summarization Evaluation

تجادل هذه الورقة بأن مقاييس تقييم التلخيص الحالية تخفق في تلبية احتياجات المستخدمين الفردية من خلال تجاهل شخصيات القراء، وتثبت من خلال اختبارات الاضطراب والتقييم البشري من قبل الخبراء أن المقاييس التقليدية وتلك القائمة على النماذج اللغوية الكبيرة ترتبط ارتباطاً ضعيفاً بالأحكام البشرية المتعلقة بالرضا عن المعلومات.

Isabel Cachola, William Walden, Reno Kriz, Mark Dredze2026-08-17
💬 NLP

Like Article, Like Audience: Enforcing Multimodal Correlations for Disinformation Detection

تقترح هذه الورقة خوارزمية تعلم متعددة الوسائط تستفيد من الارتباطات بين المحتوى الذي ينشئه المستخدمون والمقالات الإخبارية المشتركة لتعزيز الكشف عن التضليل عبر توجيه تدريب النموذج باستخدام ملفات تعريف المستخدمين مع تجنب الاعتماد عليها أثناء التنبؤ.

Liesbeth Allein, Marie-Francine Moens, Domenico Perrotta2026-08-14
💻 computer science

Revolutionizing Finance with LLMs: An Overview of Applications and Insights

تقدم هذه الورقة نظرة شاملة على التكامل الناشئ للنماذج اللغوية الكبيرة (LLMs) في القطاع المالي، مما يبرز فعاليتها في أتمتة مهام مثل إنشاء التقارير والتنبؤ بالسوق من خلال تقييمات شاملة تؤكد قدرة GPT-4 على اتباع التعليمات باللغة الطبيعية عبر تطبيقات مالية متنوعة.

Huaqin Zhao, Zhengliang Liu, Zihao Wu, Yiwei Li, Tianze Yang, Peng Shu, Shaochen Xu, Haixing Dai, Lin Zhao, Hanqi Jiang (…)2026-08-14
💻 computer science

SLAyiNG: A Diverse and Community-validated Dataset of Queer Slang

تقدم هذه الورقة "SLAyiNG"، وهي أول مجموعة بيانات تم التحقق منها مجتمعياً وتضم أكثر من 500 مصطلح من العامية المثلية باللغة الإنجليزية عبر 20 مجتمعاً فرعياً، والتي تكشف أنه في حين تفتقر العديد من النماذج اللغوية إلى انحياز التمثيل ضد الهويات المثلية، إلا أنها لا تزال تواجه صعوبة في معالجة العامية المثلية — لا سيما العامية المنتمية للمجتمعات الأفريقية الأمريكية واللاتينية — مما يسلط الض الضوء على الحاجة إلى موارد لغوية متنوعة لتحسين أنظمة معالجة اللغات الطبيعية.

Leonor Veloso, Lea Hirlimann, Lucija Mihić Zidar, Philipp Wicke, Valentin Hofmann, Hinrich Schütze2026-08-14
💬 NLP

Exploratory Semantic Reliability Analysis of Wind Turbine Maintenance Logs using Large Language Models

تقدم هذه الورقة إطار عمل استكشافياً يستفيد من النماذج اللغوية الكبيرة لإجراء تحليل دلالي عميق لسجلات صيانة توربينات الرياح غير المهيكلة، مما يتيح مهاماً متقدمة مثل تحديد أنماط الفشل والاستدلال السببي التي تحول النصوص الخام إلى رؤى موثوقية قابلة للتنفيذ تتجاوز طرق التصنيف التقليدية.

Max Malyi, Jonathan Shek, Andre Biscaya2026-08-14
💻 computer science

Gradual Code-Switching as Inference-Time Cross-Lingual Representational Alignment for LLMs

تقدم هذه الورقة البحثية "التعلم في السياق عبر تبديل الرموز" (CSICL)، وهو آلية أثناء الاستنتاج تنتقل تدريجياً من اللغات المستهدفة إلى اللغة الإنجليزية لمواءمة المدخلات غير الإنجليزية مع فضاءات الاستدلال المتمحورة حول اللغة الإنجليزية، مما يحسن بشكل كبير أداء النماذج اللغوية الكبيرة متعددة اللغات عبر مختلف اللغات وفي بيئات الموارد المنخفضة.

Haneul Yoo, Jiho Jin, Kyunghyun Cho, Alice Oh2026-08-14