💬 NLP

Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

تجادل هذه الورقة بأن طرق تقدير عدم اليقين الحالية للنماذج اللغوية الكبيرة تفشل بشكل جوههري لأنها تكتفي بقياس الاتساق الداخلي للتوليد عبر التجميع غير الخاضع للإشراف بدلاً من قياس الصحة الواقعية الخارجية، مما يخلق شعوراً مخادعاً بالأمان لا يمكنه اكتشاف الهلوسات الواثقة.

Tiejin Chen, Longchao Da, Xiaoou Liu, Hua Wei2026-05-20
💬 NLP

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

تقدم هذه الورقة إطار عمل "عزو الثقة التدريجي" (SCA)، وهو إطار لتشخيص إخفاقات الاستدلال متعدد الخطوات في النماذج اللغوية الكبيرة ذات الصندوق الأسود عبر تطبيق مبدأ "عنق زجاجة المعلومات" لتعيين درجات ثقة على مستوى الخطوة بناءً على هياكل الإجماع، مما يتيح تصحيحاً ذاتياً أكثر فعالية من التغذية الراجعة التقليدية على مستوى الإجابة.

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei2026-05-20
💬 NLP

FormalASR: End-to-End Spoken Chinese to Formal Text

تقدم الورقة البحثية FormalASR، وهو زوج من النماذج المتكاملة (end-to-end) المدمجة (0.6 مليار و1.7 مليار)، والتي تم تدريبها على مجموعات بيانات ضخمة تم إنشاؤها حديثاً لتحويل اللغة الصينية المنطوقة مباشرة إلى نص مكتوب رسمي، مما يقلل بشكل كبير من معدلات الخطأ ويلغي الحاجة إلى نماذج لغوية كبيرة (LLMs) تسبب تأخراً في الاستجابة أثناء المعالجة اللاحقة.

Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang2026-05-20
💬 NLP

DECOR: Auditing LLM Deception via Information Manipulation Theory

تقدم هذه الورقة DECOR، وهو إطار عمل متعدد الوكلاء قائم على نظرية التلاعب بالمعلومات، والذي يحقق تدقيقاً دقيقاً وقابلاً للتفسير وبأداء هو الأفضل حالياً لخداع النماذج اللغوية الكبيرة من خلال تفكيك الاستجابات إلى وحدات ذرية وتصنيفها عبر أربعة أبعاد للتلاعب.

Linyue Cai, Samuel Yeh, Jwala Dhamala, Rahul Gupta, Sharon Li2026-05-20
💬 NLP

OpenCompass: A Universal Evaluation Platform for Large Language Models

تقدم هذه الورقة OpenCompass، وهو منصة تقييم مفتوحة المصدر، وقابلة للتوسع، وعالية التزامن، صُممت للتغلب على قيود المعايير المرجعية الاستاتيكية التقليدية من خلال توفير إطار عمل معياري وموحد للتقييم الشامل والفعال للنماذج اللغوية الكبيرة عبر مجالات متنوعة.

Maosong Cao, Kai Chen, Haodong Duan, Yixiao Fang, Tong Gao, Ge Jiaye, Mo Li, Hongwei Liu, Junnan Liu, Yuan Liu, Chengqi (…)2026-05-20
💬 NLP

Language models struggle with compartmentalization

تُظهر هذه الورقة أن النماذج اللغوية الكبيرة غالباً ما تخفق في توحيد العروض المتباينة للمفهوم الكامن نفسه (مثل اللغات المختلفة أو النماذج البرمجية المختلفة) في تمثيلات داخلية مشتركة، مما يؤدي إلى تعلم زائد، وانخفاض في كفاءة العينات، وتحول طوري في فعالية التدخل بناءً على عدد عروض المفهوم.

Thomas Vincent Howe, David Wingate2026-05-20
💬 NLP

STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision

تقدم الورقة البحثية إطار عمل STAR-PólyaMath، وهو إطار عمل متعدد الوكلاء يتميز بـ "استراتيجي ميتا" (Meta-Strategist) مستمر وحلقات "مستنتج-متحقق" (Reasoner-Verifier) مهيكلة، والذي يحقق أداءً هو الأفضل في فئته على ثمانية معايير مرجعية رياضية رفيعة المستوى من خلال التخفيف الفعال من الهلوسة، وتجزئة الذاكرة، وإساءة استخدام الأدوات عبر الإشراف على مستوى الميتا.

Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong2026-05-20
💬 NLP

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

تقدم الورقة البحثية HalluWorld، وهو معيار مرجعي محكوم يستخدم نماذج عوالم مرجعية صريحة لتقييم وتصنيف الهلوسة في النماذج اللغوية بشكل منهجي، كاشفةً أنه بينما تم حل الأخطاء الإدراكية إلى حد كبير، لا تزال التحديات قائمة في تتبع الحالة متعدد الخطوات، والمحاكاة السببية، والامتناع.

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng2026-05-20
💬 NLP

Retrieval-Augmented Linguistic Calibration

تقدم هذه الورقة البحثية "المعايرة اللغوية المعززة بالاسترجاع" (RALC)، وهي إطار عمل لاحق للتحليل يعمل على نمذجة الثقة اللغوية كتوزيع احتمالي ويستخدم إعادة الكتابة المعززة بالاسترجاع لتحسين دقة وموثوقية العبارات ذات اللغة الطبيعية ومعايرتها بشكل كبير عبر مختلف النماذج اللغوية الكبيرة.

Yi-Fan Yeh, Linwei Tao, Minjing Dong, Tao Huang, Jialin Yu, Philip Torr, Chang Xu2026-05-20
💬 NLP

IMLJD: A Computational Dataset for Indian Matrimonial Litigation Analysis

تقدم هذه الورقة البحثية IMLJD، وهي مجموعة بيانات حوسبية مفتوحة تضم 3,613 حكماً قضائياً من قضايا النزاعات الزوجية الهندية الصادرة عن المحكمة العليا ومحكمة كارناتاكا العليا (2000-2024)، والتي تكشف عن تفاوت كبير في معدلات نجاح عرائض الإبطال بين المحكمتين، إلى جانب بيانات وصفية مهيكلة ورسم بياني معرفي للتحليل القانوني.

Joy Bose2026-05-20