💬 NLP

Position: Uncertainty Quantification in LLMs is Just Unsupervised Clustering

تجادل هذه الورقة بأن طرق تقدير عدم اليقين الحالية للنماذج اللغوية الكبيرة تفشل بشكل جوههري لأنها تكتفي بقياس الاتساق الداخلي للتوليد عبر التجميع غير الخاضع للإشراف بدلاً من قياس الصحة الواقعية الخارجية، مما يخلق شعوراً مخادعاً بالأمان لا يمكنه اكتشاف الهلوسات الواثقة.

Tiejin Chen, Longchao Da, Xiaoou Liu, Hua Wei2026-05-20
💬 NLP

Diagnosing Multi-step Reasoning Failures in Black-box LLMs via Stepwise Confidence Attribution

تقدم هذه الورقة إطار عمل "عزو الثقة التدريجي" (SCA)، وهو إطار لتشخيص إخفاقات الاستدلال متعدد الخطوات في النماذج اللغوية الكبيرة ذات الصندوق الأسود عبر تطبيق مبدأ "عنق زجاجة المعلومات" لتعيين درجات ثقة على مستوى الخطوة بناءً على هياكل الإجماع، مما يتيح تصحيحاً ذاتياً أكثر فعالية من التغذية الراجعة التقليدية على مستوى الإجابة.

Xiaoou Liu, Tiejin Chen, Dengjia Zhang, Yaqing Wang, Lu Cheng, Hua Wei2026-05-20
🤖 AI

AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees

تُعد AquaUI طريقة لتقليل الرموز (tokens) أثناء وقت الاستدلال دون الحاجة إلى تدريب، وهي مخصصة لوكلاء واجهة المستخدم الرسومية (GUI agents)، حيث تستخدم أشجار كوادرتي (quadtrees) تكيُّفية لاستغلال كثافة المعلومات المكانية غير المنتظمة لقطات الشاشة، مما يحقق تسريعاً كبيراً وتقليلاً في عدد الرموز مع الحفاظ على أداء يقارب الأداء الكامل والاتساق الزمني عبر التفاعلات متعددة الخطوات.

Yuankai Li, Tinghui Zhu, Ha Min Son, Zhe Zhao, Xin Liu, Muhao Chen2026-05-20
💬 NLP

FormalASR: End-to-End Spoken Chinese to Formal Text

تقدم الورقة البحثية FormalASR، وهو زوج من النماذج المتكاملة (end-to-end) المدمجة (0.6 مليار و1.7 مليار)، والتي تم تدريبها على مجموعات بيانات ضخمة تم إنشاؤها حديثاً لتحويل اللغة الصينية المنطوقة مباشرة إلى نص مكتوب رسمي، مما يقلل بشكل كبير من معدلات الخطأ ويلغي الحاجة إلى نماذج لغوية كبيرة (LLMs) تسبب تأخراً في الاستجابة أثناء المعالجة اللاحقة.

Wanyi Ning, Yinshang Guo, Haitao Qian, Jiyuan Cheng, Weiyuan Feng, Yufei Zhang2026-05-20
🤖 AI

Exploring and Developing a Pre-Model Safeguard with Draft Models

تقترح هذه الورقة وسيلة حماية ما قبل النموذج تستفيد من قابلية انتقال هجمات كسر الحماية من النماذج اللغوية الكبيرة إلى نماذج المسودة الأصغر لتوليد استجابات مسودة، مما يمكّن الحواجز الموجودة من اكتشاف المطالبات غير الآمنة بدقة أكبر قبل استدلال النموذج المستهدف مع تجنب التكاليف الحسابية العالية للتدقيق ما بعد النموذج.

Hongyu Cai, Arjun Arunasalam, Yiming Liang, Antonio Bianchi, Z. Berkay Celik2026-05-20
💬 NLP

STAR-PólyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision

تقدم الورقة البحثية إطار عمل STAR-PólyaMath، وهو إطار عمل متعدد الوكلاء يتميز بـ "استراتيجي ميتا" (Meta-Strategist) مستمر وحلقات "مستنتج-متحقق" (Reasoner-Verifier) مهيكلة، والذي يحقق أداءً هو الأفضل في فئته على ثمانية معايير مرجعية رياضية رفيعة المستوى من خلال التخفيف الفعال من الهلوسة، وتجزئة الذاكرة، وإساءة استخدام الأدوات عبر الإشراف على مستوى الميتا.

Jiaao Wu, Xian Zhang, Hanzhang Liu, Sophia Zhang, Fan Yang, Yinpeng Dong2026-05-20
💬 NLP

HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models

تقدم الورقة البحثية HalluWorld، وهو معيار مرجعي محكوم يستخدم نماذج عوالم مرجعية صريحة لتقييم وتصنيف الهلوسة في النماذج اللغوية بشكل منهجي، كاشفةً أنه بينما تم حل الأخطاء الإدراكية إلى حد كبير، لا تزال التحديات قائمة في تتبع الحالة متعدد الخطوات، والمحاكاة السببية، والامتناع.

Emmy Liu, Varun Gangal, Michael Yu, Zhuofu Tao, Karan Singh, Sachin Kumar, Steven Y. Feng2026-05-20
💬 NLP

IMLJD: A Computational Dataset for Indian Matrimonial Litigation Analysis

تقدم هذه الورقة البحثية IMLJD، وهي مجموعة بيانات حوسبية مفتوحة تضم 3,613 حكماً قضائياً من قضايا النزاعات الزوجية الهندية الصادرة عن المحكمة العليا ومحكمة كارناتاكا العليا (2000-2024)، والتي تكشف عن تفاوت كبير في معدلات نجاح عرائض الإبطال بين المحكمتين، إلى جانب بيانات وصفية مهيكلة ورسم بياني معرفي للتحليل القانوني.

Joy Bose2026-05-20
💬 NLP

PAVE: A Cognitive Architecture for Legitimate Violation in Generative Agent Societies

تقدم هذه الورقة PAVE، وهي بنية معرفية مبتكرة رباعية النماذج تمكن الوكلاء التوليديين من اتخاذ قرارات مهيكلة، وقابلة للتفسير، ومعقولة لانتهاك القواعد بشكل مشروع فقط عندما تقتضي الضرورة القصوى ذلك عبر محفزات الطوارئ، مع الحفاظ على الامتثال للسلطة والنطاق المحدود.

Ahmad Yehia, Abduallah Mohamed, Kun Qian, Tianyi Wang, Jiseop Byeon, Omar Hassanin, Christian Claudel2026-05-20
🧬 biology

Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

تُظهر هذه الدراسة أن الضبط الدقيق للنماذج التأسيسية المخصصة للفعل (LAMs) مقابل النماذج المخصصة للاستدلال (VLMs) أثناء اللعب الطبيعي يؤدي إلى أنماط محاذاة دماغية متميزة، حيث تُظهر نماذج (LAMs) تمثيلات غير متماثلة ومتخصصة في الفعل في المناطق الجبهية الحركية، بينما يتفوق كلا النموذجين على النماذج المرجعية للتعلم التعزيزي مع تدرج المكاسب على طول التسلسل الهرمي للمعالجة القشرية.

Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish G (…)2026-05-20