💬 NLP

By Their Fruits You Will Know Them: Comparing Formalizations of Law by the Decisions They Encode

تقدم هذه الورقة طريقة للمقارنة المنهجية بين الصياغات القانونية من خلال حصر وتوصيف الحالات الحدية التي تختلف فيها، مما يكشف أن التشابه الهيكلي لا يضمن الاتساق السلوكي، وأن الصياغات التي تولدها النماذج اللغوية الكبيرة يمكن أن تنتج اختلافات متباينة وذات دلالة قانونية.

Julius Vernie, Matthias Grabmair2026-05-26
💬 NLP

Clarification Is Not Enough: Post-Clarification Answering Remains the Bottleneck in Multi-Turn QA

بينما يمكن للضبط الدقيق الخاضع للإشراف أن يحسن بفعالية قدرة النموذج على تقرير متى يطرح أسئلة توضيحية في الأسئلة والأجوبة متعددة الأدوار، إلا أن العائق الرئيسي يظل عدم قدرة النظام على تفسير استجابات المستخدم بدقة وتوليد الإجابات النهائية الصحيحة حتى بعد حدوث التوضيح.

Jinyan Su, Jennifer Healey2026-05-26
💬 NLP

JudgmentBench: Comparing Rubric and Preference Evaluation for Quality Assessment

تقدم هذه الورقة البحثية JudgmentBench، وهو معيار مرجعي جديد لـ 30 مهمة قانونية تم تصنيفها من قبل محامين خبراء باستخدام كل من درجات التقييم وفق معايير محددة والتفضيلات الثنائية، مما يثبت أن الأحكام المقارنة تتفوق بشكل كبير على التسجيل القائم على المعايير في استعادة ترتيب الجودة مع تطلب أقل من نصف وقت التصنيف.

Russell Yang, Ruishi Chen, Pierce Kelaita, Riya Ranjan, Sibo Ma, Charles Dickens, Matthew Guillod, Megan Ma, Julian Nyar (…)2026-05-26
💬 NLP

Inference Time Optimization with Confidence Dynamics

تقدم هذه الورقة البحثية "كسب الثقة الديناميكي" (Confidence Dynamic Gain - CDG)، وهو أسلوب مبتكر للتحسين أثناء الاستنتاج يستفيد من أنماط مسار الثقة المتميزة بين مسارات الاستدلال الصحيحة والخاطئة لتحسين اختيار الإجابات والأداء بشكل كبير عبر نماذج لغوية كبيرة متعددة ومعايير اختبار رياضية.

Yu Wang, Minghao Liu, Jiayun Wang, Jinrui Huang, Ankit Shah, Wei Wei2026-05-26
💬 NLP

Knowing but Not Showing: LLMs Recognize Ambiguity but Rarely Ask Clarifying Questions

تكشف الورقة عن فجوة كبيرة في النماذج اللغوية الكبيرة حيث، على الرغم من قدرتها على التعرف صراحةً على غموض الاستعلام، فإنها تميل بشكل مفرط إلى تقديم إجابات مباشرة بدلاً من طرح أسئلة توضيحية، وهو توجه يتفاقم أكثر عند توفر سياق مسترجع.

Jinyan Su, Claire Cardie2026-05-26
💬 NLP

Tool-Call Dependency Structure is Linearly Decodable in LLM Agent Residual Streams

تُثبت هذه الورقة أن الرسم البياني للتبعية الموجهة لمسارات استدعاء الأدوات في وكلاء النماذج اللغوية الكبيرة قابل للفك الخطي من التدفقات المتبقية للنموذج، مما يكشف أن الشبكة تمثل بنشاط الطوبولوجيا التجريدية للتنفيذ بدلاً من مجرد تتبع الترتيب الموضعي أو قيم المعرفات.

Tianda Sun, Dimitar Kazakov2026-05-26
💬 NLP

P1SCO: Social Dimensions from a Perspectivist Lens

تقدم الورقة البحثية P1SCO، وهي مجموعة بيانات جديدة من تعليقات وسائل التواصل الاجتماعي المصنفة عبر عشرة أبعاد اجتماعية مع بيانات وصفية غنية للمُصنفين، والمصممة لتسهيل الأبحاث الدقيقة حول كيفية تباين التصورات الاجتماعية عبر المنصات والأفراد والعوامل الديموغرافية.

Amanda Cercas Curry, Gianmarco de Francisci Morales, Luca Maria Aiello2026-05-26
💬 NLP

GeoMathCode: Understanding Interleaved Math-Code Reasoning for Geometry Problem Solving

تقدم هذه الورقة GeoMathCode، وهو إطار عمل يعزز حل المسائل الهندسية باستخدام الكود البرمجي كمخرجات بصرية وسيطة، كاشفاً أن الضبط الدقيق الخاضع للإشراف يفصل بين الاستدلال وتوليد الكود بينما تلتقط البنى النحوية الهرمية معلومات رياضية أغنى من التمثيلات البصرية.

Yingji Zhang, Yong Dai, André Freitas2026-05-26
🤖 AI

Second Guess: Detecting Uncertainty Through Abstention and Answer Stability in Small Language Models

تقدم الورقة البحثية "Second Guess"، وهي تقنية توجيه خفيفة الوزن وخالية من المعلمات للنماذج اللغوية الصغيرة، تكتشف عدم اليقين وتحسن الموثوقية في الإجابة على أسئلة الاختيار من متعدد من خلال الاستفادة من استقرار الإجابة عند تضمين خيار "لا أعرف".

Ashwath Vaithinathan Aravindan, Mayank Kejriwal2026-05-26
💬 NLP

LLM-as-a-Reviewer: Benchmarking Their Ability, Divergence, and Prompt Injection Resistance as Paper Reviewers

تقدم هذه الورقة تقييماً معيارياً منهجياً لـ 12 نموذجاً لغوياً كبيراً تعمل كمراجع لـ 898 ورقة بحثية من مؤتمرات NeurIPS وICLR، كاشفةً أنه في حين توفر هذه النماذج فائدة في هيكلة التقييمات، إلا أنها تبالغ بشكل منهجي في تقدير الأوراق البحثية الضعيفة، وتختلف عن التقييم البشري في معايير محددة، وتظل عرضة بشكل كبير لهجمات حقن الأوامر.

Lingyao Li, Junjie Xiong, Changjia Zhu, Runlong Yu, Chen Chen, Junyu Wang, Renkai Ma, Zhicong Lu2026-05-26