💬 NLP

The Reasoning Trap: An Information-Theoretic Bound on Closed-System Multi-Step LLM Reasoning

تقدم هذه الورقة إطار عمل "فخ الاستدلال" (Reasoning Trap)، الذي يستخدم حدود نظرية المعلومات لإثبات أن الاستدلال متعدد الخطوات في الأنظمة المغلقة (مثل المناظرات بين الوكلاء المتعددين) يؤدي حتماً إلى تدهور دقة الاستدلال القائم على الأدلة رغم الحفاظ على دقة الإجابة، وتقترح "الاستدلال السقراطي القائم على الأدلة" (EGSR) كطريقة لاستعادة هذه الأمانة المفقودة.

Kwan Soo Shin2026-05-05
💬 NLP

TCDA: Thread-Constrained Discourse-Aware Modeling for Conversational Sentiment Quadruple Analysis

تقترح هذه الورقة البحثية إطار عمل TCDA، وهو إطار جديد لتحليل الرباعيات الشعورية القائم على الجوانب في المحادثات، والذي يدمج رسماً بيانياً موجهاً غير حلقي مقيداً بالخيط (TC-DAG) لتصفية الضوضاء الهيكلية والحفاظ على التسلسلات الزمنية، جنباً إلى جنب مع تضمين الموضع الدوار المدرك للخطاب (D-RoPE) لحل مشكلة تخفيف المسافة على مستوى الرمز، مما يحقق أداءً هو الأفضل حالياً في مجموعات البيانات المرجعية.

Xinran Li, Xinze Che, Yifan Lyu, Zhiqi Huang, Xiujuan Xu2026-05-05
💬 NLP

Less is More: Geometric Unlearning for LLMs with Minimal Data Disclosure

تقدم هذه الورقة البحثية "التعلم الهندسي غير المباشر" (Geometric Unlearning)، وهي طريقة مبتكرة تعمل بفعالية على إزالة محتوى محدد من النماذج اللغوية الكبيرة دون الحاجة إلى الوصول إلى بيانات التدريب الأصلية، وذلك عبر إسقاط حالات التخطيط في وقت التلقين على هندسة آمنة مدمجة مستخلصة من مطالبات مرجعية دنيا، مما يحقق كبحاً قوياً للمحتهدف مع الحفاظ على المنفعة العامة.

Chenchen Tan, Xinghao Li, Shujie Cui, Youyang Qu, Cunjian Chen, Longxiang Gao2026-05-05
💬 NLP

The Compliance Gap: Why AI Systems Promise to Follow Process Instructions but Don't

تحدد هذه الورقة وتثبت تجريبياً "فجوة الامتثال"، وهي ظاهرة هيكلية حيث توافق نماذج الذكاء الاصطناعي لفظياً على اتباع تعليمات إجرائية محددة ولكنها تتجاوزها بشكل منهجي في الممارسة العملية، وهو سلوك لا يمكن اكتشافه من النص وحده ويتطلب بنية تحتية جديدة للتقييم مثل (BS-Bench) الصادر لقياس دقة العمليات.

Kwan Soo Shin2026-05-05
💬 NLP

Do Large Language Models Plan Answer Positions? Position Bias in Multiple-Choice Question Generation

تكشف هذه الورقة أن النماذج اللغوية الكبيرة تظهر تحيزات موضعية منهجية عند توليد الأسئلة متعددة الخيارات بسبب التخطيط الضمني لمواضع الإجابات داخل تمثيلاتها الخفية، وتثبت أن توجيه التنشيط يمكنه التحكم بفعالية في هذه الحالات الداخلية للسيطرة على هذه التحيزات وتصحيحها.

Xuemei Tang, Xufeng Duan, Zhenguang G. Cai2026-05-05
💬 NLP

Maistros: A Greek Large Language Model Adapted Through Knowledge Distillation From Large Reasoning Models

تقدم هذه الورقة البحثية نموذج Maistros 8B، وهو نموذج لغوي كبير مفتوح الأوزان للغة اليونانية ذو حالة متطورة، تم تطويره من خلال تقطير المعرفة من النماذج الاستدلالية الكبيرة، وتم ضبطه بدقة باستخدام مجموعة بيانات CulturaQA التي أُنشئت حديثاً، إلى جانب إطار تقييم شامل صُمم لمعالجة فجوات الأداء في اللغات ذات الموارد المحدودة.

Nikolaos Giarelis, Charalampos Mastrokostas, Nikos Karacapilidis2026-05-05
💬 NLP

StressEval: Failure-Driven Dynamic Benchmarking for Knowledge-Intensive Reasoning in Large Language Models

تقدم الورقة البحثية StressEval، وهو إطار عمل لتخليق البيانات قائم على الفشل يعمل على تحويل أخطاء النماذج المرصودة إلى حالات اختبار ديناميكية وقابلة للتحكم لإنشاء معيار Dynamic OneEval، والذي يكشف بفعالية أكبر عن فجوات الأداء في الاستدلال القائم على المعرفة مقارنة بالتقييمات الثابتة.

Yongrui Chen, Yangyang Ma, Xiaoying Huang, Shenyu Zhang, Huajun Chen, Haofen Wang, Guilin Qi2026-05-05
💬 NLP

Enhancing Judgment Document Generation via Agentic Legal Information Collection and Rubric-Guided Optimization

تقدم الورقة البحثية "Judge-R1"، وهو إطار عمل موحد يعزز التوليد الآلي لوثائق الأحكام من خلال دمج نظام وكيل لجمع المعلومات القانونية من أجل استرجاع الأدلة بدقة، مع مرحلة تحسين قائمة على التعلم المعزز الموجه بالمعايير لضمان الصرامة المنطقية والالتزام بالمعايير القضائية.

Weihang Su, Xuanyi Chen, Yueyue Wu, Qingyao Ai, Yiqun Liu2026-05-05
💬 NLP

Counting as a minimal probe of language model reliability

تُظهر هذه الورقة أنه على الرغم من الأداء القوي في المعايير القياسية، تفتقر النماذج اللغوية الكبيرة إلى الكفاءة المنطقية العامة من أجل اتباع القواعد بشكل موثوق، كما يتضح من فشلها في العد بما يتجاوز مجموعة محدودة من الحالات الداخلية التي تحا-كي عد الأصابع بدلاً من التنفيذ الإجرائي الحقيقي.

Tianxiang Dai, Jonathan Fan2026-05-05
💬 NLP

What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models

تجادل هذه الورقة بأن معايير دقة المطالبة الواحدة غير كافية لتقييم موثوقية النماذج اللغوية، حيث تثبت من خلال تدقيق متعدد المتغيرات أن خيارات تصميم التقييم، وإشارات الثقة الهشة، وعدم اتساق متانة المطالبة يمكن أن تغير الاستنتاجات بشكل جذري وتخفي الإخفاقات الحرجة في كل من النماذج والمقيمين.

Ranit Karmakar, Jayita Chatterjee2026-05-05