💬 NLP

MAVEN: Multi-Agent Verification-Elaboration Network with In-Step Epistemic Auditing

يُعد MAVEN إطار عمل مستوحى من نظام السبورة (blackboard) ومتعدد الوكلاء، يعمل على تعزيز جودة استدلال النماذج اللغوية الكبيرة والثقة المعرفية عبر فك الارتباط بين الأدوار في حلقة (المشكك-الباحث-القاضي) التنافسية مع التدقيق أثناء الخطوات، متفوقاً بذلك على النماذج أحادية البنية والنماذج القائمة على الإجماع عبر مختلف المعايير والنماذج الأساسية.

Yinsheng Yao, Jiehao Tang, Zhaozhen Yang, Dawei Cheng2026-05-11
💬 NLP

Quality-Conditioned Agreement in Automated Short Answer Scoring: Mid-Range Degradation and the Impact of Task-Specific Adaptation

تكشف هذه الدراسة أنه في حين تؤدي نماذج التصحيح الآلي للإجابات القصيرة أداءً جيداً في الاستجابات الصحيحة أو الخاطئة بوضوح، إلا أنها تظهر تدهوراً كبيراً في الاتفاق مع الخبراء البشريين في الإجابات متوسطة المدى أو الصحيحة جزئياً، وهو قصور يكون في أقصى درجاته في النماذج اللغوية الكبيرة ذات التعلم من أمثلة قليلة ويتحسن مع زيادة التكيف الخاص بالمهمة.

Abigail Victoria Gurin Schleifer, Moriah Ariely, Beata Beigman Klebanov, Asaf Salman, Giora Alexandron2026-05-11
📊 statistics

Reliable Chain-of-Thought via Prefix Consistency

تقدم هذه الورقة البحثية "اتساق البادئة" (prefix consistency)، وهو إشارة موثوقية في وقت الاختبار تعمل على تحسين كفاءة استدلال "سلسلة الأفكار" (Chain-of-Thought) من خلال وزن الإجابات المرشحة بناءً على قابليتها لإعادة الإنتاج بعد الاقتطاع وإعادة التوليد، محققةً دقة التصويت بالأغلبية القياسية بعدد أقل بكثير من الرموز المولدة دون الحاجة إلى الوصول إلى احتمالات السجل (log-probabilities) أو مطالبات التقييم الذاتي.

Naoto Iwase, Yuki Ichihara, Mohammad Atif Quamar, Junpei Komiyama2026-05-11
💬 NLP

TRACE: Tourism Recommendation with Accountable Citation Evidence

تقدم الورقة البحثية TRACE، وهي مجموعة بيانات وإطار تقييم شامل لأنظمة التوصية الحوارية في مجال السياحة، والتي تعالج الفجوة الحرجة في الموثوقية من خلال التقييم المشترك لدقة التوصية، والأدلة الاستشهادية القابلة للتحقق من المراجعات، والتعافي التكيفي من رفض المستخدم عبر 10,000 حوار متعدد الأدوار.

Zixu Zhao, Sijin Wang, Yu Hou, Yuanyuan Xu, Yufan Sheng, Xike Xie, Wenjie Zhang, Won-Yong Shin, Xin Cao2026-05-11
💬 NLP

DRIP-R: A Benchmark for Decision-Making and Reasoning Under Real-World Policy Ambiguity in the Retail Domain

تقدم هذه الورقة DRIP-R، وهو معيار مرجعي جديد مصمم لتقييم قدرات اتخاذ القرار والاستدلال لدى الوكلاء القائمين على النماذج اللغوية الكبيرة في مجال التجزئة، وذلك من خلال اختبار أدائهم بشكل منهجي في سيناريوهات واقعية تتميز بوجود غموض متأصل في السياسات حيث لا يوجد حل واحد صحيح.

Hsuvas Borkakoty, Sebastian Pohl, Cheng Wang, Bei Chen, Yufang Hou2026-05-11
💬 NLP

Guidance Is Not a Hyperparameter: Learning Dynamic Control in Diffusion Language Models

تقترح هذه الورقة إطاراً للتعلم التعزيزي يعامل مقياس التوجيه الخالي من التصنيف في نماذج الانتشار اللغوية كإجراء تحكم ديناميكي قابل للتعلم بدلاً من كونه معلماً فائقاً ثابتاً، مما يثبت أن مسارات التوجيه التكيفية تحسن بشكل كبير المقايضة بين القدرة على التحكم وجودة التوليد عبر مختلف مهام معالجة اللغات الطبيعية.

Fan Zhou, Tim Van de Cruys2026-05-11
💬 NLP

SimCT: Recovering Lost Supervision for Cross-Tokenizer On-Policy Distillation

تقدم الورقة البحثية SimCT، وهي طريقة للتقطير داخل السياسة (on-policy distillation) تعمل على استعادة إشارات إشراف المعلم المفقودة في إعدادات اختلاف أجهزة التجزئة (cross-tokenizer settings) من خلال مقارنة التتمات متعددة الرموز التي يمكن لكلا النموذجين تحقيقها، مما يتغلب على قيود المطابقة الدقيقة للرموز المشتركة ويحسن الأداء في مهام الاستدلال وتوليد الكود.

Jie Sun, Mao Zheng, Mingyang Song, Qiyong Zhong, Yilin Cheng, Bichuan Feng, Pengfei Liu, Junfeng Fang, Xiang Wang2026-05-11
💬 NLP

TextLDM: Language Modeling with Continuous Latent Diffusion

تقدم الورقة البحثية TextLDM، وهو إطار عمل للنمذجة اللغوية يعمل على تكييف بنية محول الانتشار البصري (DiT) مع توليد النصوص عبر رسم خرائط الرموز المنفصلة إلى كامنات مستمرة بواسطة مشفر فك تشفير تلقائي (VAE) معزز بمحاذاة التمثيل (REPA)، محققاً أداءً يضاهي GPT-2 ومتقدماً نحو هدف نماذج الانتشار متعددة الوسائط الموحدة.

Jiaxiu Jiang, Jingjing Ren, Wenbo Li, Bo Wang, Haoze Sun, Yijun Yang, Jianhui Liu, Yanbing Zhang, Shenghe Zheng, Yuan Zh (…)2026-05-11
💬 NLP

Rethinking State Tracking in Recurrent Models Through Error Control Dynamics

تجادل هذه الورقة بأن التتبع القوي للحالة في النماذج المتكررة يعتمد بشكل حاسم على ديناميكيات التحكم في الخطأ بدلاً من مجرد القدرة التعبيرية النظرية، مبرهنةً على أن الشبكات المتكررة التآلفية تفشل حتماً في المهام ذات الآفاق الطويلة بسبب عجزها عن تصحيح الأخطاء المباعدة بين الحالات، مما يؤدي إلى انهيار التتبع المتوقع بمجرد تجاوز الانتشار داخل الفئة لعتبة القابلية للقراءة لدى فك التشفير.

Jiwan Chung, Heechan Choi, Seon Joo Kim2026-05-11
💬 NLP

Tracing Uncertainty in Language Model "Reasoning"

تقدم هذه الورقة طريقة لتقدير وتحليل ملفات تعريف عدم اليقين لمسارات استدلال النماذج اللغوية، مما يثبت أن الأنماط المتميزة في هذه الملفات يمكنها التنبؤ بصحة الإجابة بدقة عالية وتمكين الكشف المبكر عن الأخطاء.

Nils Grünefeld, Bertram Højer, Philipp Mondorf, Barbara Plank, Anna Rogers, Christian Hardmeier, Stefan Heinrich, Jes Fr (…)2026-05-11