💬 NLP

Think Before you Write: QA-Guided Reasoning for Character Descriptions in Books

تقترح هذه الورقة إطار تدريب يعمل على فصل الاستنتاج عن التوليد باستخدام نموذج استنتاج موجه بأسئلة وأجوبة لإنتاج مسارات مهيكلة تُهيئ نموذج توليد منفصل، مما يؤدي إلى تحسين الدقة والقدرة المعلوماتية والارتباط بالواقع في أوصاف الشخصيات في السردات الطويلة مقارنة بالنماذج اللغوية الكبيرة القياسية التي تدعم الاستنتاج.

Argyrios Papoudakis, Mirella Lapata, Frank Keller2026-04-14
💬 NLP

Revisiting Compositionality in Dual-Encoder Vision-Language Models: The Role of Inference

تجادل هذه الورقة بأن الأداء التركيبي الضعيف لنماذج الرؤية واللغة ذات المشفر المزدوج ينبع من اعتمادها على تشابه جيب التمام العالمي أثناء الاستدلال، وتوضح أن إدخال آليات محاذاة دقيقة ومنطقة-قطاع خفيفة الوزن فوق التمثيلات المجمدة يعزز بشكل كبير التعميم التركيبي والمتانة تجاه تحولات التوزيع مقارنة بالضبط الدقيق الكامل.

Imanol Miranda, Ander Salaberria, Eneko Agirre, Gorka Azkune2026-04-14
💬 NLP

Policy Split: Incentivizing Dual-Mode Exploration in LLM Reinforcement with Dual-Mode Entropy Regularization

تقترح الورقة البحثية "انقسام السياسة" (Policy Split)، وهو نموذج جديد يعمل على تقسيم سياسة النموذج اللغوي الكبير إلى نمطي الاستكشاف الطبيعي وعالي الاعتلال (high-entropy) اللذين يتشاركان في المعلمات ولكن يتم تحسينهما باستخدام تنظيم اعتلال ثنائي النمط تعاوني لتعزيز الاستكشاف المتنوع دون المساس بدقة المهام.

Jiashu Yao, Heyan Huang, Chuwei Luo, Daiqing Wu, Zeming Liu, Yuhang Guo, Yangyang Kang2026-04-14
💬 NLP

DuET: Dual Execution for Test Output Prediction with Generated Code and Pseudocode

تقدم الورقة البحثية DuET، وهو إطار عمل تنفيذ مزدوج يجمع بين التنفيذ المباشر للكود والاستدلال القائم على الكود الزائف (pseudocode) عبر التصويت بالأغلبية الوظيفية لتحسين موثوقية التنبؤ بمخرجات الاختبار بشكل كبير وتحقيق أداء رائد في LiveCodeBench.

Hojae Han, Jaejin Kim, Seung-won Hwang, Yu Jin Kim, Moontae Lee2026-04-14
💬 NLP

NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment

تقدم هذه الورقة NovBench، وهو أول معيار واسع النطاق وإطار تقييم رباعي الأبعاد مصمم لتقييم قدرة النماذج اللغوية الكبيرة على تقييم حداثة الأوراق الأكاديمية، مما يكشف أن النماذج الحالية تعاني في فهم الحداثة العلمية واتباع التعليمات.

Wenqing Wu, Yi Zhao, Yuzhuo Wang, Siyou Li, Juexi Shao, Yunfei Long, Chengzhi Zhang2026-04-14
💬 NLP

Synthius-Mem: Brain-Inspired Hallucination-Resistant Persona Memory Achieving 94.4% Memory Accuracy and 99.6% Adversarial Robustness on LoCoMo

يُعدّ Synthius-Mem نظام ذاكرة شخصية مهيكل ومستوحى من الدماغ، يحقق أداءً رائدًا في معيار LoCoMo بدقة ذاكرة تبلغ 94.4% ومتانة ضد الهجمات العدائية تصل إلى 99.6%، وذلك عبر استخراج وتنظيم حقائق المستخدم في ستة مجالات معرفية بدلاً من الاعتماد على طرق الاسترجاع التقليدية.

Artem Gadzhiev, Andrew Kislov2026-04-14
💬 NLP

Decomposing and Reducing Hidden Measurement Error in LLM Evaluation Pipelines

تقترح هذه الورقة إطار عمل لتفكيك وتقليل أخطاء القياس الخفية في مسارات تقييم النماذج اللغوية الكبيرة من خلال التمييز بين التباين القابل للاختزال وعدم اليقين الحساس للتصميم، مما يتيح إجراء مقارنة معيارية أكثر قوة، ويمنع التلاعب بالنتائج، ويحسن دقة التقدير بشكل كبير من خلال التصميم الأمثل للمسارات وتخصيص الميزانية.

Solomon Messing2026-04-14
💬 NLP

Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation

تقدم هذه الورقة البحثية "التقييم الذاتي للمعلومات المتبادلة" (MISE)، وهو نموذج جديد للتعلم المعزز يتغلب على تحديات المكافأة الشحيحة في النماذج اللغوية الكبيرة من خلال استخدام التقييم الذاتي التوليدي المتأخر والمعاير كمكافآت كثيفة، وهو نموذج يستند نظرياً إلى تقليل المعلومات المتبادلة، ويثبت تجريبياً أن النماذج مفتوحة المصدر ذات 7 مليارات معلمة يمكنها تحقيق أداء بمستوى GPT-4o دون إشراف خبير.

Jiashu Yao, Heyan Huang, Zeming Liu, Yuhang Guo2026-04-14
💬 NLP

CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity

تقدم هذه الورقة CARTBENCH، وهو معيار مرجعي مستند إلى المتاحف يتكون من أربع مهام فرعية لتقييم فهم الفن الصيني وتفسيره والتحقق من أصالته في نماذج الرؤية واللغة، كاشفةً أنه بينما تحقق النماذج الحالية دقة متوسطة في التعرف، فإنها تعاني بشكل كبير في الاستدلال القائم على الأدلة، والتقدير بأسلوب الخبراء، والتمييز على مستوى المتخصصين في الأصالة.

Xuefeng Wei, Zhixuan Wang, Xuan Zhou, Zhi Qu, Hongyao Li, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe2026-04-14
💬 NLP

Legal2LogicICL: Improving Generalization in Transforming Legal Cases to Logical Formulas via Diverse Few-Shot Learning

تقترح الورقة البحثية إطار عمل Legal2LogicICL، وهو إطار تعلم قليل الأمثلة معزز بالاسترجاع يعمل على تحسين التعميم والدقة في تحويل القضايا القانونية ذات اللغة الطبيعية إلى صيغ منطقية من خلال موازنة تنوع الأمثلة وتشابهها مع التخفيف من حدة انحياز الاسترجاع الناجم عن الكيانات، وكل ذلك مدعوم بمجموعة بيانات Legal2Proleg المستحدثة حديثاً.

Jieying Xue, Phuong Minh Nguyen, Ha Thanh Nguyen, May Myo Zin, Ken Satoh2026-04-14