💬 NLP

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

يُعد ScaleBox نظاماً عالي الدقة وقابلاً للتوسع للتحقق من الكود البرمجي، يعالج أوجه القصور في بيئات الاختبار (sandboxes) الحالية من خلال التوليد الآلي للحكام المتخصصين، والتنفيذ المتوازي دقيق التفاصيل، والتنسيق متعدد العقد، مما يحسن بشكل كبير كلاً من دقة وكفاءة تدريب وتقييم النماذج اللغوية الكبيرة على نطاق واسع.

Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpe (…)2026-05-01
💬 NLP

Syntactically-guided Information Maintenance in Sentence Comprehension

تقترح هذه الورقة وتتحقق من صحة تفسير عقلاني لفهم الجمل في اللغة اليابانية، مبرهنةً على أن القراء يحافظون بشكل انتقائي على المعلومات النحوية بناءً على الرؤوس المتوقعة والارتباطات غير المكتملة، حيث تُعد تكاليف الحفاظ الناتجة عوامل متميزة تتوازن مع فوائد القدرة على التنبؤ.

Shinnosuke Isono, Kohei Kajikawa2026-05-01
💬 NLP

HealthBench Professional: Evaluating Large Language Models on Real Clinician Chats

تقدم الورقة البحثية "HealthBench Professional"، وهو معيار مفتوح وصارم يتألف من محادثات صاغها أطباء ومعايير تقييم خضعت لتدقيق الخبراء، لتقييم وتتبع تقدم النماذج اللغوية الكبيرة في المهام السريرية الواقعية، مما يثبت أن نموذج "GPT-5.4" المتخصص يتفوق على كل من النماذج الأساسية والأطباء البشريين.

Rebecca Soskin Hicks, Mikhail Trofimov, Dominick Lim, Rahul K. Arora, Foivos Tsimpourlas, Preston Bowman, Michael Sharma (…)2026-05-01
💬 NLP

Debiasing Reward Models via Causally Motivated Inference-Time Intervention

تقترح هذه الورقة تدخلاًً وقت الاستنتاج مدفوعاً سببياً يعمل على كبح تنشيطات العصبونات المرتبطة بالانحياز في نماذج المكافأة للتخفيف من الحساسية تجاه الميزات الزائفة مثل طول الاستجابة، مما يمكن النماذج الأصغر من تحقيق أداء محاذاة يضاهي نماذج الـ 70 مليار بارامتر المتطورة دون أي مقايضات.

Kazutoshi Shinoda, Kosuke Nishida, Kyosuke Nishida2026-05-01
💬 NLP

Qualitative Evaluation of Language Model Rescoring in Automatic Speech Recognition

تقترح هذه الورقة إطار عمل للتقييم النوعي لأنظمة التعرف التلقائي على الكلام يتجاوز معدل خطأ الكلمات من خلال تقديم مقياسي POSER وEmbER لتحليل التحسينات المورفولوجية-النحوية والدلالية المكتسبة عبر إعادة ترتيب نتائج النموذج اللغوي.

Thibault Bañeras-Roux, Mickaël Rouvier, Jane Wottawa, Richard Dufour2026-05-01
💬 NLP

Entropy of Ukrainian

تقدم هذه الورقة أول دراسة لتقدير اعتلاج (إنتروبيا) اللغة الأوكرانية من خلال تكرار تجربة كلود شانون لتوقع الحروف عام 1951 مع 184 متطوعاً، مما أسفر عن حد أعلى يبلغ حوالي 1.201 بت لكل حرف، ومقارنة هذه النتيجة بنماذج اللغات الكبيرة الحالية.

Anton Lavreniuk, Mykyta Mudryi, Markiian Chaklosh2026-05-01
💬 NLP

HATS: An Open data set Integrating Human Perception Applied to the Evaluation of Automatic Speech Recognition Metrics

تقدم هذه الورقة البحثية HATS، وهي مجموعة بيانات فرنسية جديدة تحتوي على أخطاء نسخ مدركة بشرياً من 143 مُقيِّماً، للتحقيق في وتقييم الارتباط بين التفضيلات البشرية ومختلف مقاييس التعرف التلقائي على الكلام.

Thibault Bañeras Roux, Jane Wottawa, Mickael Rouvier, Teva Merlin, Richard Dufour2026-05-01
💬 NLP

JaiTTS: A Thai Voice Cloning Model

يُعد JaiTTS-v1.0 نموذجاً متطوراً لتحويل النص إلى كلام واستنساخ الأصوات باللغة التايلاندية يعتمد على بنية VoxCPM، حيث يحقق معدلات خطأ في الحروف فائقة الدقة ويتفوق على النماذج التجارية الرائدة في التقييمات البشرية من خلال التعامل بفعالية مع التبديل بين اللغات والأرقام دون الحاجة إلى تطبيع نصي صريح.

Jullajak Karnjanaekarin, Pontakorn Trakuekul, Narongkorn Panitsrisit, Sumana Sumanakul, Vichayuth Nitayasomboon, Nithid (…)2026-05-01
💬 NLP

Language Ideologies in a Multilingual Society: An LLM-based Analysis of Luxembourgish News Comments

تقيم هذه الورقة مدى فعالية النماذج اللغوية الكبيرة، بوجود الترجمة الآلية أو بدونها، في اكتشاف الأيديولوجيات اللغوية ضمن تعليقات المستخدمين باللغة اللوكسمبورغية، وهي لغة ذات موارد محدلة، حيث وجدت أنه على الرغم من عدم كمالها بعد في التصنيف متعدد الفئات، إلا أنها تعمل كأدوات عملية لتحديد المحتوى الأيديولوجي في المجتمعات متعددة اللغات.

Emilia Milano, Alistair Plum, Yves Scherrer, Christoph Purschke2026-05-01
🤖 AI

Contextual Agentic Memory is a Memo, Not True Memory

تجادل هذه الورقة بأن أنظمة الذاكرة الوكيلية الحالية تكتفي بمجرد إجراء عمليات بحث قائمة على التشابه بدلاً من الذاكرة القائمة على الأوزان الحقيقية، وهو خطأ فئوي جوهري يحد من التعميم والأمن، وتقترح اعتماد نهج النظام المزدوج المستوحى من العلوم العصبية لدمج التخزين السريع للنماذج مع ترسيخ القواعد البطيء.

Binyan Xu, Xilin Dai, Kehuan Zhang2026-05-01