💬 NLP

Personalized RewardBench: Evaluating Reward Models with Human Aligned Personalization

تقدم الورقة البحثية Personalized RewardBench، وهو معيار مرجعي مبتكر يقيم نماذج المكافأة بناءً على قدرتها على التوافق مع تفضيلات المستخدمين الفردية باستخدام معايير صارمة، مما يثبت أن النماذج الحالية المتطورة تعاني في تحقيق التخصيص وأن هذا المعيار يتفوق بشكل كبير على الخطوط المرجعية الحالية في التنبؤ بالأداء اللاحق.

Qiyao Ma, Dechen Gao, Rui Cai, Boqi Zhao, Hanchu Zhou, Junshan Zhang, Zhe Zhao2026-04-09
💬 NLP

CodeMind: Evaluating Large Language Models for Code Reasoning

تقدم هذه الورقة CodeMind، وهو إطار عمل يقيم قدرات الاستنتاج البرمجي للنماذج اللغوية الكبيرة من خلال ثلاث مهام متميزة — التنفيذ المستقل، والمواصفات، والاستنتاج الدلالي الديناميكي — كاشفاً أنه بينما يمكن للنماذج التعامل مع الجوانب الديناميكية الأساسية، فإن أداءها يتدهور مع زيادة التعقيد ولا يظهر أي ارتباط مع قدرات إصلاح الأخطاء البرمجية.

Changshu Liu, Yang Chen, Reyhaneh Jabbarvand2026-04-08
💬 NLP

Exploring Continual Fine-Tuning for Enhancing Language Ability in Large Language Model

تتقصى هذه الورقة كيف تؤثر التشابه بين مراحل الضبط الدقيق المتسلسل على قدرة النماذج اللغوية الكبيرة على اكتساب لغات جديدة دون نسيان مهارات المهام الحالية، مبرهنةً على أن أساليب تجميد الطبقات المصممة خصيصاً وطرق إعادة التوليد يمكن أن تخفف بفعالية من تدهور الأداء عند التكيف مع مجموعات بيانات متعددة اللغات غير متشابهة.

Divyanshu Aggarwal, Sankarshan Damle, Navin Goyal, Satya Lokam, Sunayana Sitaram2026-04-08
💬 NLP

LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification

يُعد LongSpec إطار عمل مبتكر يتيح فك تشفير استباقي غير فاقد للمعلومات وفعال لنماذج اللغات الكبيرة ذات السياق الطويل، وذلك عبر تقديم نموذج مسودة موفر للذاكرة بذاكرة تخزين مؤقت (KV cache) ثابتة الحجم، وفهارس مواضع جديدة لسد الفجوات بين التدريب والاستنتاج، واستراتيجية تجميع انتباه محسنة، مما يحقق تسريعاً كبيراً مقارنة بالنماذج المرجعية الحالية.

Penghui Yang, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An2026-04-08
💬 NLP

Phonetic Perturbations Reveal Tokenizer-Rooted Safety Gaps in LLMs

تقدم هذه الورقة CMP-RT، وهو مسبار تشخيصي يثبت أن الاضطرابات الصوتية التي تستغل آليات التجزئة (tokenization) تعمل على تفتيت الرموز ذات الأهمية المتعلقة بالسلامة إلى كلمات فرعية حميدة، مما يؤدي إلى تجاوز ضوابط السلامة في النماذج اللغوية الكبيرة الحديثة ويكشف عن فجوة هيكلية جوهرية بين مرحلة ما قبل التدريب ومرحلة ضبط السلامة.

Darpan Aswal, Siddharth D Jaiswal2026-04-08
💬 NLP

ProRank: Prompt Warmup via Reinforcement Learning for Small Language Models Reranking

يقدم ProRank إطار عمل تدريب مبتكر يتكون من مرحلتين يجمع بين التعلم التعزيزي لإحماء المطالبات وتعلم الدرجات دقيق التفاصيل للتغلب على قيود التعبير وفهم المطالبات في نماذج اللغات الصغيرة، مما يمكّن نموذجاً بـ 0.5 مليار معلمة من التفوق على نماذج إعادة التصنيف الأكبر حجماً في اختبارات معيارية مثل BEIR مع الحفاظ على الكفاءة الحسابية.

Xianming Li, Aamir Shakir, Rui Huang, Julius Lipp, Benjamin Clavié, Jing Li2026-04-08
💬 NLP

MedGemma Technical Report

تقدم الورقة البحثية MedGemma، وهي مجموعة من النماذج التأسيسية الطبية للرؤية واللغة المبنية على Gemma 3، والتي تتفوق بشكل كبير إلى جانب مشفر رؤية متخصص يسمى MedSigLIP على النماذج الأساسية وتقترب من أداء المهام المتخصصة عبر مختلف مهام التصوير والنصوص الطبية مع الحفاظ على القدرات العامة.

Andrew Sellergren, Sahar Kazemzadeh, Tiam Jaroensri, Atilla Kiraly, Madeleine Traverse, Timo Kohlberger, Shawn Xu, Fayaz (…)2026-04-08
💬 NLP

Enhancing Hallucination Detection via Future Context

تقترح هذه الورقة إطار عمل للكشف عن الهلوسة في النماذج اللغوية الكبيرة ذات الصندوق الأسود، والذي يستفيد من السياقات المستقبلية التي يتم أخذ عينات منها لتحديد الأخطاء المستمرة، مما يظهر تحسينات كبيرة في الأداء عبر مختلف طرق أخذ العينات.

Joosung Lee, Cheonbok Park, Hwiyeol Jo, Jeonghoon Kim, Joonsuk Park, Kang Min Yoo2026-04-08
💬 NLP

CharBench: Evaluating the Role of Tokenization in Character-Level Tasks

تقدم هذه الورقة CharBench، وهو معيار واسع النطاق يوضح أن النماذج اللغوية الكبيرة الحديثة تعاني في المهام المتعلقة بمستوى الحروف، ويكشف أن التجزئة (tokenization) لها تأثير ضعيف على أداء العد، لكنها تعيق بشكل كبير فهم المواضع داخل الكلمات عندما تكون الحروف مدمجة في رموز (tokens) أطول.

Omri Uzan, Yuval Pinter2026-04-08
💬 NLP

GrACE: A Generative Approach to Better Confidence Elicitation and Efficient Test-Time Scaling in Large Language Models

تقدم الورقة البحثية GrACE، وهو نهج توليدي يُمكّن النماذج اللغوية الكبيرة من إنتاج تقديرات ثقة مُعايرة بدقة وفي الوقت الفعلي عبر قياس التشابه بين الحالات الخفية والرموز الخاصة، مما يحقق موثوقية وكفاءة فائقتين في التوسع أثناء وقت الاختبار دون الحاجة إلى عمليات أخذ عينات إضافية أو نماذج مساعدة.

Zhaohan Zhang, Ziquan Liu, Ioannis Patras2026-04-08