💬 NLP

Benchmarking and Adapting On-Device LLMs for Clinical Decision Support

تقوم هذه الورقة البحثية بقياس وتكييف نماذج لغوية كبيرة متنوعة ومفتوحة المصدر تعمل على الأجهزة للعمل في مجال دعم القرار السريري، مظهرةً قدرتها على تحقيق دقة تشخيصية تضاهي أو تتجاوز النماذج المملوكة الرائدة مع توفير خصوصية وكفاءة موارد فائقتين، لا سيما عند تعزيزها من خلال الضبط الدقيق.

Alif Munim, Jun Ma, Omar Ibrahim, Alhusain Abdalla, Shuolin Yin, Leo Chen, Bo Wang2026-04-29
💬 NLP

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

تقدم هذه الورقة MGSM-Pro، وهي امتداد متعدد اللغات لمعيار GSM-Symbolic يقيم متانة الاستدلال الرياضي عبر تسع لغات من خلال توليد نماذج متعددة تختلف باختلاف الأرقام، مما يكشف عن انخفاضات كبيرة في الأداء في اللغات ذات الموارد المنخفضة وتفاوت مرونة النماذج تجاه هذه الاضطرابات.

Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiya (…)2026-04-29
💬 NLP

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

تقدم هذه الورقة TimeMachine-bench، وهو معيار مؤتمت ومحدث حياً لتقييم النماذج اللغوية الكبيرة في مهام هجرة البرمجيات على مستوى المستودعات في العالم الحقيقي، كاشفةً أنه بينما تُظهر النماذج وعوداً، إلا أنها تعاني حالياً من مشكلات تتعلق بالموثوقية مثل الحلول الزائفة والاستخدام غير الأمثل للأدوات.

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki2026-04-29
💬 NLP

CodeOCR: On the Effectiveness of Vision Language Models in Code Understanding

تقدم هذه الورقة أول دراسة منهجية تثبت أن تمثيل الشفرة المصدرية كصور يُمكّن نماذج اللغة الرؤية من تحقيق كفاءة حوسبية كبيرة من خلال نسب ضغط عالية مع الحفاظ على الأداء أو حتى تحسينه في مهام مختلفة لفهم الشفرة البرمجية.

Yuling Shi, Chaoxiang Xie, Zhensu Sun, Yeheng Chen, Chenxu Zhang, Longfei Yun, Chengcheng Wan, Hongyu Zhang, David Lo, X (…)2026-04-29
💬 NLP

Elderly-Contextual Data Augmentation via Speech Synthesis for Elderly ASR

تقترح هذه الورقة مساراً لتعزيز البيانات يجمع بين إعادة صياغة النصوص المكتوبة باستخدام النماذج اللغوية الكبيرة وبين توليد الكلام عبر تقنية تحويل النص إلى كلام باستخدام متحدثين مرجعيين من كبار السن لإنتاج بيانات اصطناعية ذات سياق خاص بكبار السن، مما يحسن بشكل كبير من أداء نموذج التعرف التلقائي على الكلام "Whisper" في مجموعات بيانات الكلام منخفضة الموارد الخاصة بكبار السن.

Minsik Lee, Seoi Hong, Chongmin Lee, Sieun Choi, Jian Kim, Jua Han, Jihie Kim2026-04-29
💬 NLP

GAIA-v2-LILT: Multilingual Adaptation of Agent Benchmark beyond Translation

تقدم هذه الورقة GAIA-v2-LILT، وهي امتداد متعدد اللغات تمت إعادة تدقيقه بصرامة لمعيار GAIA، يستخدم سير عمل مطوراً يجمع بين المحاذاة الوظيفية، والتكيف الثقافي، ومعايرة الصعوبة لإثبات أن الترجمة الآلية الدنيا تشوه معايير أداء الوكيل بشكل كبير وأن التوطين السليم يقلص فجوة الأداء متعدد اللغات بشكل جوهري.

Yunsu Kim, Kaden Uhlig, Joern Wuebker2026-04-29
🤖 machine learning

Rethinking Layer Redundancy in Large Language Models: Calibration Objectives and Search for Depth Pruning

تجادل هذه الورقة بأن تكرار الطبقات في النماذج اللغوية الكبيرة ليس خاصية هيكلية متأصلة، بل هو تابع وظيفي لهدف المعايرة، مما يثبت أن اختيار الهدف له تأثير أكبر على نتائج تقليم العمق من خوارزمية البحث المستخدمة تحديداً.

Minkyu Kim, Vincent-Daniel Yun, Youngrae Kim, Youngjin Heo, Suin Cho, Seong-hun Kim, Woosang Lim, Gaeul Kwon2026-04-29
💬 NLP

Independent-Component-Based Encoding Models of Brain Activity During Story Comprehension

تقترح هذه الورقة إطار ترميز قائم على المكونات المستقلة يتغلب على قيود النهج التقليدي القائم على الفوكسل، وذلك من خلال تفكيك بيانات التصوير بالرنين المغناطيسي الوظيفي إلى شبكات وظيفية، مما يتيح مقارنات قوية وقابلة للتفسير وعابرة للمشاركين للاستجابات العصبية للاستماع إلى القصص الطبيعية.

Kamya Hari, Taha Binhuraib, Jin Li, Cory Shain, Anna A. Ivanova2026-04-29
💬 NLP

BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks

تقدم الورقة البحثية BenchGuard، وهو إطار عمل آلي للتدقيق يستفيد من النماذج اللغوية الكبيرة الرائدة لتحديد والتحقق من العيوب في معايير تقييم الوكلاء الموجهة نحو المهام بشكل منهجي، مما يثبت فعاليته في اكتشاف الأخطاء الحرجة التي غفلت عنها المراجعة البشرية بتكلفة منخفضة.

Xinming Tu (Minta), Tianze Wang (Minta), Yingzhou (Minta), Lu, Kexin Huang, Yuanhao Qu, Sara Mostafavi2026-04-29
🤖 machine learning

PolyKV: A Shared Asymmetrically-Compressed KV Cache Pool for Multi-Agent LLM Inference

يُعد PolyKV نظاماً مبتكراً يُمكّن وكلاء استدلال نماذج اللغات الكبيرة (LLM) المتعددين والمتزامنين من مشاركة مجمع ذاكرة تخزين مؤقت (KV cache) واحد مضغوط بشكل غير متماثل —باستخدام تكميم int8 للمفاتيح (Keys) وتكميم 3-بت قائم على تحويل فورييه السريع (FWHT) للقيم (Values)— محققاً خفضاً في الذاكرة يصل إلى 97.7% مع تدهور طفيف في الارتباك (perplexity) مع الحفاظ على جودة مخرجات عالية عبر مختلف أحجام النماذج وأطوال السياق.

Ishan Patel, Ishan Joshi2026-04-29