💬 NLP

PersianMedQA: Evaluating Large Language Models on a Persian-English Bilingual Medical Question Answering Benchmark

تقدم هذه الورقة PersianMedQA، وهي مجموعة بيانات ضخمة ثنائية اللغة تضم 20,785 سؤالاً من امتحانات طبية باللغة الفارسية تم التحقق منها من قبل خبراء، لتقييم 41 نموذجاً لغوياً كبيراً من أحدث النماذج، وتكشف أنه بينما تتفوق النماذج العامة ذات الأوزان المغلقة على النماذج الفارسية المتخصصة، فإن الفروق الثقافية والسريرية الدقيقة في اللغة الأصلية تظل بالغة الأهمية للاستنتاج الطبي الدقيق.

Mohammad Javad Ranjbar Kalahroodi, Amirhossein Sheikholselami, Sepehr Karimi, Sepideh Ranjbar Kalahroodi, Heshaam Faili (…)2026-05-27
💬 NLP

AlignEvoSkill: Towards Knowledge-Aware and Task-Aligned Agent Skill Evolution

يُعد AlignEvoSkill إطار عمل مبتكر يعزز أداء الوكلاء القائمين على النماذج اللغوية الكبيرة من خلال تطوير مهارات قابلة لإعادة الاستخدام عبر تحسين مشترك لتغطية المعرفة والمواءمة مع المهام، محققاً بذلك نتائج رائدة بأقل التكاليف الحسابية.

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng2026-05-27
💬 NLP

PICACO: Pluralistic In-Context Value Alignment of LLMs via Total Correlation Optimization

تُعد PICACO طريقة مبتكرة للمحاذاة في سياق التعليمات تعالج عقبة التعليمات في التعامل مع القيم البشرية التعددية من خلال تحسين تعليمات وصفية عبر تعظيم الارتباط الكلي، مما يمكّن النماذج اللغوية الكبيرة من موازنة قيم متعددة ومتضاربة بفعالية دون الحاجة إلى الضبط الدقيق.

Han Jiang, Dongyao Zhu, Zhihua Wei, Xiaoyuan Yi, Ziang Xiao, Xing Xie2026-05-27
💬 NLP

SONAR-LLM: Autoregressive Transformer that Thinks in Sentence Embeddings and Speaks in Tokens

تقدم الورقة البحثية SONAR-LLM، وهو نموذج محول (transformer) يعتمد على فك التشفيد فقط (decoder-only)، يقوم بتوليد النصوص عبر التنبؤ بتمثيلات الجمل المستمرة ضمن فضاء SONAR مع تدريبه عبر هدف الإنتروبيا المتقاطعة على مستوى الرمز (token-level cross-entropy)، مما يجمع بين التجريد الدلالي لنماذج المفاهيم الكبيرة (Large Concept Models) وكفاءة التدريب القائم على الاحتمالية للتنبؤ بالرموز التتابعي (autoregressive).

Nikita Dragunov, Temurbek Rahmatullaev, Elizaveta Goncharova, Nikita Kurdiukov, Aysel Mirzoeva, Anna Borisiuk, Andrey Ku (…)2026-05-27
💬 NLP

Learning GUI Grounding with Spatial Reasoning from Visual Feedback

تقدم هذه الورقة البحثية نموذج GUI-Cursor، الذي يعيد صياغة عملية تحديد المواقع في واجهات المستخدم الرسومية (GUI grounding) كمهة بحث تفاعلية باستخدام التغذية الراجعة البصرية من مؤشر (cursor) مُصوَّر والتعلم التعزيزي للتغلب على قيود التنبؤ بالإحداثيات في النماذج اللغوية البصرية (Vision Language Models)، محققاً بذلك أداءً فائقاً في مهام الاستدلال المكاني والمهام الوكيلية (agentic tasks) ببيانات تدريب أقل.

Yu Zhao, Wei-Ning Chen, Huseyin Atahan Inan, Samuel Kessler, Lu Wang, Lukas Wutschitz, Fangkai Yang, Chaoyun Zhang, Pasq (…)2026-05-27
💬 NLP

When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation

تكشف هذه الورقة أن المعايير المرجعية المؤتمتة التي يتم إنشاؤها وتقييمها بواسطة النماذج اللغوية الكبيرة تعاني من انحياز ذاتي جوهري، حيث تفضل النماذج مخرجاتها بشكل منهجي بسبب نزعات أسلوبية تراكمية في كل من إنشاء مجموعة الاختبار والتقييم، مما يؤدي غالباً إلى تصنيفها لنفسها بشكل غير صحيح على أنها متفوقة على أقرانها.

Wenda Xu, Sweta Agrawal, Vilém Zouhar, Markus Freitag, Daniel Deutsch2026-05-27
💬 NLP

HiSpec: Hierarchical Speculative Decoding for LLMs

تُعد HiSpec إطار عمل للفك التخميني عالي الإنتاجية يستفيد من نماذج الخروج المبكر لعمليات التحقق الوسيطة منخفضة التكلفة، ويعيد استخدام الحالات الحسابية عبر نماذج المسودة والتحقق والهدف لتسريع استنتاج النماذج اللغوية الكبيرة بشكل كبير دون المساس بالدقة.

Avinash Kumar, Sujay Sanghavi, Poulami Das2026-05-27
💬 NLP

Plan Then Action:High-Level Planning Guidance Reinforcement Learning for LLM Reasoning

تقترح الورقة البحثية إطار عمل PTA-GRPO، وهو إطار عمل ثنائي المراحل يجمع بين الضبط الدقيق الخاضع للإشراف لتوفير توجيه التخطيط رفيع المستوى وبين التعلم المعزز المدرك للتوجيه لتعزيز قدرات الاستدلال العالمي للنماذج اللغوية الكبيرة بشكل كبير عبر مختلف الاختبارات المرجعية الرياضية والعلمية.

Zhihao Dou, Qinjian Zhao, Zhongwei Wan, Dinggen Zhang, Weida Wang, Towsif Raiyan, Benteng Chen, Qingtao Pan, Yang Ouyang (…)2026-05-27
💬 NLP

To model human linguistic prediction, make LLMs less superhuman

تجادل الورقة البحثية بأن النماذج اللغوية الكبيرة أصبحت أقل فعالية في نمذجة سلوك القراءة البشري لأن دقة تنبؤها الفائقة، المدفوعة ببيانات التدريب المكثفة والذاكرة، تتجاوز القدرات البشرية، وتدعو إلى تطوير نماذج ذات قيود ذاكرة شبيهة بالذاكرة البشرية لتتوافق بشكل أفضل مع التنبؤ اللغوي البشري.

Byung-Doh Oh, Tal Linzen2026-05-27
💬 NLP

EconCausal: A Context-Aware Economic Reasoning Benchmark for Large Language Models

تقدم هذه الورقة EconCausal، وهو معيار مرجعي واسع النطاق يضم أكثر من 10,000 ثلاثية سببية مشروحة سياقياً مستمدة من دراسات اقتصادية رفيعة المستوى، والتي تكشف أنه في حين تستطيع النماذج اللغوية الكبيرة التعامل مع السياقات الثابتة، إلا أنها تواجه صعوبة كبيرة في مراجعة الأحكام السببية عندما تتغير الظروف البيئية أو عند مواجهة أدلة مضللة.

Donggyu Lee, Hyeok Yun, Meeyoung Cha, Sungwon Park, Sangyoon Park, Jihee Kim2026-05-27