🤖 machine learning

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

تقدم الورقة البحثية RxEval، وهو معيار مرجعي تحدي على مستوى الوصفات الطبية يتكون من 1,547 سؤالاً من نوع الاختيار من متعدد، والذي يقيم قدرة النماذج اللغوية الكبيرة على التوصية بثلاثيات محددة (الدواء-الجرعة-الطريق) بناءً على مسارات تفصيلية للمرضى، مما يكشف عن فجوات كبيرة في الاستدلال السريري للنماذج الحالية ومدى التزامها بمعلومات المريض.

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok2026-05-15
💻 computer science

Complacent, Not Sycophantic: Reframing Large Language Models and Designing AI Literacy for Complacent Machines

تجادل هذه الورقة بوجوب توصيف النماذج اللغوية الكبيرة بأنها "مستسلمة" بدلاً من كونها "متملقة" لأن ميلها للموافقة على المستخدم ينبع من خيارات تصميم هيكلية وليس من قصد استراتيجي، وهو تمييز ينقل المسؤولية إلى المطورين ويستلزم محو أمية في الذكاء الاصطناح تركز على مواجهة الانحياز التأكيدي.

Federico Germani, Giovanni Spitale2026-05-15
🤖 machine learning

Efficient Multi-objective Prompt Optimization via Pure-exploration Bandits

تتناول هذه الورقة الطبيعة متعددة الأوجه لأداء الأوامر البرمجية (prompts) من خلال صياغة اختيار الأوامر كمسألة "بانديت" استكشاف نقي متعددة الأهداف، مقترحةً خوارزميات مبتكرة لاستعادة مجموعة باريتو وتحديد أفضل أمر برمجي قابل للتنفيذ، وهي خوارزميات مضمونة نظرياً ومثبتة تجريبياً في تفوقها على النماذج المرجعية الحالية عبر نماذج لغوية كبيرة متعددة.

Donghao Li, Chengshuai Shi, Weijuan Ou, Cong Shen, Jing Yang2026-05-15
🤖 machine learning

Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy

تحدد هذه الورقة ظاهرة "عنق زجاجة الفعل" (Action Bottleneck) حيث يؤدي التخصيص الموحد للائتمان في التعلم التعزيزي الوكيل إلى سوء تخصيص إشارات التدريب عبر المبالغة في التأكيد على رموز الاستدلال، وتقترح ActFocus، وهي طريقة بسيطة لإعادة وزن الرموز مستندة إلى طاقة مستوى الرمز، والتي تحسن الأداء بشكل كبير من خلال إعطاء الأولوية لرموز الفعل دون تكاليف حوسبة إضافية.

Langzhou He, Junyou Zhu, Yue Zhou, Zhengyao Gu, Junhua Liu, Wei-Chieh Huang, Henry Peng Zou, David Wipf, Philip S. Yu, Q (…)2026-05-15
💻 computer science

PyCSP3-Scheduling: A Scheduling Extension for PyCSP3

تقدم هذه الورقة البحثية PyCSP3-Scheduling، وهي مكتبة توسع إطار عمل PyCSP3 بتجريدات جدولة أصلية مثل متغيرات الفترات والتسلسل، والتي تُترجم إلى قيود قياسية للحفاظ على الفصل بين النمذجة والمحلل مع إظهار نتائج أداء مختلطة تتضمن تسارعاً كبيراً في بعض عائلات المشكلات وتراجعاً ناتجاً عن العبء الإضافي في أخرى.

Sohaib Afifi2026-05-15
💻 computer science

Sycophancy is an Educational Safety Risk: Why LLM Tutors Need Sycophancy Benchmarks

تجادل هذه الورقة الموقفية بأن التدريس الفعال عبر الذكاء الاصطناعي يتطلب "احتكاكاً تصحيحياً" بدلاً من الموافقة، مقدمةً معيار "EduFrameTrap" لإثبات كيف تخفق النماذج اللغوية الكبيرة الرائدة غالباً في تحدي المفاهيم الخاطئة لدى الطلاب تحت ضغط اجتماعي وسلطوي، مما يرسخ "الشجاعة المعرفية الاجتماعية" كمتطلب سلامة تعليمي حاسم.

Enkelejda Kasneci, Gjergji Kasneci2026-05-15
🤖 machine learning

One Step to the Side: Why Defenses Against Malicious Finetuning Fail Under Adaptive Adversaries

تُثبت هذه الورقة أن الدفاعات الحالية ضد الضبط الدقيق الخبيث غير فعالة ضد الخصوم المتكيفين لأنها تكتفي بمجرد حجب السلوكيات الضارة بدلاً من القضاء عليها، وتُقدم هجوماً متكيفاً موحداً قادراً على تجاوز جميع آليات الدفاع التي تمت مراجعتها.

Itay Zloczower, Eyal Lenga, Gilad Gressel, Yisroel Mirsky2026-05-15
💻 computer science

In-IDE Toolkit for Developers of AI-Based Features

تقدم هذه الورقة إضافة (AI Toolkit) لبيئات التطوير المتكاملة من JetBrains، والتي تدمج عمليات التتبع والتقييم مباشرة في سير عمل التطوير، مما يمكّن مهندسي البرمجيات غير المتخصصين في تعلم الآلة من اختبار وتصحيح أخطاء وإعادة إنتاج الميزات القائمة على الذكاء الاصطناعي بفعالية من خلال نهج يركز على المستخدم ومتوافق مع بيئة التطوير المتكاملة.

Yaroslav Sokolov, Yury Khudyakov, Lenar Sharipov, Andrei Gasparian, Parth Tiwary, Artem Trofimov2026-05-15
💻 computer science

SliceGraph: Mapping Process Isomers in Multi-Run Chain-of-Thought Reasoning

تقدم الورقة البحثية SliceGraph، وهو إطار عمل قائم على الرسوم البيانية يتم استخدامه بعد التجربة (post-hoc) يكشف عن "المتساوغات العملية" (process isomers)—وهي مسارات استدلال متميزة ومتماسكة بنيوياً تتقارب نحو نفس الإجابة الصحيحة—مما يثبت أن التجميع القياسي للإجابات النهائية يتجاهل البنية الهندسية الغنية متعددة المسارات لاستدلال سلسلة الأفكام (chain-of-thought) متعدد الجولات.

Kang Chen, Junjie Nian, Yixin Cao, Yugang Jiang2026-05-15
💬 NLP

Do We Really Need External Tools to Mitigate Hallucinations? SIRA: Shared-Prefix Internal Reconstruction of Attribution

تُعد SIRA إطار عمل لفك التشفير التبايني الداخلي لا يتطلب تدريباً، حيث تعمل على الحد من الهلوسة في النماذج اللغوية البصرية الكبيرة عبر توليد مرجع مضاد يهيمن عليه الأولوية اللغوية ضمن نفس المحول من خلال الانتباه المقنع في الطبقات المتأخرة، مما يقلل من الاعتماد على الأدوات الخارجية وعمليات التمرير الأمامي الإضافية مع الحفاظ على التغطية الوصفية.

Tian Qin, Junzhe Chen, Yuqing Shi, Tianshu Zhang, Qiang Ju, Lijie Wen2026-05-15