🤖 AI

Why Do Aligned LLMs Remain Jailbreakable: Refusal-Escape Directions, Operator-Level Sources, and Safety-Utility Trade-off

تتقصى هذه الورقة البحثية سبب بقاء النماذج اللغوية الكبيرة المتوافقة قابلة للاختراق عبر تقديم مفهوم "اتجاهات الرفض والهروب" (RED)، حيث تثبت أن هذه الثغرات تنبع من مصادر محددة على مستوى العمليات داخل بنية النموذج، وتوضح أن القضاء عليها يخلق مقايضة متأصلة بين السلامة والمنفعة.

Yu Chen, Yuanhao Liu, Qi Cao2026-05-12
🤖 AI

Fitting Is Not Enough: Smoothness in Extremely Quantized LLMs

تكشف هذه الورقة أن النماذج اللغوية الكبيرة ذات التكميم المفرط تعاني من تدهور منهجي في السلاسة يؤدي إلى رداءة جودة التوليد، وتقترح مبدأً حافظاً للسلاسة يحقق مكاسب في الأداء تتجاوز مجرد التحسينات في الدقة العددية.

Yuzhuang Xu, Xu Han, Yuxuan Li, Pengzhan Li, Wanxiang Che2026-05-12
🤖 AI

FragileFlow: Spectral Control of Correct-but-Fragile Predictions for Foundation Model Robustness

تقدم هذه الورقة FragileFlow، وهو منظم إضافي (plug-in regularizer) يعمل على صياغة والتحكم في أخطاء التنبؤ "الصحيحة ولكن الهشة" عبر تحليل طيفي مدرك للهامش (margin-aware spectral analysis) لتحسين متانة الحالة الأسوأ (worst-class robustness) في النماذج التأسيسية مع الحفاظ على دقة البيانات النظيفة.

Zhuoyun Li, Boxuan Wang, Jinwei Hu, Xiaowei Huang, Yi Dong2026-05-12
🤖 machine learning

Shapley Regression for Rare Disease Diagnosis Support: a case study on APDS

تقدم هذه الورقة "انحدار شابلي" (Shapley regression)، وهو نموذج جديد قائم على نظرية الألعاب يوازن بين القابلية للتفسير والقدرة التنبؤية من خلال رصد التفاعلات المعقدة للأعراض، مما يثبت فعاليته في تحسين تشخيص الاضطراب الوراثي النادر "متلازمة تنشيط PI3K8" (APDS) من خلال كل من مجموعات البيانات العامة وفوج سريري من الواقع العملي.

Safa Alsaidi, Tomás Brogueira, Nizar Mahlaoui, Marc Vincent, Guilherme Pelegrina, Nicolas Garcelon, Adrien Coulet, Migue (…)2026-05-12
🤖 AI

DAPE: Dynamic Non-uniform Alignment and Progressive Detail Enhancement Techniques for Improving the Performance of Efficient Visual Language Models

تقترح هذه الورقة إطار عمل DAPE، وهو إطار عمل مبتكر يعمل على تحسين النماذج اللغوية البصرية الفعالة من خلال تقديم آلية محاذاة ديناميكية غير موحدة ووحدة تعزيز تفاصيل تدريجية لمعالجة التفاوت في كثافة المعلومات وتقليل العبء الحسابي مع تعزيز دقة المهام اللاحقة.

Mengyuan Tian, Qiyan Zhao, Yanan Wang, Da-Han Wang2026-05-12
🤖 AI

OPT-BENCH: Evaluating the Iterative Self-Optimization of LLM Agents in Large-Scale Search Spaces

تقدم هذه الورقة OPT-BENCH، وهو معيار يجمع بين تعلم الآلة والمهام الصعبة (NP-hard) لتقييم قدرات التحسين الذاتي لوكلاء النماذج اللغوية الكبيرة، وتقترح إطار عمل OPT-Agent الذي يوضح أنه بينما تستفيد النماذج الأقوى بشكل أفضل من التغذية الراجعة للتحسين المتكرر، إلا أن قدرتها على التكيف تظل مقيدة بشكل أساسي بالسعة الأساسية وتقع دون أداء الخبراء البشريين.

Xiaozhe Li, Jixuan Chen, Xinyu Fang, Shengyuan Ding, Haodong Duan, Qingwen Liu, Kai Chen2026-05-12
🤖 AI

Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs

تقدم الورقة البحثية OPT-BENCH، وهو إطار عمل شامل يستخدم التعلم التعزيزي القائم على الجودة مع المكافآت القابلة للتحقق (RLVR) لتدريب النماذج اللغوية الكبيرة على مشكلات التحسين ذات التعقيد الحسابي من فئة NP-hard، مما يظهر تحسينات ملحوظة في جودة الحلول والقدرة على التعميم عبر مهام استدلال متنوعة مقارنة بالنماذج الحالية ونهج المكافأة الثنائية.

Xiaozhe Li, Xinyu Fang, Shengyuan Ding, Yang Li, Linyang Li, Haodong Duan, Qingwen Liu, Kai Chen2026-05-12
🤖 AI

Internalizing Safety Understanding in Large Reasoning Models via Verification

تقدم هذه الورقة "السلامة الداخلية" (SInternal)، وهو إطار عمل يعزز متانة نماذج الاستدلال الكبيرة ضد عمليات الاختراق عبر تدريبها على استيعاب فهم السلامة من خلال مهام التحقق الذاتي، مما ينقل المحاذاة من مجرد الامتثال السلوكي إلى التقييم الجوهري للسلامة.

Yi Zhang, Yuxin Chen, Leheng Sheng, Dongcheng Zhang, Chaochao Lu, Xiang Wang, An Zhang2026-05-12
🤖 AI

PnP-Corrector: A Universal Correction Framework for Coupled Spatiotemporal Forecasting

تقدم الورقة البحثية إطار عمل PnP-Corrector، وهو إطار عمل عالمي يفصل بين محاكيات الفيزياء مسبقة التدريب وبين وكيل تصحيح مخصص للتخفيف من تضخيم الخطأ المتبادل وتحسين الاستقرار والدقة على المدى الطويل للتنبؤ المكاني والزماني المقترن بشكل كبير.

Hao Wu, Fan Xu, Yuxu Lu, Penghao Zhao, Fan Zhang, Hao Jia, Yuxuan Liang, Ruijian Gou, Qingsong Wen, Xian Wu, Xiaomeng Hu (…)2026-05-12
🤖 AI

Self-ReSET: Learning to Self-Recover from Unsafe Reasoning Trajectories

تقترح الورقة البحثية Self-ReSET، وهو إطار عمل يعتمد كلياً على التعلم التعزيزي يُمكّن نماذج الاستدلال الكبيرة من تعلم التعافي الذاتي جوهرياً من مسارات استدلالها غير الآمنة، مما يعزز بشكل كبير من متانتها ضد هجمات الاختراق العدائية وهجمات تجاوز القيود خارج نطاق التوزيع مع الحفاظ على المنفعة العامة.

Dongcheng Zhang, Yi Zhang, Yuxin Chen, An Zhang, Xiang Wang, Chaochao Lu2026-05-12