🤖 AI

Beyond Cooperative Simulators: Generating Realistic User Personas for Robust Evaluation of LLM Agents

تقدم هذه الورقة "سياسات الشخصية" (PPol)، وهو إطار عمل قائم على البحث التطوري يولد شخصيات مستخدم متنوعة وشبيهة بالبشر للتغلب على الانحياز التعاوني لمحاكيات النماذج اللغوية الكبيرة القياسية، مما يحسن بشكل كبير من متانة ودقة تقييم وكلاء النماذج اللغوية الكبيرة في سيناريوهات التفاعل الواقعية.

Harshita Chopra, Kshitish Ghate, Aylin Caliskan, Tadayoshi Kohno, Chirag Shah, Natasha Jaques2026-05-14
📊 statistics

RISED: A Pre-Deployment Safety Evaluation Framework for Clinical AI Decision-Support Systems

تقدم الورقة البحثية إطار عمل RISED، وهو إطار شامل لسلامة ما قبل النشر يقيم أنظمة الذكاء الاصطناعي السريري عبر خمسة أبعاد هي: الموثوقية، والشمولية، والحساسية، والعدالة، وقابلية النشر، وذلك للكشف عن الإخفاقات الحرجة التي تغفل عنها مقاييس الدقة الإجمالية وضمان نشر قوي وعادل وممكن تشغيلياً.

Rohith Reddy Bellibatlu2026-05-14
🤖 machine learning

Data Difficulty and the Generalization--Extrapolation Tradeoff in LLM Fine-Tuning

تُثبت هذه الورقة بشكل منهجي أن صعوبة البيانات المثلى للضبط الدقيق الخاضع للإشراف للنماذج اللغوية الكبيرة تعتمد على حجم مجموعة البيانات، مما يكشف عن مقايضة بين التعميم والاستقراء حيث تستفيد ميزانيات البيانات الأكبر من الأمثلة الأكثر صعوبة.

Siyuan Liu (IIIS, Tsinghua University), Tinghong Chen (College of AI, Tsinghua University,Shanghai Qi Zhi Institute), Xi (…)2026-05-14
🤖 AI

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

تقدم هذه الورقة AgentLens، وهو إطار عمل يكشف عن مدى انتشار ظاهرة "المرور بالحظ" (Lucky Pass) في تقييمات وكلاء هندسة البرمجيات (SWE-agent) من خلال إثبات أن الاعتماد فقط على نتائج الاختبار الثنائية يحجب الاختلافات الجوية في جودة الحلول، وتقترح منهجية تقييم على مستوى العمليات باستخدام مراجع "متقبل شجرة البادئة" (Prefix Tree Acceptor) على مستوى المهمة لتصنيف أداء النماذج بدقة أكبر.

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu2026-05-14
🤖 AI

Anatomy-Slot: Unsupervised Anatomical Factorization for Homologous Bilateral Reasoning in Retinal Diagnosis

تقترح الورقة البحثية Anatomy-Slot، وهي طريقة غير خاضعة للإشراف تعمل على تفكيك رموز صور الشبكية إلى فترات تشريحية (anatomical slots) ومحاذاتها عبر العينين المتماثلتين من خلال الانتباه المتقاطع ثنائي الاتجاه، مما يحسن بشكل كبير دقة التشخيص الثنائي والمتانة مقارنة بالنماذج أحادية العين المرجعية.

Yingzhe Ma, Xiao Yang, Yuguo Yin, Zheyu Wang2026-05-14
🤖 AI

AuraMask: An Extensible Pipeline for Developing Aesthetic Anti-Facial Recognition Image Filters

تقدم الورقة البحثية AuraMask، وهو مسار عمل قابل للتوسع يولد مرشحات صور بأسلوب "إنستغرام" جذابة جمالياً، والتي تعطل أنظمة التعرف على الوجوه بفعالية مع تحقيق قبول مستخدم أعلى بكثير من الأساليب التنافسية السابقة.

Jacob Lagogiannis, William Agnew, Rosa I. Arriaga, Sauvik Das2026-05-14
🤖 AI

CRePE: Curved Ray Expectation Positional Encoding for Unified-Camera-Controlled Video Generation

تقترح الورقة البحثية CRePE، وهي طريقة تشفير موضعي مبتكرة تستفيد من توقعات الأشعة المنحنية ومحول انتباه هندسي لتمكين التحكم الموحد والمستقر في الكاميرا والتحكم في الهندسة الخارجية في توليد الفيديو، مما يعالج بفعالية قيود التشفيرات الحالية القائمة على نموذج الثقب الإبري للعدسات ذات الزاوية العريضة وعدسات عين السمكة.

Seonghyun Jin, Youngmin Kim, Sunwoo Park, Jong Chul Ye2026-05-14
🤖 machine learning

The Expressivity Boundary of Probabilistic Circuits: A Comparison with Large Language Models

تحدد هذه الورقة وتحلل فجوة التعبيرية بين الدوائر الاحتمالية والنماذج اللغوية الكبيرة في النمذجة اللغوية ذات الترتيب الذاتي، كاشفةً أنه بينما يمكن لتمثيل المعلمات في فضاء اللوجيت والبنى القابلة للتفكيك أن يخففا من حدة اختناقات معينة، فإن هيكل التوجيه الثابت للدوائر الاحتمالية القابلة للتفكيك المهيكلة يحد بشكل أساسي من قدرتها على نمذجة تضاريس التبعية غير المتجانسة مقارنة بالنماذج المحولة.

Zhiyu Zhao, Xuejie Liu, Muhan Zhang, Anji Liu2026-05-14
🤖 AI

Seg-Agent: Test-Time Multimodal Reasoning for Training-Free Language-Guided Segmentation

تقدم الورقة البحثية Seg-Agent، وهو إطار عمل خالٍ من التدريب يحقق أحدث ما توصل إليه العلم في مجال التجزئة الموجهة لغوياً عبر توظيف حلقة استنتاج متعددة الوسائط صريحة مع تلميحات بصرية من نوع "مجموعة العلامات" (Set-of-Mark) لتمكين التغذية الراجعة البصرية التكرارية، إلى جانب اقتراح معيار تقييم جديد يسمى Various-LangSeg للتقييم الشامل.

Chao Hao, Jun Xu, Ji Du, Shuo Ye, Ziyue Qiao, Xiaodong Cun, Guangcong Wang, Xubin Zheng, Zitong Yu2026-05-14
🤖 AI

AdaFocus: Adaptive Relevance-Diversity Sampling with Zero-Cache Look-back for Efficient Long Video Understanding

يُعد AdaFocus إطار عمل فعال لفهم الفيديوهات الطويلة يتغلب على قيود الترميز أحادي المرحلة الجامد من خلال الجمع بين عينة ذات صلة وتنوع تكيفي مدركة للاستعلام وبين آلية استرجاع من القرص بدون ذاكرة تخزين مؤقت تُحفزها حالة عدم اليقين، وذلك للحصول تدريجياً على أدلة عالية الدقة عند الطلب، محققاً توازناً فائقاً بين الدقة والكفاءة عبر معايسات متعددة.

Xiao Yang, Yingzhe Ma, Haoxuan Yu, Zixin Li, Ning Qin2026-05-14