📊 statistics

Bilevel Optimization over Saddle Points of Zero-Sum Markov Games

تقترح هذه الورقة طريقة PANDA، وهي طريقة تدرج سياسة من الدرجة الأولى تعتمد على الجزاء، تحل بكفاءة مشكلات الأمثلة ثنائية المستوى حيث يكون المستوى الأدنى عبارة عن لعبة ماركوف صفرية المجموع، محققةً التقارب إلى النقاط الثابتة بتعقيد عينة أمثل دون الحاجة إلى معلومات من الدرجة الثانية أو افتراضات التحدب.

Zihao Zheng, Irwin King, Songtao Lu2026-05-27
🤖 AI

Completion vs Optimality: Policy Gradient in Long-Horizon Cumulative-Damage Problems

تحدد هذه الورقة وتفكك نمطي فشل متعامدين —الإنجاز والوصول إلى الأمثلية— في طرق تدرج السياسة للمشكلات ذات الأفق الطويل والمتعلقة بالتراكم الضار، وتثبت من خلال التحقق التجريبي في محاكاة بناء الطوب ومسيرة لاعب كرة السلة في الدوري الأمريكي للمحترفين أنه بينما تتيح قيود فضاء العمل إمكانية إنجاز المهمة، إلا أنها غالبًا ما تترك فجوة كبيرة في الأمثلية ناتجة عن الالتزامات الجشعة المبكرة.

Wolfgang Maass, Sabine Janzen2026-05-27
🤖 AI

Respecting Modality Gap in Post-hoc Out-of-distribution Detection with Pre-trained Vision-Language Models

تقترح هذه الورقة إطار عمل عبر الإنترنت يعتمد على الإشراف الزائف، والذي يتعلم النماذج الأولية للفئات المرئية من بيانات الاختبار غير المصنفة لسد الفجوة الجوهرية بين الأنماط بين التمثيلات النصية والمرئية، مما يحقق أفضل النتائج في الكشف اللاحق عن البيانات الخارجة عن التوزيع دون الحاجة إلى بيانات تدريب ضمن التوزيع.

Yuanwei Hu, Bo Peng, Yadan Luo, Zhen Fang, Ling Chen, Jie Lu2026-05-27
💰 quantitative finance

AI evaluation may bias perceptions: The importance of context in interpreting academic writing

تُثبت هذه الورقة أن استخدام المعايير المجمعة للكشف عن النصوص المُنشأة بواسطة الذكاء الاصطناعي في الكتابة الأكاديمية يُدخل تحيزات كبيرة عبر مختلف الدول والمجالات، وتجادل بأن المعايير الخاصة بالسياق ضرورية للتقييم الدقيق والعادل.

Shang Wu, Randol Yao2026-05-27
🤖 AI

MemFail: Stress-Testing Failure Modes of LLM Memory Systems

تقدم هذه الورقة MemFail، وهو معيار تشخيصي يفكك أنظمة ذاكرة النماذج اللغوية الكبيرة إلى عمليات التلخيص، والتخزين، والاسترجاع لعزل وتقييم أوضاع فشل محددة، متجاوزاً بذلك مقاييس الدقة الإجمالية لتقديم رؤى دقيقة حول مفاضلات تصميم النظام.

Ishir Garg, Neel Kolhe, Dawn Song, Xuandong Zhao2026-05-27
🤖 AI

DynFrame: Adaptive Reasoning-Driven Multimodal Framework with Dynamic Frame Augmentation for Complex Video Understanding

يُعد DynFrame إطار عمل متعدد الوسائط وتكيفي يقدم كثافة أخذ عينات إطارية مرمزة وقابلة للتعلم واستراتيجية تدريب GRPO مفككة القطع، لتمكين استرجاع أدلة الفيديو متعددة التدرج بكفاءة وتعيين دقيق للمسؤولية، محققاً أداءً هو الأفضل في فئته في فهم الفيديو المعقد.

Peng Zhang, Guanghao Zhang, Wanggui He, Longxiang Zhang, Mushui Liu, Yan Xia, Zhenhao Peng, Weilong Dai, Jinlong Liu, Ha (…)2026-05-27
🧬 biology

Self-Improvement Imitation with Biologically Guided Search for Protein Design Under Oracle Budgets

تقدم الورقة البحثية SILO، وهو إطار عمل للتقليد ذاتي التحسين على مستوى المسار يجمع بين سياسات التحرير الهرمية، والبحث الشعاعي العشوائي، ودرجة لياقة مسح الألانين لتحقيق تحسين فائق لتسلسل البروتين في ظل ميزانيات أوراكل ضيقة مقارنة بالنماذج المرجعية القائمة على التعلم المعزز والنماذج التوليدية.

Ashima Khanna, Dominik Grimm2026-05-27
🤖 AI

Towards Feedback-to-Plan Decisions for Self-Evolving LLM Agents in CUDA Kernel Generation

تقدم هذه الورقة البحثية \texttt{CUDAnalyst}، وهو إطار تحليل موحد يعزل ويعزو تأثير إشارات التغذية الراجعة غير المتجانسة على قرارات التخطيط في وكلاء النماذج اللغوية الكبيرة (LLMs) ذاتية التطور لتوليد نوى CUDA، كاشفاً أن التخطيط الصريح يكون مفيداً فقط عندما تكون التغذية الراجعة متوافقة وأن التخطيط الفعال ينبثق من تفاعلات متعددة الهياكل بين التغذية الراجعة.

Yee Hin Chong, Jiaming Wu, Youhui Zhang, Peng Qu2026-05-27
🤖 AI

It's Not the Capability: Harness Sensitivity Is Non-Monotone Across LLM Agent Tiers

تُفند هذه الورقة الافتراض القائل بأن تعقيد أدوات التقييم الأمثل يتناقص رتيباً مع قدرة النموذج، حيث كشفت من خلال تجربة مكونة من 432 تشغيلاً أن حساسية أدوات التقييم غير رتيبة وتعتمد بشكل حاسم على نوع النموذج، إذ تعيق الهياكل الإسهابية نماذج الدردشة الرائدة بينما تفيد التوجيهات الصارمة نماذج الاستدلال الرائدة.

Yong-eun Cho2026-05-27
🤖 machine learning

Stabilizing Recurrent Dynamics for Test-Time Scalable Latent Reasoning in Looped Language Models

تقدم الورقة البحثية STARS، وهو إطار تدريب يعمل على تثبيت الديناميكيات المتكررة في النماذج اللغوية الحلقية (Looped Language Models) عبر تقييد الحالات الكامنة بنقاط ثابتة مستقرة تقاربيًا من خلال تنظيم نصف قطر الطيف لجاكوبي (Jacobian Spectral Radius Regularization)، مما يتيح توسيع النطاق الموثوق أثناء وقت الاختبار وتحسين الأداء في مهام الاستدلال المعقدة.

Xiao-Wen Yang, Ziyu Han, Xi-Hua Zhang, Wen-Da Wei, Jie-Jing Shao, Lan-Zhe Guo, Yu-Feng Li2026-05-27