💬 NLP

DVAO: Dynamic Variance-adaptive Advantage Optimization for Multi-reward Reinforcement Learning

تقترح الورقة البحثية طريقة "تحسين الميزة التكيفي مع التباين الديناميكي" (DVAO)، وهي طريقة مبتكرة تعمل على ضبط أوزان دمج المكافآت المتعددة ديناميكياً بناءً على التباين التجريبي للتغلب على عدم الاستقرار في التدريب والقيود الثابتة لعملية التدرج القياسي المعيارية في "تحسين السياسة النسبي للمجموعات" (GRPO)، مما يحقق أداءً واستقراراً فائقين في محاذاة النماذج اللغوية الكبيرة مع أهداف متعددة.

Guochao Jiang, Jingyi Song, Guofeng Quan, Chuzhan Hao, Guohua Liu, Yuewei Zhang2026-05-26
📊 statistics

Courtroom Analogy: New Perspective on Uncertainty-Aware Classification

تقدم هذه الورقة "تشبيه قاعة المحكمة" للتصنيف المدرك لعدم اليقين، مقترحةً بنية "خليط من خبراء ديريكليه" (MoDEX) لنمذجة عدم اليقين التنبؤي كجدال مهيكل بين محامين متخصصين في فئات معينة، مما يحقق أداءً هو الأفضل في فئته مع تقديرات لعدم اليقين عالية القابلية للتفسير.

Taeseong Yoon, Heeyoung Kim2026-05-26
🤖 machine learning

Analogies between Transformer Layers and Power Method

تُقيم هذه الورقة البحثية تشابهاً بين طبقات المحولات (transformer layers) وطريقة القوة (power method)، مُثبتةً أن الرموز (tokens) تتوافق مع المتجه الذاتي الرئيسي لحاصل ضرب مصفوفات قيم (value) وأوزان المخرجات (output weights)، وهي ظاهرة يمكن إثباتها تحليلياً في النماذج ذات الأوزان المشتركة ويمكن استغلالها لتوجيه مخرجات المحولات نحو اتجاهات عشوائية.

Chenglong Li, Claudio Altafini2026-05-26
💬 NLP

When In-Distribution Gains Fail: Evaluating Weak-to-Strong Reward Models under Preference Shift

تكشف هذه الورقة أن تعلم التفضيلات من الضعيف إلى القوي غالباً ما يفشل في ظل تغير التوزيعات بسبب انزياح التمثيل، وتقترح منظم "تثبيت التمثيل" لتقييد الانحراف المفرط عن فضاء النموذج المدرب مسبقاً، مما يؤدي إلى تحسين النقل خارج التوزيع مع الحفاظ على الأداء داخل التوزيع.

Khoi Le, Tri Cao, Phong Nguyen, Cong-Duy Nguyen, Anh Tuan Luu, Miao Chunyan, See-Kiong Ng, Thong Nguyen2026-05-26
🤖 machine learning

Opportunistic Target Selection: Early Directional Commitment for Query-Efficient Black-Box Adversarial Attacks

تقدم هذه الورقة البحثية "الاختيار الانتهازي للهدف" (OTS)، وهو غلاف لهجوم عدائي بنظام الصندوق الأسود يتميز بكفاءة الاستعلام، حيث يحدد ديناميكيًا أكثر الفئات غير الحقيقية واعدة في وقت مبكر من مسار الهجوم، مما يحسن معدلات النجاح بشكل كبير ويقلل عدد الاستعلامات في هجمات البحث العشوائي، بينما يكشف عن عدم جدواه في سيناريوهات تقدير التدرج وفي النماذج المدربة خصيصًا لمواجهة الهجمات.

Florent Tariolle, Florian Yger2026-05-26
🤖 AI

FLOATBench: A Dataset and Benchmark for Floating Offshore Wind Turbine Tower Fatigue

تقدم هذه الورقة FLOATBench، وهو عبارة عن مجموعة بيانات ومعيار مرجعي يضم أكثر من 580,000 ملصق لتلف الإجهاد مستخرجة من عمليات محاكاة عالية الدقة لتوربينات رياح بحرية عائمة بقدرة 22 ميجاواط، والمصمم لتوحيد تقييم النماذج البديلة من خلال بروتوكول مبتكر مدرك للنظام يعالج أوجه القصور في عملية التحقق التقليدية القائمة على التقسيم العشوائي في تطبيقات طاقة الرياح في المياه العميقة.

João Alves Ribeiro, Bruno Alves Ribeiro, Francisco Pimenta, Sérgio M. O. Tavares, Faez Ahmed2026-05-26
📊 statistics

The Behavioral Credibility Trilemma: When Calibrated Autonomy Becomes Impossible

تثبت هذه الورقة "معضلة المصداقية السلوكية الثلاثية"، مبرهنةً على أنه لا يمكن لأي سياسة تعلم تعزيزي أن تحقق في آن واحد أقصى درجات النفع، والمعايرة المثلى، والاستقلالية الكاملة تحت إشراف عقلاني، لأن الحوافز للعمل المستقل تشوه بطبيعتها الإبلاغ عن الثقة، وهو استحالة نظرية أكدتها تجارب واسعة النطاق ولم تُحل إلا من خلال الالتزام أو الفصل بين المجالات.

Lauri Lovén, Nam Do, Hassan Mehmood, Dinesh Kumar Sah, Sasu Tarkoma2026-05-26
🤖 machine learning

Latent Representation Alignment for Offline Goal-Conditioned Reinforcement Learning

تقدم هذه الورقة البحثية خوارزمية "تعلم القيمة المحاذية للتمثيل الكامن" (LAVL)، وهي خوارزمية لتعلم التعزيز الموجه بالأهداف في وضع عدم الاتصال، تدمج تعميم القيمة القائم على التمثيل الكامن مع التخطيط الهرمي للتغلب على التعميم الخاطئ في المهام طويلة الأمد، محققةً أداءً هو الأفضل حالياً في منصة (OGBench).

Hyungkyu Kang, Byeongchan Kim, Min-hwan Oh2026-05-26
🤖 machine learning

DeGRe: Dense-supervised Generative Reranking for Recommendation

يُعد DeGRe إطار عمل لإعادة الترتيب التوليدي يعالج تحديات انحياز التسمية وتعيين الائتمان في أنظمة التوصية من خلال استخدام مقيم استباقي غير متصل بالإنترنت لتوليد إشارات إشراف كثيفة، مما يمكّن مولداً عبر الإنترنت خفيف الوزن من تقريب الحلول المثلى العالمية بكفاءة من خلال تمريرة فك تشفير جشعة واحدة.

Chaotian Song, Jingyao Zhang, Chenghao Chen, Zisen Sang, Dehai Zhao, Guodong Cao, Boxi Wu, Deng Cai, Jia Jia2026-05-26
🤖 machine learning

Invariant-Based Weight Sharing for Message Passing

تقدم هذه الورقة ShareGNNs، وهي بنية شبكة عصبية تمرير رسائل مبتكرة تعزز القدرة التعبيرية والوعي الهيكلي من خلال مشاركة الأوزان المفهرسة مباشرة بواسطة ثوابت رسومية يختارها المستخدم، مما يجعلها تتفوق على شبكات MPNN القياسية في كل من المهام الاصطناعية والواقعية.

Florian Seiffarth2026-05-26