🤖 machine learning

Active Learners as Efficient PRP Rerankers

تعيد هذه الورقة صياغة التلقين بالترتيب الزوجي (PRP) كمسألة تعلم نشط لتطوير إطار عمل لإعادة الترتيب مقاوم للضجيج، مما يحسن كفاءة ترتيب أفضل K ويخفف من انحياز الموضع باستخدام أوراكل ذي اتجاه عشوائي أحادي الاستدعاء.

Jeremías Figueiredo Paschmann, Juan Kaplan, Francisco Nattero Santiago Mauricio Barron Bucolo, Juan Wisznia, Luciano del (…)2026-05-15
⚡ electrical engineering

Action-Conditioned Risk Gating for Safety-Critical Control under Partial Observability

تقترح هذه الورقة طريقة تعزيز تعلمي خفيفة الوزن، مشروطة بالفعل وذات بوابات مخاطر، تعمل على تقريب التحكم الحرج للسلامة تحت حالة الملاحظة الجزئية من خلال استخدام متنبئ مخاطر مدمج يعتمد على التاريخ للموازنة ديناميكيًا بين السعي وراء المكافأة والسلوكيات التحفظية، محققةً أداءً وكفاءةً متفوقين مقارنةً بالتخطيط في فضاء الاعتقاد ونماذج التعلم التعزيزي الآمن القياسية في مهام تنظيم الجلوكوز والملاحة.

Yushen Liu, Yin-Jen Chen, Ziyi Chen, Tao Wang, Heng Huang, Xugui Zhou, Yanfu Zhang2026-05-15
🤖 machine learning

Not All Timesteps Matter Equally: Selective Alignment Knowledge Distillation for Spiking Neural Networks

تقترح هذه الورقة تقنية تقطير المعرفة عبر المحاذاة الانتقائية (SeAl-KD)، وهي طريقة مبتكرة للشبكات العصبية النبضية تعمل على تحسين الأداء من خلال محاذاة المعرفة على مستوى الفئة والزمن بشكل انتقائي بناءً على الثقة والتشابه في الخطوات الزمنية، بدلاً من فرض محاذاة موحدة عبر جميع الخطوات الزمنية.

Kai Sun, Peibo Duan, Yongsheng Huang, Guowei Zhang, Benjamin Smith, Nanxu Gong, Levin Kuhlmann2026-05-15
🤖 machine learning

Dynamics of the Transformer Residual Stream: Coupling Spectral Geometry to Network Topology

تحلل هذه الورقة التفكيك الذاتي للقيم الذاتية لمصفوفة جاكوبي في النماذج اللغوية الكبيرة لتكشف أن التدريب يستحث تدرجاً طيفياً رتيباً من الطبقات المبكرة التي يهيمن عليها الدوران إلى الطبقات المتأخرة المتماثلة، مما يخلق عنق زجاجة منخفض الرتبة يربط ديناميكياً بين انتشار الاضطراب والضغط إلى الطوبولوجيا الوظيفية للشبكة.

Jesseba Fernando, Grigori Guitchounts2026-05-15
💻 computer science

Heuristic Pathologies and Further Variance Reduction via Uncertainty Propagation in the AIVAT Family of Techniques

تحدد هذه الورقة ثغرات حرجة في تقنية تقليل التباين AIVAT، وتحديداً مخاطر تباين العينات المرضي و"التلاعب بالقيم الاحتمالية" (p-hacking) عندما لا يتم تثبيت دالات القيم الاستدلالية قبل ملاحظة البيانات، وتقترح طريقة لنشر عدم اليقين الاستدلالي لتحقيق تقليل إضافي كبير في التباين عند تقييم أداء الوكلاء المتعددين.

Juho Kim, Tuomas Sandholm2026-05-15
💻 computer science

Parallelizing Counterfactual Regret Minimization

تقدم هذه الورقة إطار عمل موازٍ عامًا يعيد صياغة خوارزميات تقليل الندم المقابل للواقع (CFR) كعمليات جبر خطي، مما يتيح تنفيذات مدعومة بوحدات معالجة الرسومات تحقق تسريعًا يصل إلى أربعة مراتب عشرية مقارنة بالطرق الحالية القائمة على وحدات المعالجة المركزية.

Juho Kim, Tuomas Sandholm2026-05-15
💻 computer science

Watermarking Game-Playing Agents in Perfect-Information Extensive-Form Games

تقدم هذه الورقة طريقة لوضع علامات مائية على وكلاء لعب الألعاب في ألعاب الصيغة الممتدة ذات المعلومات الكاملة عبر تكييف تقنيات العلامات المائية للنماذج اللغوية الكبيرة، مما يثبت أن هذا النهج يسمح بالكشف الموثوق عن الاستخدام غير المصرح به للذكاء الاصطناجع مع تأثير ضئيل على جودة الاستراتيجية.

Juho Kim, Fei Fang, Tuomas Sandholm2026-05-15
🤖 machine learning

MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification

يُعد MetaMoE إطار عمل يحافظ على الخصوصية، حيث يوحد الخبراء المتخصصين في مجالات محددة والمدربين بشكل مستقل في نموذج واحد من نوع "خليط الخبراء" (Mixture-of-Experts)، وذلك عبر الاستفادة من الاختيار الواعي للتنوع في البيانات العامة البديلة لتقريب التوزيعات الخاصة وتنسيق تعلم الخبراء دون الوصول إلى بيانات العملاء الحساسة.

Weisen Jiang, Shuhao Chen, Sinno Jialin Pan2026-05-15
💬 NLP

Web Agents Should Adopt the Plan-Then-Execute Paradigm

تجادل هذه الورقة بأن على وكلاء الويب اعتماد نموذج "التخطيط ثم التنفيذ" بدلاً من نهج ReAct الافتراضي للتخفيف من مخاطر حقن الأوامر (prompt injection)، مؤكدة أن العائق الرئيسي أمام هذا التحول هو غياب واجهات برمجة تطبيقات المواقع الإلكترونية ذات النوعية والدلالية (typed, semantic APIs) وليس القيود في نماذج الذكاء الاصطناعي.

Julien Piet, Annabella Chow, Yiwei Hou, Muxi Lyu, Sylvie Venuto, Jinhao Zhu, Raluca Ada Popa, David Wagner2026-05-15
💬 NLP

To See is Not to Learn: Protecting Multimodal Data from Unauthorized Fine-Tuning of Large Vision-Language Model

تقترح هذه الورقة MMGuard، وهي آلية دفاع استباقية تولد أمثلة متعددة الوسائط غير قابلة للتعلم عن طريق حقن اضطرابات غير محسوسة للبشر وتعطيل الروابط بين الوسائط المتعددة لمنع الضبط الدقيق غير المصرح به لنماذج الرؤية واللغة الكبيرة، مما يحمي حقوق الطبع والنشر وخصوصية مالكي البيانات.

Chengshuai Zhao, Zhen Tan, Dawei Li, Zhiyuan Yu, Huan Liu2026-05-15