🤖 machine learning

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

تقدم هذه الورقة أول تنفيذ لإثبات المفهوم لوكيل تعلم تعزيزي "تحت-بايزي" (infra-Bayesian) يتفوق على التعلم التعزيزي الكلاسيكي في متانة الحالة الأسوأ من خلال التعامل بفعالية مع عدم اليقين "النايتي" (Knightian uncertainty) وعدم دقة النموذج عبر عملية اتخاذ قرار "ماكسيمين" (maximin).

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew (…)2026-05-25
💬 NLP

What Does the Server See? Understanding Privacy Leakage from Large Language Models in Split Inference

تكشف هذه الورقة عن ثغرات خصوصية حرجة في الاستدلال المجزأ للنماذج اللغوية الكبيرة من خلال تقديم ActInv، وهي طريقة تعيد بناء مدخلات العميل من التنشيطات الوسيطة رغم الدفاعات الشائعة، وتقترح مقياس عامل تضخيم الاضطراب (PAF) ودفاع PriPert لتحليل وتخفيف مخاطر التسريب هذه بشكل منهجي.

Mingyuan Fan, Yu Liu, Fuyi Wang, Cen Chen2026-05-25
🤖 AI

PoisonForge: Task-Level Targeted Poisoning Benchmark for Instruction-Tuned LLMs

تقدم هذه الورقة البحثية PoisonForge، وهو معيار مرجعي يوضح أن تسميم البيانات على مستوى المهام باستخدام 1% فقط من الأمثلة المصممة يمكن أن ينجح في إجبار النماذج اللغوية الكبيرة المضبوطة بالتعليمات على تضمين كيانات محددة من قبل المهاجم في مخرجات المهام المستهدفة مع الحفاظ على الأداء الطبيعي في مجالات أخرى، مما يكشف أن خيارات تصميم التسميم وليس حجم النموذج هي المحركات الأساسية لنجاح الهجوم.

Luze Sun, Anshuman Suri, Harsh Chaudhari, Cristina Nita-Rotaru, Alina Oprea2026-05-25
💬 NLP

Positional Failures in Long-Context LLMs: A Blind Spot in Reasoning Benchmarks

تكشف هذه الورقة عن فجوة حرجة في معايير تقييم الاستدلال في السياقات الطويلة من خلال إثبات أن التقييمات السائدة تفشل في ضبط موضع المهمة، مما يؤدي إلى انخفاض كبير في الأداء عندما توضع المهام في منتصف السياقات الطويلة بسبب تداخل الحشو، وتقترح إطار عمل تقييم تعفن السياق (CRE) لمعالجة هذه النقطة العمياء الهيكلية.

Chuyifei Zhang, Hongyu Cui, Xiaowen Huang, Jitao Sang2026-05-25
💬 NLP

Self-Improving In-Context Learning

تقترح هذه الورقة طريقة لمعايرة وقت الاختبار للتعلم داخل السياق، تعمل على تحسين تضمينات المطالبات المستمرة من خلال تعظيم مؤشر ثقة ذاتي التوجيه مستمد من الاحتمالات اللوغاريتمية للنموذج، مما يؤدي إلى تحسين الأداء في كل من مهام التصنيف والتوليد دون الحاجة إلى الضبط الدقيق، أو توليد الرموز، أو بيانات خارجية.

Baturay Saglam, Dionysis Kalogerias2026-05-25
🤖 machine learning

Pure Exploration for a Good Policy in Reinforcement Learning with Bandit Feedback

تقدم هذه الورقة هدف تحديد السياسة الجيدة (GPI) في الاستكشاف الخالص لتعلم التعزيز، والذي يهدف إلى إيجاد سياسة تتجاوز عتبة مكافأة معينة بكفاءة بدلاً من السياسة المثلى، وتقترح خوارزمية BEE-GPI التي تحقق تعقيد عينات يقارب الأمثل مع اعتماد على الفجوة بين المكافآت المثلى وعتبة المكافآت بدلاً من حجم فضاء الحالة-الفعل.

Zitian Li, Wang Chi Cheung2026-05-25
🤖 machine learning

Empirical Bayes Conformal Prediction for Vision and Language Models

تقدم هذه الورقة إطار عمل للتنبؤ المطابق القائم على بايز التجريبي (Empirical Bayes Conformal Prediction) يستفيد من قيم rr لتحويل تباين الدرجات إلى درجة عدم مطابقة مستنيرة باليقين، مما يؤدي إلى تحسين استقرار الترتيب وتقليل إدراج المرشحين الزائفين ذوي التباين العالي في نماذج الرؤية واللغة مع الحفاظ على ضمانات التغطية المستقلة عن التوزيع.

Jiapeng Zeng, Yogesh Prabhu, Zhanpeng Zeng, Michael A. Newton, Vikas Singh2026-05-25
🤖 machine learning

Expand More, Shrink Less: Shaping Effective-Rank Dynamics for Dense Scaling in Recommendation

لمعالجة انهيار التضمين ومحدودية القدرة التعبيرية في بنية RankMixer، تقترح هذه الورقة RankElastor، وهو نموذج توصية مبتكر يتميز بالخلط الكامل المحدّد بالمعلمات وP-FFNs المحسنة بواسطة وحدة بوابة خطية (GLU) التي تعمل على استقرار أطياف التمثيل وتمكين التوسع الكثيف القوي.

Guoming Li, Shangyu Zhang, Junwei Pan, Wentao Ning, Jin Chen, Gengsheng Xue, Chao Zhou, Shudong Huang, Haijie Gu, Mengli (…)2026-05-25
🤖 machine learning

Label-Efficient Dataset Pruning via Semi-Supervised Pseudo-Labeling

تقترح الورقة البحثية SemiPrune، وهو إطار عمل لتقليص مجموعات البيانات بكفاءة في استخدام الملصقات، والذي يستفيد من التسمية المستعارة شبه المراقبة على مجموعة فرعية صغيرة موسومة لتمكين طرق التقليص الخاضعة للإشراف على البيانات غير الموسومة، مما يحقق أداءً هو الأفضل حالياً من خلال التقاط التوزيع المستهدف بشكل أفضل دون الاعتماد على الميزات مسبقة التدريب التي قد تكون غير متطابقة.

Yeseul Cho, Baekrok Shin, Changmin Kang, Chulhee Yun2026-05-25
🤖 AI

Lipschitz Optimization for Formal Verification of Homographies

تقدم هذه الورقة إطار عمل للتحقق الرسمي يستنتج حدوداً خطية محكمة لقيم البكسل تحت اضطرابات حركة الكاميرا ثلاثية الأبعاد من خلال الاستفادة من تحسين ليبشيتز والاستمرارية الجزئية للتحويلات الهوموجرافية، مما يتيح أول ضمانات متينة وصارمة لمتانة الشبكات الرؤيوية في المشاهد المستوية دون الاعتماد على عمليات محاكاة معقدة أو نماذج بديلة.

Jean-Guillaume Durand, Panagiotis Kouvaros, Maxime Gariel, Alessio Lomuscio2026-05-25