Online Learning on Hidden-Convex Losses via Algorithmic Equivalence: Optimal Regret, Geometric Barrier, and Bandit Feedback
تحل هذه الورقة الأسئلة المفتوحة المتعلقة بالتعلم عبر الإنترنت الخصمي مع الخسائر المحدبة المخفية من خلال إثبات أن خوارزمية التدرج المتناقص عبر الإنترنت (Online Gradient Descent) تحقق الندم الأمثل بمعدل في ظل شرط توافق هسي (Hessian compatibility condition) ضروري وكافٍ، مع وضع حد أدنى مطابق لفشلها أيضاً وتوسيع هذه النتائج لتشمل إعدادات التغذية الراجعة من نوع البانديت (bandit feedback settings).