Sparse Gaussian-Mixture-Model Q-Functions via Hadamard Overparametrization for Online Reinforcement Learning
تقدم هذه الورقة إطار عمل للتعلم التعزيزي عبر الإنترنت وغير متصل بالسياسة يستخدم فرط التخصيص بضرب هادامارد (Hadamard overparametrization) لاشتقاق دالات قيم Q مكونة من نماذج خليط غاوسي متفرقة وقابلة للتفسير، مما يتيح تحسيناً ريمانياً فعالاً يحقق كفاءة معلمات وقدرة على التعميم تتفوق على طرق التعلم التعزيزي العميق.