Gated Q-learning: Add Off-Policy Bias to Taste
يعالج التعلم بـ Q المبوّب (Gated Q-learning) المقايضة طويلة الأمد بين انحياز السياسة الخارجية وطول تعيين الائتمان في التعلم التعزيزي من خلال تقديم آلية بوابية مبتكرة تدمج بسلاسة بين طرفي نقيض لـ Q() عند واتكينز وبينج، مما يتيح تعلمًا أسرع بانحياز محكوم دون الاعتماد على أخذ العينات بالأهمية.