Breaking the Grid: Distance-Guided Reinforcement Learning in Large Discrete Action Spaces
تقدم هذه الورقة البحثية خوارزمية التعلم المعزز الموجه بالمسافة (DGRL)، وهي خوارزمية مبتكرة تتغلب على لعنة الأبعاد في فضاءات الأفعال المنفصلة الكبيرة (التي تصل إلى فعلًا) من خلال الجمع بين الأحياء الديناميكية المأخوذة بالعينة والتحديثات القائمة على المسافة لتحويل تحسين السياسة إلى مهمة انحدار مستقرة، مما يحقق تحسينات كبيرة في الأداء والتقارب مقارنة بأحدث الأساليب المتبعة.