Modelling Reinforcement Learning Scheduling Agents: Action spaces, reward designs, and expert demonstrations
Este artículo investiga cómo las elecciones de modelado en el Aprendizaje por Refuerzo Profundo afectan las políticas de programación para el Problema de Programación de Taller Flexible, demostrando que la integración de límites de optimalidad derivados de la Programación de Restricciones y demostraciones de expertos en un marco multiagente mejora significativamente el diseño de recompensas y acelera la convergencia para lograr un rendimiento de programación superior en tiempo real.