When Reward Is Not Grammar: A Reward-Action Validity Audit of Deep Reinforcement Learning for English Inflection
Este artículo introduce una auditoría de validez de recompensa-acción para demostrar que un cuaderno de Deep Q-Network que afirma aprender morfología inglesa en realidad falla en la adquisición de reglas gramaticales debido a fallos fundamentales en su función de recompensa, expresividad de acción, codificación de estado y metodología de evaluación.