When Reward Is Not Grammar: A Reward-Action Validity Audit of Deep Reinforcement Learning for English Inflection
Dieses Paper führt eine Auditierung der Belohnungs-Aktions-Validität ein, um zu demonstrieren, dass ein Deep-Q-Network-Notebook, das behauptet, englische Morphologie zu erlernen, aufgrund grundlegender Mängel in seiner Belohnungsfunktion, Aktions-Expressivität, Zustandskodierung und Evaluierungsmethodik tatsächlich daran scheitert, grammatikalische Regeln zu erwerben.