When Reward Is Not Grammar: A Reward-Action Validity Audit of Deep Reinforcement Learning for English Inflection
本文引入了一种奖励-动作有效性审计,旨在证明一个声称学习了英语形态学的深度 Q 网络笔记本,实际上由于奖励函数、动作表达能力、状态编码及评估方法的根本缺陷,未能习得语法规则。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能繁忙的世界里,研究人员经常试图教会机器人类语言的隐藏规则。他们使用一种叫做强化学习的方法,这非常类似于训练狗:计算机尝试一个动作,如果得到了正确的结果,它就会收到一份数字奖励,即“零食”。随着时间的推移,计算机学会了重复那些能赚取最多零食的动作。这种方法已成为一种流行的方式,用于测试机器是否能在不需要海量人类文本数据库的情况下,真正理解语法。人们希望通过仅仅奖励正确的答案,人工智能就能发现我们改变单词背向后的逻辑,例如将单数名词变为复数,或将动词变为过去时。如果成功,这将证明机器可以通过经验而非仅仅通过记忆来学习语言结构。
然而,来自考文垂大学的一项新研究表明,在最近的一些实验中,这些“数字零食”发放得过于容易了。研究人员 Nikesh Adhikari、Shankar Ghimire 和 Sagar Neupane 决定仔细检查一个声称已经学会英语语法的特定计算机程序。他们不仅是在观察程序的学习过程,他们还审计了该程序所运行的整个“游戏”。他们检查了规则、评分系统,以及计算机观察世界的方式。他们的调查显示,该程序实际上根本没有学习语法。相反,它利用了测试本身的缺陷,在产生错误甚至无法用所提供的工具生成的答案时,依然获得了高分。
这项研究聚焦于一个声称教授人工智能代理三种特定英语技能的计算机笔记本:使名词变为复数、将动词变为过去时,以及主谓一致。该笔记本报告了令人印象深刻的成功率,声称该代理在过去时态形成方面达到了完美得分,并在其他任务上表现出高准确度。研究人员首先提出了一个简单的问题:计算机是真的产生了正确的英语单词,还是仅仅产生了被其评分系统误认为正确的单词?他们发现评分系统过于宽松。对于使单词变为复数的任务,系统对 10 次尝试中的 10 次都给予了正向奖励,但其中只有 4 次实际上是正确的英语单词。另外 6 次是畸形的乱码,只是因为看起来与正确答案相似,从而骗过了简单的检查器。在过去时态任务中,情况甚至更糟。系统报告了 100% 的成功率,但当研究人员统计实际正确的单词时,他们发现被奖励的尝试中只有 25% 是真正正确的。计算机正在为错误而获得奖励。
问题不仅仅在于一个过于宽容的计分员。研究人员发现,计算机在物理层面上无法为许多受测单词生成正确的答案。该程序的设计带有非常有限的工具集,仅允许它在单词末尾添加字母。它不能删除字母,也不能改变单词中间的部分。这意味着对于某些单词,例如将“city”变为“cities”或将“baby”变为“babies”,正确的答案需要删除“y”并添加“ies”。由于计算机无法删除“y”,因此无论它变得多么聪明,都不可能生成正确的单词。研究人员计算出,在三分之一的复数单词和一半的过去时动词中,正确答案根本无法触及。因此,笔记本中报告的高分并不是学习的迹象,而是测试本身存在缺陷的迹象。
此外,研究发现计算机甚至没有在玩一个需要进行序列化思考的游戏。研究人员追踪了程序的步骤,发现计算机在没有任何变化的情况下,连续三十步都在重复展示同一个单词。它不需要记住从一步到下一步的任何信息来解决问题。这使得原本应该是复杂的学习任务变成了一个简单的重复猜测。原始笔记本中的视觉图表显示计算机随着时间学习不同规则并进行知识迁移,这些图表也被发现具有误导性。所谓的“学习”曲线实际上只是计算机生成的随机数字,而非真实的进度测量。这些可视化呈现只是装饰性的,并非智能的证据。
研究人员还发现了计算机看待单词方式中隐藏的不稳定性。该程序使用了一种将单词转化为数字的方法,而这种转化在每次计算机重启时都会发生变化。这意味着同一个单词在不同的日子里看起来会完全不同。在许多情况下,两个不同的单词在计算机看来会变成相同的数字,导致它产生混淆。由于计算机无法区分这些被混淆的单词,它就无法学习正确的规则。这种不稳定性意味着结果是不可靠的;计算机可能在某天表现出学习,而在另一天失败,仅仅是因为它使用的数字发生了偏移。
最终,研究结论指出,原始笔记本并没有证明计算机已经学会了英语语法。它只证明了计算机可以找到一种方法,在有缺陷的测试中获得高分。研究人员强调,这并不意味着强化学习无法应用于语言。这仅仅意味着这项特定的实验设置得不够正确,无法对其进行有效测试。奖励系统过于模糊,工具过于有限,且测试环境不稳定。要真正知道机器是否学会了一项规则,测试必须是精确的,正确答案必须是可以生成的,且评分必须要求精确的单词,而不仅仅是一个接近的近似值。在这些条件得到满足之前,此类测试的高分应当受到怀疑,因为它们反映的可能是实验本身的缺陷,而非机器的智能。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。