A Unified Assessment of the Poverty of the Stimulus Argument for Neural Language Models
本文介绍了 \poshbench,这是一个统一的基准测试,它证明了虽然神经语言模型可以在缺乏先天句法偏置的情况下,通过有限的数据获得结构依赖性的泛化能力,但它们在效率上仍低于儿童,并且需要额外的、受认知驱动的归纳偏置才能完全达到类人水平的学习。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
几十年来,一个核心谜题一直困扰着语言学习的研究。尽管身处混乱且往往不完整的言语流中,孩子们却能在五岁左右就掌握复杂且无形的语法规则。他们知道某些句子是不可能的,即便他们从未听过成年人说“那是错的”,也从未见过一份禁止短语的清单。这种孩子接收到的有限、杂乱的数据与他们习得的复杂知识之间的差距,被称为“刺激贫乏”(poverty of the stimulus)。支持这一观点的传统解释由几代语言学家所倡导,认为人类天生就拥有某种特殊的、先天的语法蓝图——一个内置的指南,告诉大脑哪些规则是可能的,哪些是不可能的。该论点认为,如果没有这种生物学上的领先优势,输入的信息实在太贫乏,根本无法教会一个孩子如何说话。
近年来,人工智能为测试这一观点提供了一种新方法。科学家们构建了被称为神经网络的计算机程序,通过阅读海量文本进行学习。这些机器在预测句子中的下一个词方面表现得异常出色,往往在没有被明确教授规则的情况下就能模仿人类语法。这种成功引发了一场辩论:如果一台机器仅通过阅读就能学习复杂的语法,那么或许“刺激贫乏”只是一个幻觉,输入的信息实际上对于任何强大的学习者来说都足够丰富,足以让其领悟规律。然而,这种比较存在一个关键缺陷:计算机被喂养了数十亿个词汇,而人类儿童听到的仅是其中的极小部分。为了解决这个问题,研究人员需要观察机器是否能在仅使用与儿童相当的有限数据的情况下,学习到同样的困难规则。
乔治城大学和格罗宁根大学的一个研究小组致力于通过创建一个名为 POSH-BENCH 的新测试平台来回答这个问题。他们专注于四个长期以来被视为先天知识最有力证据的特定语法谜题。这些谜题包括:孩子们如何通过移动主助动词而非听到的第一个动词来学习提问;他们如何知道某些句子结构会阻碍单词的移动;他们如何理解复杂句子中代词的指代对象;以及控制“want to”缩减为“wanna”的微妙规则。研究人员构建了一个庞大的文本库,旨在模拟儿童的语言环境,其规模从 1000 万到 5000 万词不等。这大约是一个五岁儿童所接触到的语言量,其规模比现代计算机模型通常消耗的量要小数百万倍。
该团队在这些“儿童规模”的数据上训练了三种不同类型的计算机模型。一种是驱动许多现代 AI 工具的标准神经网络;另一种是较旧风格的网络;第三种是仅关注单词即时历史的简单统计模型。为了进一步测试“贫乏”论点,他们创建了一个版本,在其中特意删除了所有关于正在测试的特定语法规则的示例。这模拟了一个从未听到过该规则直接实例的孩子,迫使学习者完全依赖语言中其他的间接线索。
结果令人惊讶且富有层次感。研究人员发现,先进的神经网络确实能从有限的、儿童规模的数据中学习这些困难的语法规则,即使在缺少直接示例的情况下也是如此。它们的表现显著优于随机水平,这表明输入的信息并不像之前认为的那样贫乏,强大的学习机器可以在不需要预设语法指南的情况下,提取出深层的结构模式。然而,故事并未就此结束。虽然机器可以学习这些规则,但它们的效率远低于人类儿童。随着数据量的增加,机器的表现有所提升,但始终无法赶上六岁儿童的速度和准确度。机器的学习曲线与儿童之间仍存在顽固的差距,这表明,虽然输入的信息是可学习的,但一定还有其他因素在帮助人类如此快速地学习。
随后,研究人员测试了添加特定的“偏差”(受人类大脑运作方式启发的思维捷径)是否能帮助机器缩小这一差距。他们尝试通过以下方式给模型一个“领先优势”:让它们练习形式逻辑谜题;强制它们像人类一样关注句子结构;以及限制它们的记忆力以模拟儿童发育中的工作记忆。这些改变确实提高了模型的整体语言理解能力,使其在通用测试中更加稳健和准确。然而,至关重要的一点是,这些偏差并未一致地帮助模型学习那些构成“刺激贫乏”论点核心的特定困难规则。那些有助于理解通用语法的偏差,并不一定能解决孩子们能轻易掌握的特定谜题。
这项研究的结论是,这场辩论并非可以通过简单的“是”或“否”来定论。研究结果表明,儿童接收到的输入信息确实足以让一个强大的学习者习得复杂的语法,从而挑战了“先天规则是唯一路径”的观点。然而,机器在效率上仍难以匹配人类这一事实表明,人类的学习不仅仅是统计模式匹配。这意味着,儿童拥有的学习机制或约束条件超出了本研究中所测试的结构性偏差。人类的大脑不仅仅是从接收到的数据中学习,而是以一种独特且高效的方式进行学习,而这种品质是目前的生成式人工智能尚未完全复制的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。