You Can Learn Tokenization End-to-End with Reinforcement Learning
本文提出通过使用得分函数估计(score function estimates)和时间折扣(time discounting)来降低方差,利用强化学习进行端到端的分词学习,并证明该方法在 1 亿参数规模下优于先前的直通(straight-through)方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代计算机并不能自然地理解人类语言;它们只能理解数字。为了弥补这一差距,处理文本的人工智能系统必须首先将单词和句子转化为它们可以消化的数字流。多年来,实现这一目标的标准方法是一个僵化的、预先编程的步骤,称为“分词”(tokenization)。可以将这个过程想象成一位图书管理员,在机器阅读一本书之前,必须根据一本固定的规则手册,将书页切割成特定的、预先确定的块。这本规则手册决定了一个词在哪里结束,下一个词从哪里开始,通常会将常见的字母组合组合在一起。虽然这种方法运作良好,但它是一个脱离了人工智能大脑本身、位于学习过程之外的、人工且静态的步骤。随着这些数字大脑变得越来越庞大且功能更加强大,科学家们开始怀疑,这种僵化的、预先切割的方法是否正在阻碍它们的发展,以及机器是否可以学会以一种更符合其自身内部逻辑的方式来切割文本。
苏黎世联邦理工学院(ETH Zurich)的一个研究小组通过教人工智能从零开始学习如何切割自己的文本,而无需任何预设规则,在回答这个问题方面迈出了重要一步。在他们的新工作中,他们证明了一个计算机模型可以通过尝试最小化其错误来进行训练,从而决定准确地在哪里放置文本块之间的边界。该模型并非遵循固定的手册,也不是基于空格或标点符号进行巧妙的猜测,而是使用了一种类似于动物学习如何通过迷宫的试错法。它随机猜测切割位置,观察其对下一部分文本的预测效果如何,然后调整策略。如果一次猜测带来了更好的预测,模型就会强化这一决策;如果导致了困惑,它就会尝试其他方法。随着时间的推移,模型发现了其自身最优的语言拆解方式,实际上是在学习语言的过程中,自学了分词的规则。
研究人员发现,当他们让模型以这种方式学习时,模型自然而然地开始在人类进行切割的位置进行切割,例如在单词之间的空格处或句末,尽管没有人告诉它这样做。即使模型没有接收到任何关于语法或语言结构的特定指令,这种情况依然发生了。在利用超过一亿个参数的数据集进行的测试中,这种自学方法被证明比以往那些试图使用另一种较不直接的数学技术来学习边界的方法更为有效。新方法不仅产生了更好的结果,而且尽管没有任何先验规则知识,其性能也达到了依赖于传统手工规则手册的系统的水平。
这项发现最引人注心的方面之一是,模型学会了高效运作。它弄清楚了如何将字节数据分组为对其特定任务有意义的块,无论该任务是阅读通用文本还是理解计算机代码。当研究人员在 Python 代码上测试该模型时,它学会了在函数名称的开头开始新的块,并将某些常用短语保持在一起,展示了对所读代码结构的直觉理解。这表明模型不仅仅是在记忆模式,而是在积极开发一种与其处理的文本含义相一致的策略。
该研究还解决了此前使这类学习变得困难的一个主要障碍:学习信号中的噪声。由于切割文本的选择是一个二元选择——要么在这里切割,要么不在这里切割——因此在数学上很难告诉模型具体该如何改进。研究人员通过借鉴强化学习(一个智能体通过奖励和惩罚进行学习的领域)中的技术解决了这个问题。他们引入了一种能够平滑噪声的方法,允许模型识别出哪些特定决策在较长一段文本中负责了其成功或失败。这使得模型能够有效地学习,而不需要极其庞大的计算能力。
虽然目前的实验是在特定规模的模型上进行的,但其结果为人工智能的未来提供了一个引人入胜的愿景。通过消除对准备文本的独立、预编程步骤的需求,研究人员展示了语言处理可以成为一个完全集成、端到端的学习过程。模型不仅在学习如何说话,还在学习如何倾听以及如何以最高效的方式解析周围的世界。这种方法最终可能导致能够处理那些不存在人类设计规则手册的语言和数据类型的系统,使人工智能更具适应性和包容性。这项工作表明,我们向机器喂送数据的方式那种僵化的、手工设计的模式,可能很快就会被一种更流畅、自我发现的方法所取代,在这种方法中,机器将学会以其自身的方式来阅读世界。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。