When Machines Speak: A Unified Generative Framework for Integrating Machine-Native Symbols into Pretrained Large Language Models
本文介绍了 UniLang,这是一个统一的生成式框架,它扩展了预训练大语言模型的能力,使其能够原生处理并生成机器原生符号以及自然语言,从而在无需言语化或特定任务架构的情况下,弥合了语言建模与结构化预测之间的鸿沟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的广袤版图中,长期存在着一种关于描述世界的两种方式之间的微妙张力。一方面是人类使用的语言,这是一种流动的、丰富的媒介,人类用它来分享故事、思想和情感。大型语言模型——那些能够撰写论文或回答问题的强大计算机程序——正是基于这种人类语言进行训练的。它们通过文字来理解世界。另一方面是机器语言,一个僵化且紧凑的代码与数字系统。计算机通常将复杂的信息(例如一部特定的电影或一项法律裁决)存储为一段简短、高效的符号字符串,而非一段文字段落。这些符号对于计算和存储而言非常完美,但对于依赖人类文字的语言模型来说却是不可见的。多年来,研究人员不得不在这两个世界之间做出选择。为了让计算机理解机器代码,他们通常必须先将其翻译成句子,但这可能会丢失重要的细节。或者,他们必须构建专门的、独立的系统来处理这些代码,从而抛弃了语言模型所拥有的强大知识。
谷歌的一组研究人员现在提出了一种将这两个世界结合起来的方法,而无需强制进行翻译。他们引入了一个名为 UniLang 的新框架,该框架允许标准语言模型像对待单词一样对待机器代码。该模型不再将机器符号转换为如“一部 1999 年的电影”之类的句子,而是学习直接生成该符号本身,就像它生成“电影”这个词一样。研究人员在两个截然不同的问题上测试了这一想法:根据一个人的历史记录预测其可能观看的内容,以及在过去的判例中寻找支持新法律论点的确切句子。在这两种情况下,这种新方法都比现有的纯文本或纯代码系统表现得更好。通过让模型能够同时使用人类语言和机器符号进行表达,研究人员展示了人工智能可以在利用从阅读人类书籍和网站中获得的广博知识的同时,更准确地处理结构化数据。
这项工作的核心在于研究人员如何教计算机识别这些机器符号。想象一下,在一个图书馆里,每本书都有一个唯一的条形码。长期以来,一位只懂英语的图书管理员无法理解条形码;她必须阅读封面上的标题才能知道这本书是什么。新方法为图书管理员提供了一套新的工具。他们获取条形码,并教导图书管理员,这个特定的线条模式就代表“关于太空旅行的书”,这并不是通过阅读描述来实现的,而是通过学习模式与物体之间的直接联系。在研究中,研究人员将数千个项目(如电影或法律案例)转化为这些紧凑的机器代码。然后,他们使用一种学习过程,将这些代码与相同项目的文本描述对齐。这意味着当计算机看到特定电影的代码时,它理解该代码的方式,就如同它理解“80 年代的动作电影”这些词汇一样。
一旦计算机学会了这种新词汇,研究人员就要求它执行通常需要两种不同思维方式的任务。在第一个测试中,计算机充当推荐引擎。它被展示了一系列由普通英语描述的电影标题和类型,随后是这些电影的机器代码。然后,计算机必须预测下一部电影。它不是猜测标题,而是生成下一部电影的机器代码,并附带其年份和类型。这种方法保持了数据的精确结构。在第二个测试中,计算机充ло扮演法律研究员的角色。它被给予一段来自新案件的文本,并被要求找到旧案件中支持该论点的特定句子。同样,计算机不仅仅是搜索关键词,它还生成了代表与上下文相匹配的旧案例精确段落的机器代码。
这些测试的结果清晰且一致。在电影推荐任务中,这种新方法显著优于其他仅尝试使用文本或仅使用代码来解决问题的系统。在最大的电影数据集上,与之前的一些方法相比,该方法在寻找正确推荐方面的准确度提高了百分之一百以上。在法律任务中,它找到支持句子的频率远高于专门为法律文本设计的系统。研究人员发现,成功的关键不仅在于添加代码,还在于保留人类语言。当他们移除文本描述并要求计算机仅使用代码工作时,系统变得难以应对并迷失了方向。人类语言提供了必要的上下文,一种帮助计算机理解符号背后含义的“落地感”。
这项工作暗示了人工智能进化的新路径。长期以来,该领域一直将语言和结构化数据视为不同的领域,需要不同的工具。研究人员证明,一个统一框架可以学会流利地使用这两种语言,将机器代码和人类单词视为对话中的平等伙伴。这并不意味着计算机停止理解人类语言,而是扩展了它直接与数字世界交互的能力。研究表明,通过将这些机器原生的符号集成到模型的词汇表中,系统可以在不丢失从阅读人类文本中获得的丰富世界知识的情况下,处理复杂的结构化信息。研究人员指出,虽然该系统在这些预测任务中表现出色,但他们并未测试这种新的思维方式是否会影响模型撰写诗歌或讲述故事的能力,这为未来的探索留下了疑问。
这种方法的意义超越了仅仅是电影或法律案例。研究人员展示了相同的框架可以应用于不同类型的结构化数据,而无需更改模型的底层架构。无论任务是预测序列中的下一个项目,还是在庞大的法律数据库中寻找特定段落,方法都是相同的。这种灵活性表明,在未来,人工智能系统可能不需要为每种新类型的数据从头开始构建。相反,一个统一的框架可以通过学习生成正确的符号,来理解任何系统的独特“语言”,无论是医疗记录还是金融交易。这项研究提供了一个概念验证,证明了人类语言与机器代码之间的鸿沟是可以跨越的,从而使人工智能能够更自然地在驱动现代世界的结构化环境中运行。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。