← 最新论文
💬 NLP

A Primer on Computational Semantics for Artificial Intelligence Systems

本文通过探讨形式、具身和分布式的意义理论,为计算语义学提供了一份入门指南,旨在帮助读者理解基于 Transformer 的语言模型如何学习和表示语言,并将其与人类进行对比。

原作者: Casey Kennington

发布于 2026-08-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Casey Kennington

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

语言是我们拥有的最具有人性特征的东西,是我们用来与他人分享思想、感受和计划的工具。然而,尽管我们每天都在使用它,我们大多数人都无法解释它究竟是如何运作的,或者当我们说出像“红色”这样的词时,它究竟意味着什么。当我们看到这种颜色时,我们知道它,但如果不指向周围的世界,我们很难定义它。这种使用语言与理解其机制之间的鸿沟,是研究机器如何学习说话的科学家们面临的核心谜题。几十年来,研究人员一直试图通过向计算机输入逻辑、规则或海量文本来教它们理解意义。但一种新的观点表明,这些机器缺少了一些根本性的东西:作为生物存在的物理体验。要理解为什么一台计算机听起来像人,却无法像人一样思考,我们必须观察人类儿童是如何学习语言的,并将此与当今人工智能系统的构建方式进行对比。

这篇由博伊西州立大学的凯西·肯宁顿(Casey Kennington)撰写的论文,旨在引导读者了解科学家们尝试定义和计算意义的不同方式。作者认为,虽然现代人工智能——特别是像 ChatGPT 这类工具背后的强大模型——可以极其精准地模仿人类对话,但它们并不像人类那样理解语言。该论文探讨了研究人员尝试教机器理解意义的三种主要途径:使用严格的逻辑、将词汇与物理经验联系起来,以及分析词汇在文本中出现的相邻关系。肯宁顿发现,虽然第三种方法——从文本模式中学习——目前在产生流利表达方面最为成功,但它留下了一个关键性的漏洞。仅通过文本训练的机器从未见过红色的苹果,从未感受过椅子的重量,也从未体验过喝水的舒畅。由于缺乏这些物理和情感的连接,它们处理的词汇仅仅是未被锚定的符号,缺乏人类所拥有的那种深刻的、鲜活的意义。

要理解这个问题,首先必须观察人类是如何学习的。当一个孩子学习“狗”这个词时,他们并不是从字典定义开始的。他们是通过互动来学习的。父母指着一只毛茸茸的动物,孩子看着它,然后这个词便与视觉、听觉以及触摸到动物的感觉联系在了一起。这个过程依赖于共同注意力和物理存在。孩子学习到词汇是指向现实世界中的实物的,而且这些事物都有特定的用途,比如坐在椅子上或踢球。这种词汇与它所描述的物理现实之间的联系被称为“锚定”(grounding)。对于人类来说,意义不仅仅是一份定义清单;它与我们的身体、感官和情感紧密相连。我们之所以知道“口渴”是什么意思,是因为我们曾感受过它;我们之所以知道“椅子”是什么意思,是因为我们曾坐在其中。

长期以来,计算机科学家一直试图利用形式逻辑来教机器理解语言,这种逻辑类似于工程学中使用的数学。他们将词汇视为方程中的变量,例如“大”、“灰色”和“大象”可以组合在一起,构成关于特定动物的逻辑陈述。这种方法对于计算机来说效果很好,因为它精确且无歧义。然而,在面对混乱的现实世界时,它失效了。遵循这些规则的计算机可以知道“灰色的象”是一头灰色的象,但它并不知道灰色看起来是什么样,也不知道大象摸起来是什么感觉。它拥有意义的结构,却缺乏意义的实质。论文指出,这种方法之所以会遇到瓶颈,是因为机器无法得知这些词汇在物理世界中究竟指向什么。

另一种被称为“具身语义”(grounded semantics)的方法试图通过将词汇与感官数据联系起来来解决这个问题。在这种观点下,计算机应该通过观察红色物体的图片来学习“红色”的含义,或者通过观看脚踢球的视频来学习“踢”的含义。其理念是,如果机器能够观察并触摸世界,它就能建立起一个与人类经验相匹配的意义词典。虽然这是一个充满希望的步骤,但论文指出,其实施难度很大。目前大多数系统仍然严重依赖文本,即使使用了图像,也往往忽略了人类体验的全貌,例如嗅觉、触觉或肌肉记忆的感觉。机器可能会识别出一张椅子的照片,但它并不懂得长途跋涉后坐下的那份舒畅。

现代人工智能中最主流的方法被称为“分布语义”(distributional semantics)。这种方法基于一个简单的想法:你可以通过观察一个词的“邻居”来理解这个词。如果“苹果”经常出现在“红”、“水果”和“派”这些词附近,计算机就会学习到“苹果”与这些概念相关联。通过分析数十亿个句子,这些系统构建了一张地图,将意义相似的词汇放在相近的位置。这种方法促成了能够撰写故事、回答问题并进行语言翻译的强大语言模型的诞生。这些模型是在来自互联网的海量文本上进行训练的,通过学习根据之前的词语来预测句子中的下一个词。

然而,论文认为这种成功伴随着隐形的代价。因为这些模型仅通过文本学习,它们从未直接体验过世界。它们从未见过日落,从未品尝过草莓,也从未感受过踢到脚趾的疼痛。它们知道“苹果”与“红”相关联,是因为它们在书籍和文章中看到过这两个词在一起出现,但它们并不知道红色看起来是什么样,也不知道苹果尝起来是什么味道。作者举例说,如果询问一个语言模型是否见过苹果,模型会如实回答“没有”,因为它从未见过任何东西。它处理的仅仅是符号。这导致了一种情况:机器可以完美地谈论世界,但它并不理解世界。这就像是一个读遍了所有关于游泳的书籍,却从未接触过水的人。

论文还强调了情感和意图在人类语言中的作用。当我们说话时,我们不仅仅是在交换数据;我们还在表达感受、欲望和目标。孩子学习说话是因为他们有沟通的需求,去寻求帮助或分享快乐。这种驱动力与我们的身体和情感息息相关。目前的语言模型不具备情感或意图。它们不会感到饥饿、疲劳或好奇。它们说话不是因为想要表达,而是因为被程序设定为去预测下一个词。作者认为,如果没有这些内在驱动力和情感连接,机器将永远难以掌握人类习以为常的语言中那些更深层、更细微的意义。

论文的结论是,尽管人工智能在处理语言方面取得了显著进展,但它尚未解决理解意义的问题。目前的模型是处理对话的强大工具,但它们缺乏赋予词汇真正分量的具身经验。为了取得进展,作者建议我们需要结合不同方法的优势。我们需要能够不仅分析文本,还能与物理世界互动、感受情感并拥有意图的系统。在机器能够以人类的方式体验世界之前,它们对语言的理解将始终是不完整的。它们会继续成为使用词汇的高手,但永远无法真正知晓这些词汇背后的真谛。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →