Lexical discovery in unknown environments orchestrated by Large Language Models
本文提出了神经符号词汇发现(NSLD)框架,在该框架中,基于大语言模型的智能体通过将新的“异类”词汇锚定到自然语言(通过语义嵌入的邻近性),自主地为未知的视觉实体开发并收敛出共享词汇,从而为自主探索任务实现部署前规划。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一群探险家降落在一个没有任何事物被命名的星球上。那里没有地图,没有字典,也没有人类用来描述那些奇异发光岩石或漂浮生物的词汇。他们该如何彼此交流关于这些新事物的看法?这就是“符号落地”(symbol grounding)的谜题。简单来说,它是将一个虚构的声音或符号与你所能看到或触摸到的真实事物相连接的挑战,而不是仅仅将一个词链接到另一个词上。通常,机器人和人工智能通过阅读人类的书籍或观看人类的视频来学习,因此它们只知道人类已经命名的事物的名称。但当它们遇到全新的、在任何人类语言中都不存在的事物时,会发生什么呢?这篇论文深入探讨了这一谜团,探讨了一群人工智能智能体是否可以为未知事物发明属于它们自己的共享语言,并随后将其教给我们。
这项研究背后的研究人员拉斐尔·森德拉-阿兰斯(Rafael Sendra-Arranz)及其团队建立了一个数字实验,以观察一群人工智能机器人能否自行解决这个问题。他们创建了一个名为“神经符号词汇发现”(Neuro-Symbolic Lexical Discovery, NSLD)的框架。把它想象成一群机器人在探索一个奇异外星世界时玩的一场“传声筒”游戏。在这个世界里,机器人遇到了十种不同的视觉物体——比如奇怪的、有纹理的岩石或外星生物——这些物体经过专门设计,使其完全是全新的,因此人工智能无法仅凭其训练数据来猜测它们的名称。
这些机器人配备了一个特殊的“大脑”,结合了视觉系统(用于观察物体)、记忆库(用于存储名称)和语言模型(用于思考和交谈)。它们玩着这样一个游戏:一个机器人作为“说话者”,挑选一个物体并尝试给它起个名字。另一个机器人作为“听话者”,看到同一个物体,并且必须猜出那个名字。如果他们选择了相同的虚构词汇,就会获得一个置信度分数;如果他们选择了不同的词汇,则会失去分数并必须重新思考他们的选择。经过数百轮之后,机器人开始争论、达成一致,并最终为这十种奇异物体中的每一种都确定了一个单一的、共享的名称。
真正酷的地方在于,机器人不仅仅是就一个随机的声音达成一致。因为它们使用了一个聪明的视觉系统,它们的新名称是“锚定”在物体的实际外观上的。论文显示,机器人甚至可以根据物体外观的相似程度,将它们的新外星词汇与人类的英语单词联系起来。例如,如果一块新的外星岩石看起来有点像一块巨石,人工智能可能会将它的新外星词汇与英语单词“rock”(岩石)联系起来。这意味着机器人不仅仅是在制造胡言乱语;它们正在在它们的新发现与我们现有的语言之间搭建一座桥梁。
该团队在规模从仅有两个到二十个机器人不等的群体中进行了这些模拟,他们发现无论群体规模多大,机器人总能就共享词汇达成一致。然而,群体越大,达成一致所需的时间就越长。在最小的群体(两个机器人和三个物体)中,它们在大约16轮内就解决了问题。但在最大的群体(二十个机器人和十个物体)中,它们花费了近4600轮才达到完美的共识。研究人员还创建了数学公式,可以精确预测一个机器人群体达成一致所需的时间,这可以帮助工程师在任务启动前进行规划。
需要注意的是,整个故事都发生在计算机模拟之中。机器人并没有真正走在星球上,而那些“外星人”也只是计算机生成的图像。论文并不声称这在现实世界的机器人中是一个已解决的问题,但它表明这种方法在受控的数字环境中运作得非常好。作者认为,这是一个重要的进步,因为它表明人工智能可以学习为它从未见过的东西命名,而无需人类介入去教它们每一个单词。这是迈向未来的一步,届时我们的机器人探险家可以从深海或遥远卫星归来,并说:“我们发现了这个奇怪的东西,这就是我们对它的称呼。”
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。