A Rigorous Turing Test: a Foundation for Evaluating Artificial General Intelligence
本文认为,关于大语言模型通过图灵测试的说法还为时过早,因为一项对图灵最初的模仿游戏进行的严谨且无约束的实现表明,人类裁判可以轻易地将人工智能与人类区分开来,这与此前可能使用了较短时间限制的研究有所不同。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个你无法仅通过阅读信息就分辨出对方是真人还是超级智能机器人的世界。这就是一个被称为“图灵测试”的著名概念的核心,这个概念几十年来一直激发着科学家、哲学家和好奇心敏锐的人们的辩论。把它想象成一场终极的“冒充游戏”。在这场游戏中,一名人类裁判通过屏幕与两名隐藏的玩家聊天。一名玩家是人类,另一名则是机器。裁判的任务是弄清谁是谁。如果机器能骗过裁判,让裁判以为它是人类,它就通过了测试。这不仅仅是一个小把戏;这是一个关于机器是否真的能像我们一样“思考”的严肃问题。随着人工智能在写故事、解数学题以及像朋友一样聊天方面变得越来越出色,人们开始问:我们是否终于制造出了一台能愚弄我们的机器?如果真的如此,这将改变我们看待技术、法律,甚至改变我们对“人之所以为人”这一定义的看法。
现在,有一支研究团队决定用一个非常严格、非常细致的实验来解决这场争论。他们想看看顶尖人工智能(以 GPT-4-Turbo 为知名代表)是否真的能通过图灵测试。但这里的转折在于:他们不仅仅是在玩这个游戏;他们是按照测试创始人艾伦·图灵在 1950 年编写的原始、严格的规则来玩的。以往许多研究都声称人工智能已经通过了测试,但研究人员怀疑那些游戏是在使用捷径,比如在仅仅五分钟后就缩短对话。他们想看看如果移除时间限制,让对话自然流动,就像朋友间真实的聊天一样,会发生什么。
结果令人惊讶,也给人工智能的热潮泼了一盆冷水。在他们严谨的实验中,人类裁判识别出机器人的次数比不上完美得分的情况,但也并非轻而易举。在 AI 试图伪装成人类的 37 场游戏中,裁判在 16 场中正确识别出了计算机。这是 43% 的成功率,意味着 AI 在大多数游戏中成功愚弄了裁判(57%)。然而,研究人员发现,与随机猜测相比,裁判的表现具有统计学上的显著性,尽管如此,AI 仍然在大多数试验中成功欺骗了裁判。这项研究表明,尽管人工智能听起来很令人印象深刻,但在这种严格条件下,它尚未完全掌握成为人类的艺术,因为它成功欺骗裁判的次数仍多于被抓获的次数。
研究中最有趣的环节之一是游戏持续的时间。以前的实验通常强迫裁判在短短五分钟内做出决定。研究人员发现,当他们让裁判从容进行时,游戏持续的时间要长得多。平均而言,“人类对机器人”的游戏大约持续 14 分钟,而“男人对女人”的游戏甚至更长,约为 24 分钟。这告诉我们,其他研究中使用的五分钟限制可能太短了,迫使裁判在真正搞清楚对方身份之前就匆忙做出判断。在给予足够的时间后,裁判变得足够敏锐,能够更频繁地识破机器人,尽管 AI 在大多数对话中依然表现出色。
研究人员还观察了 AI 是否可以通过扮演特定类型的人(例如一些早期研究尝试过的青少年)来欺骗人类。即使使用了这些技巧,在他们这种长时间、不匆促的对话中,AI 也无法像在较短的测试中那样频繁地迷惑裁判。研究得出结论,声称人工智能已经通过图灵测试可能还为时过早。并不是说 AI 很笨;它只是在面对人类长时间、放松的交谈时,它的“面具”会开始出现裂痕,即便并没有完全脱落。
那么,这对未来意味着什么?研究人员认为,图灵测试仍然是检查机器是否真正智能的重要工具。他们建议,我们不应该现在就急于宣布人工智能取得了胜利。相反,我们应该继续测试,不断完善我们的规则,并继续提出那些深刻的问题。正如其中一位研究人员所言,这项测试在未来多年内可能仍将是理解机器智能的核心部分。在人工智能能够在一场长时间、无时间压力的轻松对话中持续愚弄人类裁判之前,“机器能否思考?”这个问题仍然悬而未决,而机器人依然是房间里的那个冒充者。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。