← 最新论文
💬 NLP

Comparing Semantic Navigation in Humans and Large Language Models using Natural Language Processing

这项研究表明,人类语义记忆检索表现出比当前大语言模型更具变异性和探索性的搜索模式,这由言语流畅度任务中更高的熵、更大的语义步长以及更广的离散度所证实,且没有任何温度调优配置能够完全复制这一特征。

原作者: Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-Hernández

发布于 2026-07-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Gabriel Paris-Colombo, Rodrigo M. Cabral-Carvalho, Felipe D. Toro-Hernández

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你的大脑是一个巨大的、繁忙的图书馆,每一本书都是一个词汇或一个概念。当你玩像“在一分钟内说出尽可能多的动物名称”这样的游戏时,你并不只是在随机地从书架上取书;你是在这个图书馆中进行导航。你可能从“宠物”书架开始,拿了几本书(猫、狗、仓鼠),然后突然决定来一个大跳跃,直接跳到“海洋”书架去拿一只鲨鱼。这就是你的大脑探索世界的方式。

一支研究团队决定观察我们今天使用的超级智能 AI 聊天机器人(如 GPT-4o、Gemini 和 Claude)是否也以同样的方式在这个图书馆中导航。他们让 82 名真实人类和三种不同的 AI 模型接受了测试,要求他们列举动物。为了让 AI 表现得更像人,他们甚至要求机器人先假装自己是不同类型的人(比如厨师或飞行员),然后再列举动物。他们还调整了一个“随机性旋钮”(称为温度/temperature),将其从 0.0(超级机器人化且可预测)调至 1.0(超级混乱且狂野)。

以下是他们的发现,这有点像是一个剧情反转。

人类的“丛林秋千” vs. AI 的“走钢丝”

研究人员测量了三个指标,以观察在图书馆中的“行走”状态:

  1. 步长(Step Size): 你在词汇之间跳跃的幅度有多大?(例如,从“猫”跳到“鲨鱼”是大跳跃;“猫”到“狗”是小跳跃)。
  2. 惊喜因子(熵/Entropy): 你的步伐有多不可预测?你是随机切换书架,还是路径非常稳定?
  3. 漫游欲(距离质心的距离/Distance to Centroid): 你离图书馆的中心有多远?你是紧贴着主干道,还是去探索了那些尘封已久的角落?

重大发现:
人类是终极的探险家。我们的路径是混乱、不可预测且充满巨大跳跃的。我们在词汇之间的步长更大,我们的路径更不可预测,并且我们离中心点更远。我们就像是在丛林秋千上玩耍的孩子,在横杆之间荡来荡去,有时会落在离起点很远的地方。

相比之下,AI 模型则像是走钢丝的人。它们保持在书架中心附近。它们的步幅较小,路径更具可预测性,而且很少进入“深林”区域。即使研究人员将“随机性旋钮”调到最大(1.0)以让 AI 变得更加狂野,这些机器人仍然无法完全匹配人类的风格。它们仍然显得过于谨慎且过于聚集。

“温度”陷阱

你可能会想:“如果我把 AI 的随机性调得足够高,它就会表现得和人类一模一样!”该论文指出,事实并非如此。

研究人员测试了 AI 在八种不同的温度设置下的表现(0.0, 0.15, 0.3, 0.45, 0.6, 0.75, 0.9, 1.0):

  • 在某些特定的设置下,AI 在某一项测试中确实看起来像人。例如,在温度为 0.75 时,Claude 模型采取的步长与人类大致相当。
  • 但问题在于:没有任何单一的设置能让 AI 在所有维度上同时看起来都像人。 你可以让步长变得正确,但那样 AI 就会变得过于可预测。或者你可以让它进行远程漫游,但那样它就会停止进行大幅度的跳跃。

这就像是在尝试调到一个特定的电台频率。你可能会调对音量,或者调对清晰度,但无论你怎么旋转旋钮,都无法调出那种完美的、具有人类特征的声音。AI 的“大脑”构建方式不同,因此它无法复制人类记忆中那种完整、混乱且美丽的舞蹈。

这对“机器人人”意味着什么

曾几何时,科学家们希望我们可以直接使用 AI 作为“硅基参与者”——基本上就是作为“机器人人类”——来测试心理学理论。我们可以询问 AI 一个问题,看它说了什么,并假设它像人一样思考。

这篇论文对此提出了反对意见。它表明,虽然 AI 在听起来流畅且聪明方面表现出色,但它并不像我们那样进行信息“搜索”。AI 是基于统计学来预测下一个词的,就像一个超级快速的猜谜者,总是选择最可能的选项。然而,人类结合了策略与惊喜。我们拥有“工作记忆”,这有助于我们记住已经说过的话,并决定何时跳向一个全新的想法。即使被要求假装成一个人,AI 似乎也缺乏这种特定的“脑力体操”。

总结

这项研究并不是证明 AI “坏掉了”或它永远无法发挥作用。相反,它表明当前的 AI 模型存在一种系统性偏差,即倾向于留在安全且熟悉的地方。它们擅长局部探索(留在“宠物”书架),但在进行人类自然进行的全局探索(跳到“海洋”书架)方面却表现挣扎。

因此,尽管我们可以通过微调让 AI 在特定时刻表现得有一点点像人,但我们尚未找到一种方法,能让它完全模拟人类大脑在词汇世界中航行时那种复杂、漫游且充满惊喜的方式。AI 是一个强大的工具,但它还不是人类思维的完美复刻版。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →