← 最新论文
🤖 AI

Structural Ranking of the Cognitive Plausibility of Computational Models of Analogy and Metaphors with the Minimal Cognitive Grid

本文应用最小认知网格框架,基于功能/结构比、通用性和性能匹配的形式化定量方法,系统评估并排序类比与隐喻的主流计算模型(包括 SME、CogSketch、METCL 和大语言模型)的认知合理性。

原作者: Alessio Donvito, Antonio Lieto

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Alessio Donvito, Antonio Lieto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名才艺秀的评委,但参赛者不是歌手或舞者,而是试图表现得像人类思考者的计算机程序。具体来说,它们正在尝试解决涉及类比(例如"A 之于 B 如同 C 之于 D")和隐喻(例如“我的工作是一座监狱”)的谜题。

这篇论文的作者,Alessio Donvito 和 Antonio Lieto,创建了一个名为**最小认知网格(MCG)*的特殊评分系统。将这个网格想象成一张三条腿的凳子。为了让计算机舒适地坐在凳子上,并被视为一个“认知上合理”的模型(意味着它像人类一样思考,而不仅仅是看起来*像),它需要在三条腿上保持平衡。

以下是这三条腿的工作原理,使用简单的类比:

第一条腿:蓝图匹配(功能/结构比率)

问题: 计算机构建答案的方式是否与人类大脑相同,还是它只是靠“魔法”得到了正确答案?

  • 类比: 想象两个人试图建造一个鸟屋。
    • A 先生(结构模型): 使用木材、钉子和锤子,遵循木匠会遵循的完全相同的步骤。他们可能很慢,但他们的过程是像人类的。
    • B 先生(功能模型): 使用 3D 打印机或激光切割机。他们得到了完全相同的鸟屋,但机器内部与人类的双手完全不同。
  • 论文主张: 作者认为,为了让计算机成为我们如何思考的良好模型,它需要使用“木材和钉子”的方法(结构性的)。
    • SME 和 CogSketch: 这些就像木匠。它们使用特定的规则(例如“一件事映射到一件事”),模仿人类如何进行类比。它们在此项得分很高。
    • LLM(如 GPT-4): 这些就像 3D 打印机。它们在制造鸟屋(获得正确答案)方面非常出色,但它们是通过从庞大的书籍库中猜测模式来完成的,而不是遵循类似人类的逻辑步骤。由于它们的“内部机制”与人类思维格格不入,它们在此项得分非常低。
    • METCL: 这是一位处于中间地带的木匠。它使用一套不同的蓝图(侧重于分类而非映射),因此得分居中。

第二条腿:瑞士军刀(通用性)

问题: 计算机能进行多种不同类型的思考,还是它只是一招鲜?

  • 类比:
    • 专家: 一位能击败特级大师的象棋大师,但不会系鞋带或煎鸡蛋。
    • 通才: 一个能下棋、做饭、开车和解决数学问题的人。
  • 论文主张: 作者考察这些系统是否能处理数学、视觉谜题、语言,甚至身体运动(感觉/运动技能)。
    • LLM: 这些是终极通才。它们能阅读、写作、做数学题和看图。它们在此项得分最高。
    • SME 和 CogSketch: 这些是专家。它们非常擅长特定的逻辑谜题(如视觉模式),但无法真正做数学题或理解复杂的句子。它们在此项得分较低。
    • METCL: 同样也是专家,主要专注于语言隐喻。

第三条腿:镜像测试(表现匹配)

问题: 当计算机出错时,它犯的是同一种人类会犯的错误吗?

  • 类比: 想象参加一场考试。
    • 如果你因为误解概念而答错了一道题,那是一个“人类”错误。
    • 如果你因为计算机故障或随机猜测而答错,那是一个“机器”错误。
    • 目标是看计算机的“故障”是否看起来像人类的困惑。
  • 论文主张:
    • SME 和 CogSketch: 它们在这方面表现出色。当它们未能通过视觉谜题(如瑞文渐进矩阵)时,它们会在完全相同的难题上失败,就像人类挣扎的那些难题一样。它们甚至花费相似的思考时间。它们得分非常高。
    • LLM: 它们经常能给出正确答案,但当它们失败时,它们的错误看起来与人类不同。它们可能会因为措辞的细微变化而困惑,而这不会难倒一个人。它们在此项得分较低。

最终记分牌

作者结合这三个分数,看谁赢得了“认知合理性”称号。他们决定**第一条腿(蓝图)*是最重要的,因为主要目标是理解人类如何*思考,而不仅仅是得到正确答案。

  • 获胜者(在严格规则下): CogSketch 和 SME。 尽管它们是“一招鲜”(通用性低),但它们像人类一样思考。它们是研究人类思维的最佳模型。
  • 亚军: METCL。 它处于中间位置,做了一些类似人类的事情,但不如前两者全面。
  • “魔法”盒子: LLM(GPT-4 等)。 它们极其聪明且多才多艺(高通用性),但它们不像人类那样思考。如果你想要一个解决问题的工具,它们很棒。但如果你想要一个模型来解释为什么人类会这样思考,论文说它们不是最佳选择。

主要启示

论文得出结论,变得“聪明”(得到正确答案)与变得“认知上合理”(像人类一样思考)是不同的。

  • LLM 就像一位超级演员,可以完美地背诵剧本,听起来完全像人类,但它们实际上并不感受情感。
  • SME/CogSketch 就像一位方法派演员,真正感受情感并通过角色的逻辑进行思考,即使它们无法背诵那么多台词。

作者构建了这个网格,以帮助科学家决定哪个计算机程序是研究人类思维的最佳“方法派演员”。他们发现,虽然“超级演员”(LLM)令人印象深刻,但“方法派演员”(SME/CogSketch)仍然是理解人类思维机制的黄金标准。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →