← 最新论文
🤖 AI

Taming the Centaur(s) with LAPITHS: a framework for a theoretically grounded interpretation of AI performances

本文介绍了 LAPITHS 框架,以质疑诸如 CENTAUR 等人工智能模型具备类人认知这一主张的理论有效性,并论证其表现源于行为主义模式而非真正的认知合理性。

原作者: Matteo Da Pelo, Alessio Donvito, Claudio Frongia, Pietro Salis, Antonio Lieto

发布于 2026-05-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Matteo Da Pelo, Alessio Donvito, Claudio Frongia, Pietro Salis, Antonio Lieto

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《用拉庇泰人驯服半人马》的通俗解读,辅以富有创意的类比。

宏观图景:“半人马”与“拉庇泰人”的对决

想象一下,有一款名为半人马(Centaur)的全新超级智能 AI。其创造者声称它是一个“统一认知模型”。用大白话来说,他们宣称:“我们教会了这款 AI 完美模仿人类行为,因此它必然像人类一样思考。它不仅仅是一个计算器,它是一个数字大脑。”

这篇论文的作者,一支来自意大利的研究团队,却说道:"且慢。”

他们提出了一个名为拉庇泰人(LAPITHS)的框架(得名于与半人马作战的古希腊战士)。他们的任务是“驯服”围绕半人马的炒作。他们主张,仅仅因为 AI 表现得像人类,并不意味着它像人类一样思考。他们希望将表现(performance)与思考(cognition)区分开来。


核心问题:“归因谬误”

这篇论文指出了一个逻辑陷阱,称为归因谬误(Ascription Fallacy)。

类比
想象你看到一个机器人,它能完美模仿人类下棋。它移动棋子,停顿以“思考”,甚至会在疲劳时犯下与人类相同的错误。

  • 谬误:你看着机器人说:“哇,它一定拥有人类的大脑!它理解策略,并能感受到比赛的压力。”
  • 现实:这个机器人可能只是一个超高速计算器,它死记硬背了数百万场棋局。它并不“理解”任何东西;它只是基于模式预测下一步棋。

作者认为,半人马就是这盘棋机器人。它是在名为Psych-101的人类决策海量数据集上训练的。因为它被训练去预测人类会做什么,所以它预测得非常准确。但作者声称,这仅仅是行为模仿,而非认知对齐

工具:“最小认知网格”(MCG)

为了证明他们的观点,作者构建了一个名为最小认知网格(Minimal Cognitive Grid, MCG)的评分表。你可以把它想象成一个“认知真相探测器”,它从三个方面对 AI 进行评分,而不仅仅是看它回答问题有多好。

  1. 结构与功能(“如何”):

    • 问题: AI 是否使用了与人类大脑相同的内部“齿轮”?
    • 发现: 人类是渐进式学习的(实时试错),并且工作记忆有限(我们只能在脑海中记住少量事物)。然而,半人马是批量训练的(就像一次性读完整本书),并且拥有巨大的“上下文窗口”(它能记住对话中的所有内容)。
    • 裁决: 半人马未能通过此项测试。它表现得像人类,但其内部引擎截然不同。这就像一架飞机像鸟一样飞行,却使用的是喷气发动机而非扇动翅膀。
  2. 通用性(“范围”):

    • 问题: 它能进行多种不同类型的思考吗?
    • 发现: 半人马擅长数学、推理和语言。但它是单模态的,意味着它只处理文本。它没有眼睛去看,没有手去触摸,也没有身体去移动。
    • 裁决: 它获得部分分数。它很聪明,但缺乏人类的“具身”体验。
  3. 表现匹配(“结果”):

    • 问题: 它能否给出正确答案,犯同样的错误,并花费相同的时间?
    • 发现: 半人马在这方面表现出色。它几乎完美地预测了人类的选择,甚至模仿了人类的错误模式。
    • 裁决: 此项得分很高。但作者警告:此处的高分并不能证明它像我们一样思考

最终得分:综合来看,半人马的“认知可能性”得分较低。它是一个出色的模拟器(完美的演员),但不是一个优秀的认知模型(真正的思考者)。

实验:“任何人都能做到吗?”

为了证明半人马并非独一无二,研究人员进行了一项测试。他们选取了另外五个强大的 AI 模型(如 GPT-4、Gemini 等),这些模型并未在人类数据上进行过训练。

他们给这些模型一个简单的指令:“这是游戏规则。这是发生的历史。现在,人类会怎么做?”(这被称为RAG或检索增强生成)。

结果

  • 这些“未训练”的模型表现几乎与半人马一样好。
  • 在某些情况下,性能差异如此微小,以至于在统计上毫无意义。
  • 比喻:这就像给一群演员一个剧本。半人马是那个完美背下剧本的演员。但是,当你把同一份剧本给其他演员时,他们也能在没有预先背诵整本书的情况下,几乎完美地演绎出台词。

结论:你不需要一个“特殊”的认知模型来模仿人类行为;你只需要一个聪明的语言模型和正确的指令。

脑扫描测试(fMRI)

半人马的创造者声称,经过训练后,AI 的“内部思想”(神经表征)开始看起来像人类脑扫描(fMRI 数据)。他们说这证明了 AI 正在变得“像大脑”。

作者也对此进行了测试。他们让其他 AI 模型仅通过阅读任务描述,来猜测特定任务的大脑活动会是什么样子。

结果

  • 其他模型也产生了与人类脑扫描高度相关的猜测。
  • 比喻:如果你问一群人描述“恐惧”的感觉,他们可能会使用相似的词汇(心跳加速、出汗)。这并不意味着他们都有完全相同的生物恐惧机制;这仅仅意味着他们都在描述同一个概念。
  • 作者认为,脑扫描中的高相关性比创造者承认的更容易获得。这并不能证明 AI 拥有大脑;它只能证明它理解了任务的概念

最终结论

这篇论文向 AI 世界发出了警告:

  • 不要混淆地图与疆域。仅仅因为 AI 绘制了人类行为的完美地图(预测我们的行为),并不意味着 AI 就是疆域本身(人类思维)。
  • 半人马是一个优秀的预测者,但是一个薄弱的解释者。它是预测人类下一步行动的绝佳工具。但我们不能用它来解释人类为何会这样思考,因为其内部机制与我们有着根本的不同。
  • 我们需要更好的测试。我们需要停止只问“它是否得到了正确答案?”,转而开始问“它是否使用了与人类相同的思维齿轮得出了正确答案?”

简而言之:半人马是一位技艺精湛的演员,但它不是人类。作者建立了一个框架(LAPITHS),以确保我们不会被这种表演所迷惑。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →