← 最新论文
💬 NLP

EduArt: An educational-level benchmark for evaluating art history knowledge in large language models

本文介绍了 EduArt,这是一个包含 871 个由人工编写的多语言、多格式问题的、具有心理测量学鲁棒性的教育级基准测试,该研究表明,尽管大语言模型擅长进行艺术史的多项选择识别,但其在开放式问题和错误识别任务上的表现大幅下降,凸显了识别能力与可靠部署艺术史知识能力之间的关键差距。

原作者: Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Gianmarco Spinaci, Lukas Klic, Giovanni Colavizza

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图测试一群新学生在艺术史方面的聪明程度。长期以来,标准的测试方法一直是多项选择题。你向他们展示一张画作的照片,并问:“这是谁画的?”并给出四个选项:A、B、C 或 D。

这篇名为“EduArt”的论文指出,这种方法就像是通过只让一名厨师指着一张汉堡的照片并说“是的,那是汉堡”来测试他们的烹饪技能。这太简单了。最聪明的 AI 模型(即“学生”)现在在这些多项选择题上的得分几乎达到了 100%。它们并不一定理解艺术,它们只是非常擅长从一个列表中猜出正确的字母。

新测试:EduArt
作者创建了一个更难的新考试,叫做 EduArt。它不再仅仅是多项选择,而是使用了来自意大利高中教科书和美国大学入学考试的真实问题。他们并不是用计算机生成的这些问题;这些问题是由真正的教师编写的。

把 EduArt 想象成一个针对 AI 的“多技能障碍赛”。AI 不再只是挑选一个字母,它必须:

  • 填空: “艺术家使用了 [______] 技术。”
  • 找错: “找出关于这幅画作的句子中错误的单词。”
  • 拖放: “将正确的词放在文本中的正确位置。”
  • 解释其作品: “你为什么选择那个答案?”

研究发现
研究人员在这一新赛道上测试了 12 种不同的 AI 模型(即不同公司的“大脑”)。以下是发生的情况,使用了一些简单的比喻:

  1. “识别”陷阱: 当 AI 被要求仅从列表中选择答案(多项选择)时,顶尖模型的得分超过了 94%。它们看起来像是艺术史天才。但当测试变为要求它们写出答案或寻找错误时,它们的得分骤降。一个在选择答案方面得分 94% 的模型,在被要求寻找错误时,得分掉到了 6%。

    • 比喻: 这就像一个学生可以在益智问答节目中通过快速按铃来赢得比赛,但在被要求就同一主题写一篇论文时却完全失败了。他们知道如何“识别”答案,但不知道如何“使用”知识。
  2. “图像”悖论: 你可能会认为,向 AI 展示绘画会让它更容易。令人惊讶的是,当包含图像时,AI 的表现反而变差了。

    • 比喻: 这就像给一个学生一张地图和一个指南针,但他们因为过于专注于看地图而忘了怎么走路。AI 似乎更依赖于它的文本记忆,而不是真正地“看”图片。当图片存在时,它会感到困惑;当只有文本时,它的表现反而更好。
  3. “解释你自己”效应: 研究人员要求 AI 为其答案写一段简短的理由。

    • 比喻: 想象一个通常在测试中靠猜来获得正确答案的学生。当老师说,“好,现在告诉我你为什么选这个”时,有些学生会不知所措并答错。另一些学生则会变得更加自信并答对。
    • 结果: 这完全取决于 AI 来自哪个“家族”。某些 AI 家族(如 Claude)在被迫解释自己的理由时,表现反而更好。而其他家族(如 Google 的 Gemini 和 OpenAI 的 GPT)的表现则变差了。看来,强迫它们“大声思考”有时会绊倒它们。

核心结论
这篇论文的主要观点是:知道答案和能够使用答案是两种不同的技能。

如果你只用多项选择题来测试 AI,你得到的是一个具有误导性的高分。这就像只根据一辆车在直线停车方面的表现来评判其性能,却忽略了它是否能爬坡或转弯。

对于想要利用 AI 来分析绘画或撰写描述的艺术史专家来说,这篇论文发出了警告:“不要相信多项选择题的分数。”仅仅因为一个 AI 能选出画作的正确名称,并不意味着它能写出一篇关于它的正确段落,或者能识破一件赝品。要了解 AI 真正能做什么,你必须用那些真正的学者所面临的、混乱且开放式的任务来进行测试。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →