← 最新论文
💬 NLP

CArtBench: Evaluating Vision-Language Models on Chinese Art Understanding, Interpretation, and Authenticity

本文提出了基于故宫博物院藏品的多模态基准 CARTBENCH,通过策展问答、结构化鉴赏、重新解读及真伪鉴别四项任务,系统评估了当前视觉语言模型在中文艺术品理解、深度推理及真伪鉴别方面的能力,揭示了现有模型在证据关联、长文生成及专家级鉴别方面仍存在显著不足。

原作者: Xuefeng Wei, Zhixuan Wang, Xuan Zhou, Zhi Qu, Hongyao Li, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

发布于 2026-04-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Xuefeng Wei, Zhixuan Wang, Xuan Zhou, Zhi Qu, Hongyao Li, Yusuke Sakai, Hidetaka Kamigaito, Taro Watanabe

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一个名为 CARTBENCH 的新“考试”,专门用来测试人工智能(AI)对中国传统艺术的理解能力。

想象一下,如果你给一个 AI 看一幅古画,它不仅能认出画里画的是“山水”还是“花鸟”,还能像一位真正的博物馆策展人艺术鉴赏家那样,讲出画背后的故事、分析笔触的妙处,甚至能分辨出哪幅是真迹、哪幅是赝品。

这篇论文就是给 AI 们出了一套这样的“高难度试卷”,看看它们到底是不是真的“懂”中国艺术,还是只是在“背答案”。

🎨 核心概念:CARTBENCH 是什么?

以前的 AI 考试,大多像“看图说话”或“选择题”,比如问:“这幅画里有一只猫吗?”或者“这是哪个朝代的?”。
CARTBENCH 不一样,它更像是一场**“艺术大师的进阶考核”**。它基于故宫博物院的真实藏品数据,设计了四个关卡(任务):

  1. 🕵️‍♂️ 策展人问答 (CURATORQA):证据链大挑战

    • 比喻:就像侦探破案。AI 不能瞎猜,必须指着画上的某个细节(比如印章、笔法、构图)说:“因为这里有个红印章,所以这是明代的作品。”
    • 发现:AI 做简单的“看图识字”很厉害,但一旦需要把“画面细节”和“历史知识”联系起来(比如通过画风推断朝代),很多 AI 就开始“露馅”了,准确率大幅下降。
  2. 📝 专家鉴赏 (CATALOGCAPTION):写“满分作文”

    • 比喻:让 AI 写一篇专业的艺术品介绍,必须包含四个部分:背景、内容、艺术特色、综合评价。就像让一个学生写“读后感”,不仅要写得长,还要写得有深度、有文采。
    • 发现:AI 能写出通顺的文章,格式也对了,但读起来像“行活”(套话),缺乏真正专家那种对笔墨、气韵的深刻洞察。它们离人类专家的水平还有很大差距。
  3. 💡 创意重读 (REINTERPRET):老树发新芽

    • 比喻:给一幅名画,让 AI 提出一个“新颖”的解读角度。不能只是复述教科书,要有自己的见解,但必须基于画面,不能瞎编。
    • 发现:AI 很难在“不胡编乱造”的前提下提出“有创意”的观点。它们要么太保守(像复读机),要么为了创新而编造事实。
  4. 🔍 鉴宝大师 (CONNOISSEURPAIRS):火眼金睛辨真假

    • 比喻:这是最难的“终极挑战”。给 AI 看两幅画,一幅真迹,一幅高仿(长得非常像),让它选哪个是真的。这需要观察极其细微的笔触连贯性和整体气韵。
    • 发现:在这个任务上,AI 的表现几乎和**“瞎蒙”**(猜硬币正反面)差不多。它们容易被表面的细节(比如印章多、线条密)迷惑,却看不懂真正的“笔墨神韵”。

📊 主要发现:AI 的“偏科”现象

论文测试了 9 种目前最厉害的 AI 模型,发现了一个有趣的现象:

  • 表面光鲜,内里空虚:有些 AI 在简单的选择题上得分很高(比如 80% 以上),让人以为它很懂艺术。
  • 一深就露馅:一旦题目变难,需要结合视觉证据和历史知识推理(比如“为什么这种笔法属于宋代?”),或者需要像专家一样写长文、辨真假时,它们的能力就断崖式下跌。
  • 中文模型更懂中文:在涉及中国艺术知识时,专门针对中文优化的模型(如 Qwen 系列)比通用的国际模型(如 GPT、Gemini)表现稍好,但差距依然存在。

🚀 为什么这很重要?

这就好比我们请 AI 当博物馆的“数字讲解员”或“文物鉴定助手”。

  • 如果 AI 只是**“背答案”**,它可能会把赝品当真品推荐,或者讲出一些看似有理实则错误的历史故事,误导观众。
  • CARTBENCH 的目的就是**“照妖镜”,它告诉研究人员:现在的 AI 在“文化理解”和“深度推理”上还有很长的路要走。我们需要教它们如何像人类专家一样,去观察、推理、并负责任地解释**,而不仅仅是识别物体。

总结

这篇论文就像给 AI 艺术圈发了一张**“体检报告”。它告诉我们:AI 现在的“艺术细胞”还比较初级,能认图,但不懂“画意”,更不懂“鉴真”。要想让 AI 真正走进博物馆,成为人类艺术家的得力助手,我们还需要在“证据推理”“文化深度”**上继续打磨。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →