MuseBench: Benchmarking Intent-Level Audiovisual Arts Understanding in MLLMs
本文介绍了 MuseBench,这是一个包含超过 4,000 个经过专家验证的、涵盖多种视听艺术领域的综合基准测试,旨在评估多模态大语言模型的意图级推理能力,并揭示了当前人工智能系统与人类专家在理解创意艺术意图方面存在的显著性能差距。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下你正在看电影。一个标准的视频 AI 可能会告诉你:“一个男人在黑暗的房间里哭泣。”它识别的是像素并辨认出物体。
但 MuseBench 提出了一个更难的问题:“导演为什么要选择让房间变暗并让镜头晃动?是为了让你感到被困住了,还是为了表现角色正在丧失理智?”
这篇论文介绍了一个名为 MuseBench 的新“考试”,旨在测试 AI 是否能够理解视频中的艺术灵魂,而不仅仅是表面的细节。以下是它的工作原理,简单拆解如下:
1. 问题所在:AI 是“剧透者”,而非“评论家”
目前的 AI 模型非常擅长识别事物(比如“一只狗”或“一辆车”)。但当涉及到艺术——电影、绘画、戏剧和电子游戏时——它们很难理解其中的意图。
- 类比: 想象一个学生可以背诵整部剧本,却不明白为什么演员在说话前停顿了三秒。他们知道发生了什么,但不知道为什么要那样做。
- 差距: 现有的测试只问“正在发生什么?”而 MuseBench 问的是:“艺术家试图让你感受什么,以及他们是如何做到的?”
2. 解决方案:“视频论文”库
为了构建这个测试,研究人员并没有随机抓取片段。他们从互联网(YouTube、Bilibili、TikTok)上收集了超过 10,000 篇“视频论文”(Video Essays)。
- 什么是视频论文? 可以把它想象成一位电影评论家在一段剪辑上方进行讲解,指出为什么特定的灯光选择能营造恐惧感,或者为什么特定的相机角度会让角色看起来充满力量。
- 过程: 研究人员利用 AI 将这些专家的评论转化为考试题目。他们创建了 4,016 道题目,涵盖了四个主要的艺术领域:
- 电影(电影/电视剧)
- 静态视觉艺术(绘画/摄影)
- 舞台表演(戏剧/舞蹈)
- 游戏艺术(电子游戏)
3. 考试形式:不仅仅是“A, B, C, D”
真正的艺术往往具有多种解读的可能性。一幅画可能同时关于“孤独”和“宁静”。
- 旧方式: 大多数 AI 测试会强迫你选择一个唯一的正确答案(就像单选题一样)。
- MuseBench 的方式: 他们结合了单选题(选出最佳答案)和多选题(选出所有有效的解读)。
- 类比: 如果你问“这首歌在表达什么?”,一个简单的测试可能会强迫你选择“悲伤”。而 MuseBench 允许你在视频支持的情况下,同时选择“悲伤”和“希望”。这测试了 AI 处理人类艺术复杂性的能力。
4. 结果:AI 仍处于“新手”阶段
研究人员在 28 个目前最智能的 AI 模型(包括 GPT-4、Claude 和 Gemini 等知名模型)上进行了这项考试。
- 得分: 即便是最好的 AI 也仅获得了约 48% 的正确率。
- 人类得分: 人类艺术专家获得了 87% 的正确率。
- 结论: AI 基本上是在一半的问题上靠猜。它还没有学会艺术的“语言”。
5. 它们在哪里失败了?
论文发现了 AI 失败的一些有趣且具体的模式:
- “游戏”盲点: AI 对理解电子游戏表现得很差。它似乎阅读了很多电影剧本,但还没有通过足够的“游玩”来理解游戏设计是如何创造情感的。
- “首选选项”偏见: 当 AI 不知道答案时,它有一种奇怪的习惯,即比人类更频繁地选择第一个选项(选项 A)。
- “显著性”陷阱: 在有多个正确答案的问题中,AI 通常能找到最显而易见的答案,但会错过那些微妙的答案。这就像是看到了大树,却忽略了森林。
总结
MuseBench 是对 AI 的一次现实检验。它证明了虽然 AI 可以描述一段视频,但它仍然非常不擅长理解其背后的创作选择。要变得更好,AI 需要停止仅仅“观看”像素,开始学习艺术家、导演和游戏设计师的“词汇量”。
底线是: 我们已经拥有了可以描述画作的 AI,但我们还没有拥有能够真正欣赏画作的 AI。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。