← 最新论文
💻 computer science

Musical Score Understanding Benchmark: Evaluating Large Language Models' Comprehension of Complete Musical Scores

本文提出了名为 MSU-Bench 的人为构建基准,旨在通过涵盖巴赫、贝多芬等作曲家作品的 1800 个生成式问答对,从文本和视觉模态评估大语言模型及视觉语言模型对完整乐谱(包括音高、节奏、和声及结构)的理解能力,并揭示了现有模型在模态差异和多层次推理方面的显著挑战。

原作者: Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

发布于 2026-04-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Congren Dai, Yue Yang, Krinos Li, Huichi Zhou, Shijie Liang, Bo Zhang, Enyang Liu, Ge Jin, Hongran An, Haosen Zhang, Peiyuan Jing, Kinhei Lee, Z henxuan Zhang, Xiaobing Li, Maosong Sun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文就像是在给现在的超级人工智能(AI)进行一场**“音乐乐理期末考试”**,看看它们到底能不能真正读懂一张完整的乐谱。

想象一下,现在的 AI 就像是一个读过万卷书、背过无数歌词的“超级学霸”。你问它“贝多芬是谁?”或者“什么是大调?”,它都能对答如流。但是,如果你把一张完整的、复杂的交响乐总谱(就像一张画满了密密麻麻音符、线条和符号的“天书”)扔给它,问它:“第 7 小节的第 3 个音是什么?这段音乐的和声走向是怎样的?”,它可能会开始**“胡编乱造”**。

这篇论文就是为了解决这个问题而诞生的。

1. 核心挑战:AI 的“乐谱近视眼”和“幻觉症”

作者发现,目前的 AI 在处理乐谱时有两个大毛病:

  • 定位困难(乐谱近视眼): 乐谱是由很多“小节”组成的。AI 经常搞不清“第 7 小节”到底在哪里。就像你让一个人找书里的第 7 页,他却翻到了第 17 页,然后指着上面的字说“这就是第 7 页的内容”。
  • 幻觉(胡编乱造): 因为定位错了,或者根本看不懂,AI 就会开始“编故事”。比如乐谱上明明写的是“连奏”(smooth),它却说是“断奏”(staccato),而且说得头头是道,仿佛它真的看到了。

2. 解决方案:MSU-Bench(乐谱理解大考)

为了测试 AI 到底行不行,作者们设计了一个名为 MSU-Bench 的考试系统。

  • 题库来源: 就像音乐学院的期末考试题,题目来自巴赫、贝多芬、肖邦等大师的经典作品(共 150 首)。
  • 难度分级(像游戏闯关):
    • 第 1 关(入门): 问基本信息。比如“这首曲子是谁写的?”“速度是多少?”(就像看封面和目录)。
    • 第 2 关(进阶): 问局部细节。比如“第 5 小节最低的那个音是什么?”“这里有没有升降号?”(就像找具体的段落)。
    • 第 3 关(高手): 问和声结构。比如“这里是不是 G 小调和弦?”“和弦是怎么连接的?”(就像分析句子的语法结构)。
    • 第 4 关(大师): 问整体风格。比如“这首曲子的主题旋律在哪里出现的?”“整体是什么织体?”(就像分析整篇文章的中心思想和结构)。
  • 两种考试形式:
    • 文本版(ABC 记谱法): 把乐谱变成像代码一样的文字。这就像给 AI 看乐谱的“翻译版”,它读起来很顺畅,不容易出错。
    • 图片版(PDF): 直接给 AI 看乐谱的原始图片。这就像让 AI 直接看“天书”,难度极大。

3. 考试结果:AI 的表现如何?

作者找了 15 多个最厉害的 AI 模型来参加考试,结果发现:

  • 文本版 vs. 图片版: 当 AI 看“翻译版”(文本)时,成绩还不错,能答对一半左右;但一旦让它直接看“原图”(图片),成绩就断崖式下跌,很多模型只能答对 20% 左右。这说明 AI 目前还不太擅长直接“看”懂乐谱图片。
  • 越往后越难: 在第 1 关(找基本信息)时,AI 还能混个及格;到了第 3、4 关(分析和声、结构),很多 AI 就彻底“晕”了,正确率极低。
  • 训练有用: 如果给这些 AI 专门做一下“特训”(微调),它们的成绩会提高不少,而且不会忘记原本学到的其他知识(比如不会忘了怎么聊天)。

4. 一个有趣的发现:一起问比分开问好

作者还发现了一个小窍门:如果你把关于同一首曲子的 12 个问题一次性打包问 AI,它的表现比一个一个分开问要好。

这就像你让一个学生做一套试卷,他可能因为上下文连贯,能利用前面的答案辅助后面的思考;但如果把题目拆散了,他可能做着做着就忘了前面的线索。

5. 总结与意义

这篇论文就像给 AI 音乐领域立了一块**“里程碑”**。

  • 它告诉我们: 现在的 AI 虽然很聪明,但在理解复杂的、完整的音乐乐谱方面,还像个**“刚入门的实习生”**,特别是看图能力很弱,容易“睁眼说瞎话”。
  • 它提供了工具: 这个考试系统(MSU-Bench)就像一把尺子,未来可以用来衡量 AI 在音乐理解上到底进步了多少。
  • 未来展望: 虽然现在的 AI 还不能完全替代人类音乐家去分析乐谱,但通过这种“文本 + 图片”结合的训练,它们正在慢慢学会如何更准确地“阅读”音乐。

一句话总结:
这就好比给 AI 发了一张**“乐谱阅读理解”的考卷,发现它们目前“读得懂文字,看不懂图片,且容易在细节上胡编乱造”**,但这个考试系统为未来训练出真正的“音乐 AI 大师”打下了坚实的基础。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →