← 最新论文
⚡ electrical engineering

AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs

本文介绍了 AVI-Bench,这是一个受认知启发、具有三阶段评估框架和原始感觉扩展(AVI-Bench-PriSe)的基准测试,旨在系统地评估和诊断全模态多模态大语言模型(Omni-MLLMs)在音视频智能方面的当前局限性,并最终提出了一个四级分类法以指导未来的模型开发。

原作者: Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaoting Wang, Ziyi Zhang, Wenming Tu, Shaoxuan Xu, Wenjie Du, Cheng Liang, Weijun Wang, Yuanchao Li, Guangyao Li, Hao Fei, Yuanchun Li, Henghui Ding, Yunxin Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个机器人成为一名“类人”的观察者。你希望它不仅仅是看到一段视频或听到一种声音,而是真正理解两者是如何协同工作的——比如意识到警笛的声音与警车闪烁的灯光是相匹配的,或者一个人的愤怒声音与其紧锁的眉头是相匹配的。

论文 《AVI-Bench:迈向全能多模态大模型(Omni-MLLMs)的类人视听智能》 引入了一个全新的、严苛的测试,名为 AVI-Bench,旨在测试当前的 AI 模型在这一特定技能上的表现究竟如何。

以下是他们所做工作的拆解,使用了简单的类比:

1. 问题所在:“单线程思维”的机器人

目前的 AI 模型(称为 Omni-MLLMs)就像是那些擅长读教科书但听不懂音乐或看不懂电影的学生。它们可以分别处理文本、图像和音频,但在将它们无缝融合方面表现得很差。

  • 差距: 现有的测试就像是给学生做数学测验或者音乐测验,但从未要求他们在听着歌的同时解一道数学题。我们不知道它们是否能够处理现实世界中视听同步发生的情况。

2. 解决方案:“认知健身房”(AVI-Bench)

作者们为 AI 模型构建了一个新的健身房,用于训练和测试它们的“视听智能”(AVI)。他们不仅仅是检查 AI 是否得到了正确答案,还会检查 AI 是如何思考的,通过四个难度等级将其分解,就像带有递增难度的电子游戏一样:

  • 第 1 级:感知(眼睛与耳朵)
    • 类比: AI 能发现物体吗?它能听到声音吗?
    • 测试: “这段视频里有多少只狗?”或者“这个声音是汽车喇叭声还是鸟叫声?”它检查 AI 是否能简单地检测出存在的事物。
  • 第 2 级:理解(大脑的档案柜)
    • 类比: AI 能把点连成线吗?
    • 测试: “描述这个场景。”或者“找到与这段音频相匹配的视频片段。”它检查 AI 是否理解了故事,或者理解了视觉与听觉之间的关系。
  • 第 3 级:推理(侦探)
    • 类比: AI 能解开谜团吗?
    • 测试: “为什么那个人在奔跑?”或者“如果玻璃碎了,我们应该听到什么声音?”它检查 AI 是否能基于结合了视觉和听觉的线索做出逻辑结论。
  • 第 4 级:原始感官(“外星人”测试)
    • 类比: 这是该论文独特的转折点。想象向 AI 展示一个奇怪的、抽象的形状在移动,并伴随着一种低沉的嗡嗡声。它没有任何“意义”(没有汽车、人或语言)。
    • 测试: “这个形状是在变大吗?”或者“这个声音是在变响吗?”
    • 为什么重要: 大多数 AI 是在“熟悉”的数据(猫、狗、汽车)上训练的。这个测试旨在观察 AI 是否能像人类婴儿一样,在不需要识别特定物体之前,就对原始感官数据做出反应。

3. 结果: “视觉专家”陷阱

作者测试了 28 种不同的 AI 模型(包括 GPT-4o 和 Gemini 等知名模型)。结果令人警醒:

  • “视觉专家”综合征: 大多数模型就像是一个拥有 20/20 视力但听力不佳的人。它们在处理涉及图像的任务时表现出色,但在以音频为主要线索的任务中却表现得非常吃力。
  • 瓶颈效应: 论文发现,如果一个 AI 在“感知”(看或听)方面表现糟糕,那么它在“推理”(解谜)方面就不可能表现出色。你无法在脆弱的地基上建造一座强大的推理塔。
  • “外星人”失败: 当被测试于“原始感官”(不熟悉、低意义的数据)时,这些模型崩溃了。它们的表现远逊于人类。这就像是给人类一个从未听过的语言测试;人类甚至无法仅凭观察形状来推测其规则。
  • 定位(Grounding)很难: 即便是最优秀的模型,在尝试指出声音在视频中的确切来源时(例如指向房间里的说话者)也感到困难。

4. 新的评分卡:四级分类法

作者没有仅仅给出一个平均分(因为平均分可能会掩盖弱点),而是创建了一个 “四级分类法” 来更公平地评估模型:

  1. 任务适应性(Task-Adaptive): 它能否完成这项工作?
  2. 模态适应性(Modality-Adaptive): 它是均衡的,还是仅仅是一个“视觉专家”?
  3. 阶段适应性(Stage-Adaptive): 它的推理确实依赖于良好的感知,还是仅仅在瞎猜?
  4. 领域适应性(Domain-Adaptive): 它能否处理奇怪、陌生的情境,还是只能处理它见过的东西?

核心结论

论文得出结论:虽然 AI 正在变得越来越聪明,但它距离“类人”的视听智能还很遥远。目前的 AI 更像是一群尚未学会良好协作的专业人士,尤其是在面对陌生或新奇的情况时。

AVI-Bench 是研究人员用来衡量进步的新标尺,确保未来的 AI 不仅仅是记忆答案,而是真正像人类一样去感知、理解和推理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →