AVI-Bench: Toward Human-like Audio-Visual Intelligence of Omni-MLLMs
本文介绍了 AVI-Bench,这是一个受认知启发、具有三阶段评估框架和原始感觉扩展(AVI-Bench-PriSe)的基准测试,旨在系统地评估和诊断全模态多模态大语言模型(Omni-MLLMs)在音视频智能方面的当前局限性,并最终提出了一个四级分类法以指导未来的模型开发。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个机器人成为一名“类人”的观察者。你希望它不仅仅是看到一段视频或听到一种声音,而是真正理解两者是如何协同工作的——比如意识到警笛的声音与警车闪烁的灯光是相匹配的,或者一个人的愤怒声音与其紧锁的眉头是相匹配的。
论文 《AVI-Bench:迈向全能多模态大模型(Omni-MLLMs)的类人视听智能》 引入了一个全新的、严苛的测试,名为 AVI-Bench,旨在测试当前的 AI 模型在这一特定技能上的表现究竟如何。
以下是他们所做工作的拆解,使用了简单的类比:
1. 问题所在:“单线程思维”的机器人
目前的 AI 模型(称为 Omni-MLLMs)就像是那些擅长读教科书但听不懂音乐或看不懂电影的学生。它们可以分别处理文本、图像和音频,但在将它们无缝融合方面表现得很差。
- 差距: 现有的测试就像是给学生做数学测验或者音乐测验,但从未要求他们在听着歌的同时解一道数学题。我们不知道它们是否能够处理现实世界中视听同步发生的情况。
2. 解决方案:“认知健身房”(AVI-Bench)
作者们为 AI 模型构建了一个新的健身房,用于训练和测试它们的“视听智能”(AVI)。他们不仅仅是检查 AI 是否得到了正确答案,还会检查 AI 是如何思考的,通过四个难度等级将其分解,就像带有递增难度的电子游戏一样:
- 第 1 级:感知(眼睛与耳朵)
- 类比: AI 能发现物体吗?它能听到声音吗?
- 测试: “这段视频里有多少只狗?”或者“这个声音是汽车喇叭声还是鸟叫声?”它检查 AI 是否能简单地检测出存在的事物。
- 第 2 级:理解(大脑的档案柜)
- 类比: AI 能把点连成线吗?
- 测试: “描述这个场景。”或者“找到与这段音频相匹配的视频片段。”它检查 AI 是否理解了故事,或者理解了视觉与听觉之间的关系。
- 第 3 级:推理(侦探)
- 类比: AI 能解开谜团吗?
- 测试: “为什么那个人在奔跑?”或者“如果玻璃碎了,我们应该听到什么声音?”它检查 AI 是否能基于结合了视觉和听觉的线索做出逻辑结论。
- 第 4 级:原始感官(“外星人”测试)
- 类比: 这是该论文独特的转折点。想象向 AI 展示一个奇怪的、抽象的形状在移动,并伴随着一种低沉的嗡嗡声。它没有任何“意义”(没有汽车、人或语言)。
- 测试: “这个形状是在变大吗?”或者“这个声音是在变响吗?”
- 为什么重要: 大多数 AI 是在“熟悉”的数据(猫、狗、汽车)上训练的。这个测试旨在观察 AI 是否能像人类婴儿一样,在不需要识别特定物体之前,就对原始感官数据做出反应。
3. 结果: “视觉专家”陷阱
作者测试了 28 种不同的 AI 模型(包括 GPT-4o 和 Gemini 等知名模型)。结果令人警醒:
- “视觉专家”综合征: 大多数模型就像是一个拥有 20/20 视力但听力不佳的人。它们在处理涉及图像的任务时表现出色,但在以音频为主要线索的任务中却表现得非常吃力。
- 瓶颈效应: 论文发现,如果一个 AI 在“感知”(看或听)方面表现糟糕,那么它在“推理”(解谜)方面就不可能表现出色。你无法在脆弱的地基上建造一座强大的推理塔。
- “外星人”失败: 当被测试于“原始感官”(不熟悉、低意义的数据)时,这些模型崩溃了。它们的表现远逊于人类。这就像是给人类一个从未听过的语言测试;人类甚至无法仅凭观察形状来推测其规则。
- 定位(Grounding)很难: 即便是最优秀的模型,在尝试指出声音在视频中的确切来源时(例如指向房间里的说话者)也感到困难。
4. 新的评分卡:四级分类法
作者没有仅仅给出一个平均分(因为平均分可能会掩盖弱点),而是创建了一个 “四级分类法” 来更公平地评估模型:
- 任务适应性(Task-Adaptive): 它能否完成这项工作?
- 模态适应性(Modality-Adaptive): 它是均衡的,还是仅仅是一个“视觉专家”?
- 阶段适应性(Stage-Adaptive): 它的推理确实依赖于良好的感知,还是仅仅在瞎猜?
- 领域适应性(Domain-Adaptive): 它能否处理奇怪、陌生的情境,还是只能处理它见过的东西?
核心结论
论文得出结论:虽然 AI 正在变得越来越聪明,但它距离“类人”的视听智能还很遥远。目前的 AI 更像是一群尚未学会良好协作的专业人士,尤其是在面对陌生或新奇的情况时。
AVI-Bench 是研究人员用来衡量进步的新标尺,确保未来的 AI 不仅仅是记忆答案,而是真正像人类一样去感知、理解和推理。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。