Exploring Audio Hallucination in Egocentric Video Understanding
本文引入了一套系统评估框架和一个精心策划的数据集,以揭示最先进的视听语言模型在自我中心视频理解中存在严重的音频幻觉问题,即它们往往从视觉线索而非实际音频中推断声音,从而凸显了多模态系统进行可靠鲁棒性评估的迫切需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你胸前佩戴着一台摄像机,从你自己的视角记录你的一天。这被称为“自我中心”视频。有时,摄像机会晃动,被你的手遮挡,或者对准一面空白的墙壁。在这些时刻,你的眼睛可能会感到困惑,但你的耳朵仍在努力运作。
本文旨在教会计算机聆听这些视频,但研究人员发现了一个有趣且危险的问题:计算机正在“听到”那些并不存在的声音。
以下是他们研究发现的分解,使用了简单的类比:
1. 问题所在:计算机是在“观察房间”而不是在“聆听”
将最先进的 AI 模型(一个超级聪明的计算机大脑)想象成一位试图根据视频解决谜团的侦探。
- 理想的侦探:聆听音频磁带,然后说:“我听到狗在叫。”
- 有缺陷的侦探(本文中的 AI):看着视频,看到一张狗的图片,立刻说:“我听到狗在叫”,即使音频磁带完全静音或只有风声。
研究人员将这种现象称为**“音频幻觉”**。这就像一个人看到一张柠檬的图片,就坚持声称自己能闻到柑橘味,尽管他身处一个没有任何气味的房间里。AI 过于痴迷于它看到的内容,以至于编造出与图片相匹配的声音。
2. 实验:“声音测验”
为了证明这一点,研究人员构建了一个特殊的测试,就像给这些 AI 侦探出的一道随堂测验。
- 设置:他们选取了 300 段人们进行各种活动(如烹饪或行走)的真实生活视频,并将它们切割成 10 秒的短片。
- 问题:他们向 AI 提出了 1,000 个具体问题。
- A 类(真相):“此刻正在发生什么声音?”(例如:“搅拌机在运转吗?”)
- B 类(陷阱):“嘶嘶声是从哪里传来的?”(当视频中完全没有嘶嘶声时)。
他们想看看 AI 是说“没有嘶嘶声”,还是因为看到了视频中的炉灶就撒谎说:“哦,那大概是燃气灶。”
3. 结果:AI 未能通过陷阱测试
结果相当糟糕。即使是最聪明的 AI 模型(如 Qwen2.5 Omni)在这方面也表现得很差。
- 当询问真实声音时:AI 答对了约 56% 到 63% 的问题。它在描述实际发生的事情方面表现尚可。
- 当询问虚假声音时(陷阱):AI 的准确率急剧下降至 27% 到 39% 之间。
比喻:想象一个学生参加考试。如果你问“天空是什么颜色的?”,他能答对。但如果你问“隐形大象是什么颜色的?”,他会自信地回答“是蓝色的”,因为他是在根据他认为大象应该长什么样来猜测,而不是承认他看不见大象。
AI 本质上是在根据视觉画面“填空”进行猜测,而不是承认“我没听到那个声音”。
4. 两种类型的“虚假听觉”
研究人员将这些错误分为两类:
- “主角”错误(前景):AI 听到了视频中的人应该发出的声音。
- 示例:视频显示有人在使用搅拌机。AI 说:“我听到机械的嗡嗡声。”即使音频损坏或静音,AI 也会因为搅拌机在移动而假设声音存在。
- “背景噪音”错误(背景):AI 听到了环境中并不存在的声音。
- 示例:视频显示一个安静的厨房。AI 说:“我听到窗外有鸟在鸣叫”,仅仅是因为它看到了一扇窗户。
5. 为什么这很重要
该论文得出结论,目前这些 AI 模型是不可靠的聆听者。它们过度依赖眼睛,而对耳朵的依赖不足。
如果你将这项技术用于现实场景(例如帮助机器人理解嘈杂的车间或盲人的周围环境),机器人可能会以为听到了警告警笛,而实际上它只是看到了红灯。研究人员表示,在我们能够信任这些模型通过声音理解世界之前,我们需要建立更好的“听觉核查”系统。
简而言之:该论文表明,当今最智能的视频 AI 就像那些擅长读唇语以至于忘记了听声音的人,他们经常编造出与所见画面相符的声音。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。