← 最新论文
🤖 AI

DoubleHelix: Structured Cross-Modal Fusion for Audio-Visual Speech Recognition with LLMs

本文介绍了 DoubleHelix,这是一个结构化多模态融合框架,它将音视频语音识别重新表述为一个具有自适应退化感知增强的迭代跨模态交互过程,在 LRS3 数据集上实现了最先进的性能并提升了鲁棒性。

原作者: Ziwei Cheng, Zhenhua Tan, Zhuomin Zhu

发布于 2026-08-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Ziwei Cheng, Zhenhua Tan, Zhuomin Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图在嘈杂混乱的派对上听懂一位朋友对你说的话。你拥有两种超能力:你的耳朵用来听词句,你的眼睛用来观察他们的嘴唇动作。通常情况下,你的大脑会对这两种感官进行一次快速的、单次的融合,以弄清对方说了什么。如果音乐声太大,你的大脑可能会仅仅调低耳朵的音量并更多地依赖视觉,或者仅仅根据它最后听到的内容进行猜测。但如果你的大脑能做得更聪明呢?如果它能进行第二次观察,意识到音频变得模糊,利用嘴唇的动作在脑海中“修复”声音,然后再次检查这种修复是否合理呢?这就是**音视频语音识别(AVSR)**的核心理念——这是一个计算机科学领域,机器通过结合声音和视频来学习“阅读”语音。早期的计算机就像那些只是瞥一眼就进行猜测的人,而现在的挑战在于,如何让它们变得像人类一样具有适应性,能够实时地倾听、观察并自我纠正,尤其是在环境嘈ę时。

由此,DoubleHelix 应运而生,这是一个旨在实现这一目标的全新计算机框架。研究人员并没有简单地将声音和视频混合一次,而是构建了一个将理解语音视为两种感官之间“对话”的系统。他们将这种方法称为“DoubleHelix”(双螺旋),因为就像 DNA 的两条螺旋链一样,音频和视觉信息相互缠绕、交织,经过多轮迭代来不断精炼和提升彼此。该系统构建在强大的 AI 模型(特别是擅长理解语言的大语言模型,即 LLMs)之上,但它在中间增加了一个特殊的“融合”层。这个层级不仅仅是把数据堆砌在一起;它会主动检查声音是否变得破碎。如果声音质量变差,一个被称为 QualitySensor(质量传感器)的组件就会充当“损管员”,识别出问题所在。随后,一支被称为 HelixReplication(螺旋复制)的“维修队”会利用说话者清晰的唇部视频,来“重建”缺失或损坏的部分音频。

论文指出,这种“迭代式”方法——即系统通过反复回溯来修正错误——是一个游戏规则的改变者。在利用包含数千小时 TED 演讲语音的 LRS3 数据集进行测试时,DoubleHelix 系统在清晰音频下的词错率(WER)达到了 0.68%。在使用相同底层技术的情况下,这比之前的最优方法(MMS-LLaMA)相对提升了 5.6%。但真正的魔力发生在环境变得糟糕的时候。当研究人员加入重度背景噪声(模拟信噪比为 -5dB 的拥挤房间)时,新系统成功将错误率控制在了 11.6%。这比原本表现挣扎于 17.0% 的旧版 LLaMA-AVSR 系统实现了 31.8% 的巨大提升。作者发现,该系统之所以表现出色,是因为它不仅忽略坏掉的声音,而是利用视觉线索主动修复它,并通过多次交互而非单次静态计算来实现这一点。通过将过程分解为这些结构化的、重复的步骤,DoubleHelix 表明,语音识别的未来不仅仅在于拥有更大的“大脑”,还在于教会这些大脑如何将倾听、观察与自我纠正有机地结合在一起。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →