WnW: Waxing-and-Waning KV Cache for Long-Form Speech LLMs
本文介绍了 WnW,一种动态 KV 缓存管理策略,该策略将注意力头划分为锚点(anchor)、潮汐(tidal)和固定(fixed)角色,通过仅在 GPU 上保留 20% 的音频标记,并利用选择性的 CPU-GPU 召回机制,实现高效的长文本语音处理并保持接近全缓存的准确度。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
现代计算机在“听”方面已变得异常出色。它们可以将数小时的原始声音——会议、讲座、长篇对话,甚至是整本有声读物——转化为书面文本或翻译成其他语言。这种能力依赖于强大的人工智能模型,这些模型通过将音频分解为被称为“标记”(tokens)的微小且快速的快照来处理音频。在聆听的过程中,这些模型会构建起对已听到内容的临时记忆,存储最重要的细节,以帮助理解对话的上下文。这种记忆至关重要;如果没有它,模型在到达句子末尾时就会忘记句首的内容。然而,随着音频变长,这种记忆需求会迅速增长,最终变得如此庞大,以至于会撑爆计算机的可用空间,导致系统崩溃或产生乱码。
核心问题在于,这些模型决定记住什么的方式会随着对话的进行而发生变化。当模型第一次听到一段长录音时,它往往会过度关注开头,假设开头包含了最关键的线索。但随着模型开始说话或翻译,它的注意力会发生转移。它开始观察音频的不同部分,有时甚至远离开头,以理解当前的时刻。旧的方法试图通过在最开始做一个永久性的决定来解决记忆问题:它们会查看音频开头,挑选出它们认为重要的部分,然后永远丢弃其余部分。这种方法对于短片段效果尚可,但对于长录音来说,这是一种经常失败的赌博。模型丢弃了它稍后会需要的关键信息,从而导致错误或完全无法完成任务。
一个研究小组开发了一种名为 WnW(意为“消长”,Waxing-and-Waning)的新方法,该方法不将记忆视为静态列表,而是将其视为一种动态流。WnW 不会在模型开始说话之前就对保留内容做出最终决定,而是允许系统在运行过程中改变主意。研究人员发现,模型大脑中的并非所有部分对于记忆音频都同等重要。有些部分与声音本身紧密相连,对准确性至关重要,而另一些部分则不太敏感。通过精细的校准过程,他们将模型的内部组件分成了三组。第一组被称为“锚点”(anchor)头,它们保持完全活跃状态并充当向导,不断观察音频以确定当前哪些部分是重要的。第二组被称为“潮汐”(tidal)头,它们在主芯片上保留部分记忆,而将剩余部分存储在较慢的二级存储驱动器上。随着模型说话,锚点头会发出信号,指示当前哪些音频部分具有相关性,系统随后会迅速从二级驱动器中提取这些特定的数据块,并用它们替换掉不再需要的块。第三组是“固定”(fixed)头,它们仅保留音频的一小部分永久切片,并丢弃其余部分,因为这些部分不需要完整的信息图景即可运作。
这种策略被证明是长篇音频领域的游戏规则改变者。在对持续数分钟的录音进行测试时,这种新方法使模型能够在标准计算机硬件上流畅运行,在任何给定时间内仅保留约 20% 的音频数据在快速的主内存中。尽管进行了如此大幅度的削减,模型的准确性仍与保留了每一件数据的系统几乎完全一致。相比之下,那些在开始时做出永久决定的旧方法在相同条件下完全失败,通常无法完成转录任务。研究人员还在不同语言(如法语)和不同任务(如将英语语音翻译成法语)上测试了该系统,其表现同样出色。该系统能够处理医疗咨询和各种口音,而无需针对每种新情况进行重新训练。
这种方法的成功在于其灵活性。通过将“保留什么”的决定推迟到需要的那一刻,系统避免了在开始阶段就猜错的陷阱。“潮汐”头就像潮汐一样,随之涨落,在需要时引入正确的信息,并在信息不再有用时将其释放。这种移动发生得极快,几乎不会给过程增加延迟,使其在实际应用中具有可行性。研究结果表明,如果机器要真正理解长篇对话,必须允许它们进行动态的记忆与遗忘,而不是被迫在故事还没开始前就做出永久的选择。这种从静态快照到流动记忆的转变,可能是解锁日常设备上可靠长篇语音识别的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。