← 最新论文
🤖 machine learning

HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models

HybridCodec 通过将时间压缩的离散标记与降维的连续残差相结合,解决了语音语言模型中离散音频表示的信息丢失问题,从而在减少自回归推理步骤的同时,提高了说话人特征的保留能力。

原作者: Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

发布于 2026-06-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Artem Ploujnikov, Francesco Verdini, Samir Sadok, Mirco Ravanelli

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过一个非常缓慢的网络连接向朋友发送一部高清电影。

旧方法(仅限离散化):
为了让视频符合传输要求,你必须对其进行大幅压缩。你将电影变成了一系列简单的、块状的图标(类似于表情符号),用来代表场景的大致意思。你的朋友的电脑可以轻松理解其中的“故事”(情节),但细节却丢失了。演员的面部看起来像像素化的色块,背景音乐听起来像单调的嘀嗒声,而叙述者独特的嗓音也消失了。这就是目前的 AI 语音模型所做的:它们将声音转化为一系列“离散标记”(就像句子中的单词)。这种方式很高效,但丢失了声音的“灵魂”。

新方法(HybridCodec):
这篇论文的作者们想出了一个聪明的窍门,在不减慢网速的情况下解决这个问题。他们意识到,虽然“故事”(文字)可以用简单的图标来表达,但“风味”(声音、情感、音高)则需要额外的帮助。

以下是他们的系统是如何运作的,我们使用一个简单的类比:

1. 双轨系统

想象一列运载两种货物的火车:

  • 轨道 A(离散标记): 这是主火车。它移动速度快,承载着语音的“骨架”——即文字和基本的节奏。它就像是一条总结场景的短信。
  • 轨道 B(连续残差): 这是一个在火车旁快速飞行的微型无人机。它并不承载整个故事;它只携带火车遗漏的细节。它持有精细的信息:说话者独特的音色、细微的呼吸以及情感基调。

2. 它是如何工作的(“草图与精修”法)

当 AI 需要生成语音时,它不会试图从一开始就完美地画出整幅画。相反,它使用了一个两步走的过程

  • 第 1 步:粗略草图(自回归): AI 使用离散标记快速生成“骨架”。这就像艺术家快速勾勒出一张脸的轮廓。这个部分既快速又高效。
  • 第 2 步:瞬间润色(非自回归): AI 并不是要一个接一个地画出每一根头发(那会耗费太长时间),而是利用“无人机”(连续残差)在一次性完成的任务中瞬间填补所有缺失的细节。这就像是拿着那张粗略的草图,瞬间应用了一个高质量滤镜,为它添加皮肤纹理、眼睛颜色和光影效果。

3. 为什么这很重要

论文声称这种方法解决了主要问题:权衡(Trade-off)

  • 旧模型必须在“速度快(低细节)”或“准确度高(慢、高细节)”之间做出选择。
  • HybridCodec 兼得了两者的优点。因为“无人机”(残差)通过仅需一步的操作就完成了繁重的细节添加工作,所以系统不需要通过成千上万个缓慢的步骤来构建声音。

实验结果:
研究人员在 LibriTTS 数据集上对该系统进行了测试。他们发现:

  • 语音质量: 声音听起来更加自然、更像真人,尤其是在系统以极低速度(如 6.25 Hz)运行时。旧方法在这些速度下听起来会有机器人感或失真,但新方法保留了说话者独特的身份特征。
  • 速度: 它显著减少了计算机生成语音所需的步骤。
  • 理解能力: 当用于语音识别(将语音转回文本)时,额外的细节有助于计算机更好地理解词汇,即使在嘈杂的环境下也是如此。

总结

可以将 HybridCodec 理解为一种在低带宽连接下发送高清视频的方法。你不是只发送一张模糊、块状的图像,而是发送一个清晰的图像轮廓,再加上一个“魔法数据包”,瞬间恢复色彩、纹理和精细细节。其结果是,即便在生成速度很快的情况下,也能获得清晰、高质量的声音,且不会丢失说话者独特的个性。

论文得出结论,这种“混合”方法使 AI 处理语音的方式能像处理文本一样自然,弥合了高效数据压缩与丰富、类人化声音之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →