← 最新论文
⚡ electrical engineering

HoliTok:A Coutinuous Holistic Tokenization with Robust Dual Capabilities of Speech Generation and Understanding

本文介绍了 HoliTok,这是一种连续整体语音标记化模型,它将高保真音频编码为紧凑的可学习潜在表示,使统一的自回归加扩散变换器架构能够在无需额外优化的情况下稳健地执行高质量语音生成与识别。

原作者: Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Bohan Li, Shi Lian, Hankun Wang, Yiwei Guo, Yu Xi, Zhihan Li, Da Zheng, Colin Zhang, Kai Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于HoliTok论文的解读,已用通俗易懂的语言并辅以生动的类比进行翻译。

核心难题:“翻译官”的困境

想象一下,你正在试图制造一个超级聪明的机器人,它既能懂人类说话(理解),又能答人类(生成)。为此,机器人需要一种通用语言,将声波翻译成它能思考的形式,然后再将这些思考翻译回声波。

目前,现有的“翻译官”(语音分词器)就像蹩脚的翻译:

  • “高保真”翻译官:这一类非常擅长逐字逐句、原声原调地复述你说的话,但极不擅长理解其中的含义或进行推理。它就像一只鹦鹉,模仿得惟妙惟肖,却完全不知道自己在说什么。
  • “语义”翻译官:这一类能完美理解含义和情感,但当它试图开口说话时,声音听起来却像机器人一样,充满故障或失真。它就像一位天才哲学家,却无法正确发音。

由于这种差距,工程师们通常不得不构建两个独立的系统,或者使用复杂且混乱的变通方法,才能让机器人同时出色地完成这两项任务。

解决方案:HoliTok(“完美双语者”)

作者提出了HoliTok,这是一种新型语音分词器,旨在成为“完美双语”翻译官。它创造了一个连续且整体的空间,让声音和含义在此和谐共存。

你可以把 HoliTok 想象成一个高效的语音压缩应用。它不像保存巨大的原始音频文件(AI 难以处理)那样,也不像把语音拆解成微小、僵硬的乐高积木(会丢失细微差别)那样,而是将你的声音转化为流畅、连续的“思维点”流。

  • 输入:它每秒接收 48,000 个声音样本(非常详细)。
  • 输出:它将此压缩为每秒仅 25 个“思维点”,每个点都是一个丰富的 128 维数字。
  • 魔力:这些点易于 AI 学习(就像给汽车铺了一条平滑的道路),同时仍能解码回高质量、类人的语音。

构建过程:三步训练食谱

你不能指望机器人一次性学会所有事情,否则它会感到困惑。作者分三个阶段循序渐进地训练了 HoliTok,就像训练一名运动员:

  1. 第一阶段:“完美模仿者”(重构)
    首先,他们教导模型成为一个完美的回声。它的唯一任务就是听声音并原封不动地复述出来。这确保了“思维点”包含了所有必要的声学细节(音高、音色、清晰度),以免日后声音听起来像机器人。

  2. 第二阶段:“流畅操作者”(变分正则化)
    接下来,他们教导模型将这些点组织成平滑、可预测的模式。想象一下将一堆杂乱的沙子抚平,使其像水一样流动。这使得 AI 更容易预测序列中的下一个点,这对于生成新语音至关重要。

  3. 第三阶段:“学者”(下游丰富化)
    最后,他们教导模型理解它听到的内容。他们利用其他智能 AI 模型将知识“蒸馏”进 HoliTok。现在,“思维点”不仅包含声音,还包含关于情感、说话者身份和语言含义的信息。这使得这些点既适用于语音理解,也适用于语音生成。

测试:“统一”架构

为了证明 HoliTok 有效,作者构建了一个单一的机器人大脑(使用AR+DiT架构),该大脑利用 HoliTok 同时处理两项任务:

  • :机器人读取“思维点”并回答问题或转录文本。
  • :机器人将文本转化为“思维点”,然后将其解码为语音。

结果:

  • 质量:HoliTok 生成的语音质量与现有最佳方法一样好(高保真)。
  • 控制:它能很好地生成带有特定情感或风格的语音。
  • “统一”的胜利:这是关键所在。当他们尝试在这个单一的“统一”机器人大脑中使用其他方法时,机器人表现挣扎。它要么说话糟糕,要么理解糟糕。HoliTok 是唯一能够稳健地同时处理这两项任务而无需额外技巧的方法。

一句话总结

HoliTok 是一种将人类语音转换为数字格式的新方法,它足够小以便 AI 轻松处理,足够丰富以理解含义和情感,且足够清晰以高质量地回话。它弥合了“听”与“说”之间的鸿沟,使得单个 AI 模型能够有效地同时完成这两项工作,而无需依赖复杂的多部分系统。

注:论文明确指出,虽然 HoliTok 是为音频设计的,但其当前实验严格专注于语音(人声)。他们尚未在音乐或环境声音上测试它,并警告这种强大的语音生成工具必须负责任地使用,以防止诸如声音冒充等滥用行为。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →