← 最新论文
💬 NLP

UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception

通过引入用于结构化监督的语义-声学原语(Semantic-Acoustic Primitives)以及用于恢复声学细节的语义-声学平衡门控机制(Semantic-Acoustic Equilibrium gating mechanism),UniAudio-Token 通过增强语义语音分词器的通用音频感知能力,从而实现了一个在理解和生成任务上均优于现有单码本基准模型的统一音频接口。

原作者: Yuhan Song, Linhao Zhang, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuhan Song, Linhao Zhang, Aiwei Liu, Chuhan Wu, Sijun Zhang, Wei Jia, Yuan Liu, Houfeng Wang, Xiao Zhou

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个超级聪明的机器人(人工智能)如何理解并运用声音的世界。为了做到这一点,机器人需要一本“字典”,将声波翻译成它能阅读的文字。这本字典被称为分词器(tokenizer)

长期以来,这些字典都有一个重大问题:它们就像是只懂“人类语言”的专业翻译员。它们非常擅长理解人类说了什么,但如果你播放一段狗吠、海浪拍岸或警笛鸣响的声音,它们就会变得“耳聋”。它们会试图将这些声音强行套入语音模式,从而导致理解错误或完全忽略细节。这就是论文中所说的**“声学盲视”(acoustic blindness)**。

另一方面,还有一些旨在“听见一切”的字典(就像高保真麦克风一样),但它们却很难理解文字背后的含义。它们能听出声音的精确音高,却无法告诉你这个人是在开心还是难过,或者他们到底在说什么。

UniAudio-Token 是一个解决这一问题的新型全能字典。作者们(来自北京大学和腾讯)构建了一个系统,它充当了所有声音(不仅是人类语言)的通用翻译器

他们是通过两个主要的“超能力”来实现这一目标的:

1. “三层三明治”(语义-声学原语)

想象一下你在向朋友描述电影场景。

  • 旧方法: 你只说:“一个男人正在走。”(这是语言部分)。你忽略了他是在雨中行走、穿着红外套以及神情忧郁的事实。
  • UniAudio-Token 的方法: 他们发明了一种描述声音的新方式,称为语义-声学原语(Semantic-Acoustic Primitives, SAP)。它就像一个三层三明治:
    • 第一层(剧本): 在说什么?(文字内容)。
    • 第二层(演员): 是怎么说的?(声音是低沉的吗?说话的人是在愤怒吗?是一个孩子还是长辈?)。
    • 第三层(舞台): 周围发生了什么?(是在下雨吗?有汽车引擎的轰鸣声吗?还是有门砰然关闭的声音?)。

通过迫使 AI 同时学习这三个层面,它就不再忽略那些“噪音”(如雨声或音乐),而是将其视为重要的信息。

2. “智能混合器”(语义-声学均衡)

即使有了优秀的描述,技术上仍存在一个问题。随着 AI 在大脑中处理声音的深度增加,它往往会丢弃“精细细节”(如声音的质感或房间的回声)以专注于主要含义。这就像是过快地总结一本书,结果把优美的环境描写都弄丢了。

为了解决这个问题,他们构建了一个智能混合器(称为 SAE)。

  • 把 AI 想象成一条工厂装配线。早期的工位看到的是原始、详细的声音(“浅层”层级)。后期的工位看到的是宏观的意义(“深层”层级)。
  • 通常情况下,深层层级会忘记早期层级所看到的内容。
  • 智能混合器是一个观察内容的“守门人”。如果 AI 正在聆听复杂的歌曲或嘈闹的街道,门就会开得很大,让详细的“原始声音”重新进入,并与“宏观意义”进行混合。如果 AI 正在聆听清晰的语音,门就会稍微关闭,以专注于文字内容。
  • 这种过程是自动且即时的,确保 AI 在理解含义的同时,永远不会丢失声音的“韵味”。

结果:一把瑞士军刀

论文表明,这个新系统是音频领域的“瑞士军刀”:

  • 它能听见一切: 在对狗吠、雨落或直升机飞行等声音进行测试时,它能完美地对它们进行分类。旧系统会将这些声音混淆或忽略。
  • 它能完美表达: 尽管它要聆听所有这些非语言类声音,但它并没有在理解人类语言方面变差。事实上,它在生成人类语音方面表现得更出色,因为它学会了保留那些让语音听起来真实的微小细节(如口音和呼吸声)。
  • 它助力“大脑”: 当他们将这个分词器接入大型语言模型(“大脑”)时,那个大脑在回答有关音乐、音效和语音的问题时变得更加聪明,性能超越了之前所有的单一字典系统。

简而言之: UniAudio-Token 是一个全新的工具,它教会 AI 去聆听整个声音世界——包括文字、声音以及背景噪音——同时不会丧失理解或清晰表达的能力。它弥合了“听觉”与“理解”之间的鸿沟。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →