这篇技术报告介绍了一个名为 Covo-Audio 的 AI 模型。为了让你轻松理解,我们可以把它想象成一位**“全能型超级对话伙伴”**。
1. 它是什么?(核心概念)
想象一下,以前的语音助手(比如早期的 Siri 或智能音箱)像是一个**“传声筒团队”**:
- 你说话 -> 第一个员工(听写员)把你说的话变成文字。
- 文字交给第二个员工(大脑)思考并写出回答。
- 回答交给第三个员工(播音员)读出来。
- 缺点:环节多,容易出错,反应慢,而且那个“播音员”的声音往往很机械,缺乏感情。
Covo-Audio 则完全不同。它是一个**“单兵作战的超级特工”**。
- 它直接听你的声音,直接思考,然后直接开口说话。
- 它不需要把声音先转成文字再转回去,而是像人类一样,直接通过“声音”来理解和表达。
- 它的个头很小(只有 70 亿参数,相当于一个中等身材的成年人),但能力却非常惊人,能媲美那些体型巨大的“巨人”模型。
2. 它有什么超能力?(主要亮点)
🎧 超能力一:真正的“耳听心受” (端到端处理)
以前的模型像是在“读稿子”,而 Covo-Audio 像是在“聊天”。它能直接处理连续的音频流。
- 比喻:就像你和一个真人聊天,对方能直接听懂你的语气、语速和停顿,而不是先把你说的话记在纸上,再照着纸念。这让它的反应更快,交流更自然。
🗣️ 超能力二:既能“听”又能“说”的“双工模式” (全双工交互)
这是它最酷的地方。大多数语音助手是“半双工”的,就像对讲机:你按着说话,它才能听;它说完,你才能说。如果你打断它,它通常会卡住或乱套。
- Covo-Audio 的突破:它像真人面对面聊天。你可以随时打断它(比如“等等,我插一句”),它也能在你说话时发出“嗯嗯”、“对”这样的反馈(Backchanneling),甚至能同时处理“听”和“说”的任务。
- 比喻:它不再是那个只会等你说完话的“复读机”,而是一个能和你“抢话”、能接话茬、能灵活应对插嘴的活生生的人。
🧠 超能力三:聪明又走心 (情感与逻辑)
很多 AI 要么很聪明但声音像机器人,要么声音好听但脑子笨。
- Covo-Audio 做到了**“智商”与“情商”的平衡**。它不仅能做复杂的数学题、推理逻辑(像学霸),还能听懂你的情绪。如果你难过,它会用温柔的声音安慰你;如果你生气,它能感知到并调整语气。
- 比喻:它就像是一个**“博学的心理咨询师”**,既有深厚的知识储备,又懂得察言观色,说话暖人心。
🎭 超能力四:声音的“换装魔法” (智能与声音解耦)
这是他们解决的一个大难题。通常,要让 AI 用某个特定的人(比如你的声音)说话,需要收集那个人大量的对话录音,成本极高。
- Covo-Audio 的妙招:他们发明了一种**“解耦”技术**。
- 把“大脑”(对话逻辑)和“嗓子”(声音音色)分开训练。
- 比喻:想象你有一个**“万能大脑”,它学会了所有对话技巧。然后,你可以给这个大脑配上一个“假发套”(不同的声音音色)。你只需要给这个“假发套”一点点录音数据,就能让“万能大脑”用这个声音说话,而且完全不会变笨**。这让定制个性化声音变得非常便宜和快速。
3. 它是怎么练成的?(训练过程)
- 海量阅读与听力:它先像小学生一样,听了 800 万小时的音频,读了海量的书籍,建立了声音和文字之间的深层联系(预训练)。
- 情景模拟:然后,它进入了“角色扮演”阶段。
- 有人教它怎么像普通人一样聊天(口语化)。
- 有人教它怎么识别情绪(共情训练)。
- 有人专门训练它怎么应对插嘴和打断(全双工训练)。
- 特殊技巧:为了让它既聪明声音又好听,他们用了“解耦”策略,把“学知识”和“练嗓子”分开进行,最后再完美融合。
4. 总结:为什么这很重要?
Covo-Audio 证明了,不需要巨大的模型,也能拥有顶级的语音交互能力。
- 它让 AI 对话不再冷冰冰,而是充满了人情味。
- 它让打断、插话、即时反馈成为可能,让对话像真人一样流畅。
- 它让个性化声音定制变得简单便宜,未来你可能只需要几分钟的录音,就能让 AI 用你喜欢的声音(甚至是已故亲人的声音,当然这需要伦理规范)来陪你聊天。
一句话总结:
Covo-Audio 是一个个头不大、反应极快、能听能插话、既聪明又暖心的 AI 聊天伙伴,它让机器与人类的语音交流,终于从“听写机器”进化到了“灵魂伴侣”的初级阶段。
以下是基于腾讯 Covo-Audio 技术报告的详细中文技术总结:
Covo-Audio 技术报告总结
1. 研究背景与问题 (Problem)
当前的语音交互系统主要面临以下挑战:
- 级联架构的局限性:传统系统通常采用“自动语音识别 (ASR) + 大语言模型 (LLM) + 文本转语音 (TTS)"的级联架构。这种模式存在信息丢失、误差传播等问题,难以实现低延迟和自然的情感交互。
- 端到端模型的权衡:虽然端到端大音频语言模型 (LALMs) 能直接处理音频输入并生成音频输出,但现有模型往往在“智能推理能力”与“语音自然度/交互效率”之间难以兼顾。
- 部分模型(如 Thinker-Talker 架构)为了保留文本智能,牺牲了端到端的语音指令跟随能力和直接对话控制力。
- 智能与声源的耦合问题:在端到端场景中,构建高自然度的对话机器人通常需要大量高质量的对话数据来训练特定声源,成本高昂且难以灵活定制声音(即“智能”与“说话人”强耦合)。
- 全双工交互的复杂性:实现像人类一样同时听和说(全双工)、处理打断(Barge-in)和话轮转换(Turn-taking)在端到端模型中极具挑战性。
2. 方法论 (Methodology)
Covo-Audio 是一个参数量为 7B 的端到端大音频语言模型,采用单一统一架构直接处理连续音频输入并生成音频输出。
核心架构设计:
- 编码器:使用预训练的 Whisper-large-v3 作为音频编码器,输出 50Hz 的连续音频特征。
- 适配器 (Adapter):通过三个下采样模块将音频帧率从 50Hz 降至 6.25Hz,以适配 LLM。
- LLM 骨干:基于 Qwen2.5-7B-Base,扩展词汇表以包含离散音频 Token。
- 分词器与解码器:
- 基于 WavLM-large 开发专用语音分词器,将音频量化为 25Hz 的离散 Token。
- 采用两阶段分层解码框架:先通过 Flow-Matching 将离散 Token 转换为连续潜在表示,再通过 BigVGAN 重建成 24K 波形。
- 输入输出模式:支持交错序列(Interleaved),即连续音频特征、文本 Token 和离散音频 Token 混合输入/输出。
训练策略:
- 两阶段预训练 (Pre-training):
- 阶段一(模态桥接):冻结 LLM 和编码器,仅优化适配器,利用 20 万小时多语言 ASR 数据实现语音到文本的语义对齐。
- 阶段二(模态融合):联合优化适配器和 LLM。引入分层三模态语音 - 文本交错策略 (Hierarchical Tri-modal Speech-Text Interleaving),将连续音频特征 (ac)、离散音频 Token (ad) 和文本 (t) 在统一序列中进行短语级和句子级的交错训练,实现深度语义与声学对齐。
- 后训练 (Post-training):
- 涵盖通用智能、口语对话、语音理解、语音生成和音频理解等多任务指令微调。
- 情感与同理心:构建包含七种情绪类别的数据集,训练模型生成具有同理心的响应。
- 智能 - 声源解耦技术 (Intelligence-Speaker Decoupling):
- 为了解决高质量对话数据稀缺和声音定制成本高的问题,提出将“对话智能”与“说话人特征”解耦。
- 利用多说话人训练,并将高质量 TTS 数据重构为伪对话数据(Masked Text Loss),在保留推理能力的同时,仅用少量 TTS 数据即可实现高保真、个性化的声音定制。
- 全双工交互 (Full-Duplex):
- 将全双工能力直接纳入预训练阶段。
- 采用混合双流机制(连续音频输入流 + 离散音频输出流),通过流式编码和特定的 Token(如
THINK, SHIFT, BREAK)管理听/说状态,支持实时打断、话轮转换和旁白(Backchanneling)。
3. 关键贡献 (Key Contributions)
- 分层三模态交错框架:创新性地提出了连续特征、离散 Token 和文本的三模态融合及分层交错策略,在保持宏观语义连贯性的同时,捕捉微观声学细节。
- 智能 - 声源解耦技术:提出了一种新颖的解耦策略,使得模型能够利用通用的 TTS 数据快速定制声音,同时保持高水平的对话智能,显著降低了端到端对话系统的部署成本。
- 原生全双工语音交互:通过大规模预训练而非多阶段微调,实现了低延迟、流畅的全双工对话能力,支持自然的打断和话轮管理。
- 7B 规模下的 SOTA 性能:证明了 7B 参数量的模型通过精心设计的架构和训练策略,可以在语音理解、推理和交互能力上媲美甚至超越更大规模的模型。
4. 实验结果 (Results)
Covo-Audio 在多个基准测试中展现了卓越性能:
- 语音 - 文本建模:在 A2A-tSC(语音续写)、sBLIMP(语法完整性)等任务上,性能优于同规模开源模型(如 GLM-4-Voice-Base, Moshi 等),证明了其强大的语义推理能力。
- 口语对话 (Covo-Audio-Chat):
- URO-Bench:在中英文任务中,特别是在推理(Reasoning)和口语对话(Oral Conversation)方面表现优异,多项指标超越 Qwen3-Omni 等先进模型。
- VCB Bench:在指令跟随、多轮对话和鲁棒性(抗噪、抗口音)方面达到 SOTA。
- 同理心 (VStyle):在中文情感识别和响应生成上达到 SOTA,能有效识别细微情感线索。
- 全双工交互 (Covo-Audio-Chat-FD):
- 在 URO-Bench 上保持了与半双工模型相当的对话能力。
- 在全双工行为指标上大幅领先:话轮转换成功率 99.7%,停顿处理 97.6%,打断处理 96.81%,旁白处理 93.89%。
- 语音与音频理解:
- ASR/TTS:在 Librispeech 等数据集上表现具有竞争力。
- MMAU & MMSU:在音频理解基准测试中,Covo-Audio 在 7B 模型中表现最佳,尤其在音乐理解和感知任务上显著优于其他模型(MMSU 平均分 66.64%,超越所有对比模型)。
- 解耦技术验证:Covo-Audio-Chat-TTS 版本在仅使用 TTS 数据的情况下,保持了与原版相当的对话智能,验证了该技术的有效性。
5. 意义与展望 (Significance)
- 技术突破:Covo-Audio 展示了 7B 规模模型如何通过架构优化和多阶段训练,实现高保真语音交互与高级语义推理的完美统一,打破了“大参数=高性能”的单一依赖。
- 应用价值:提出的“智能 - 声源解耦”策略为构建低成本、高自然度、可个性化定制的语音助手提供了可行的技术路径,解决了端到端模型落地难的问题。
- 开源贡献:腾讯开源了 Covo-Audio-Chat 模型及推理流程,推动了大音频语言模型领域的社区发展。
- 未来方向:研究团队计划进一步探索模型扩展(Scaling-up),以挖掘 Covo-Audio 在更复杂场景下的潜力。
总结:Covo-Audio 是一个在端到端架构下,成功平衡了智能推理、语音自然度和交互效率的 7B 大模型,其提出的解耦策略和全双工训练方法为下一代语音交互系统的发展奠定了重要基础。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。