技术摘要:Vorch-Streamer
问题陈述
在将预训练的双向扩散模型适配到流式设置时,实时、长时程的数字人音视频生成面临两个主要的困境:
- 曝光偏差与视觉漂移(Exposure Bias and Visual Visual Drift): 长时程流式生成需要自回归生成,即模型的预测结果将作为后续数据块的上下文。外观、动作或同步方面的微小误差会随时间累积,导致训练与测试之间存在不匹配——即干净的训练数据与自生成的推理历史之间的不匹配。这会导致复合伪影和时间漂移,从而使长程生成变得不稳定。
- 全局语音与因果上下文的不匹配(Global Speech vs. Causal Context Mismatch): 在文本生成音频-视频(T2AV)任务中,输入提示词描述的是一个完整的表达。然而,一个运行在流式窗口中的因果生成器只能关注有限的局部历史。如果没有显式的规划,模型在确定下一段话应该说哪部分内容时会感到困难,这通常导致音频在句子中间开始、失去时间对齐,或者生成错误的语音内容。
现有的模型通常设计用于短时的离线片段并采用双向注意力机制,这使得它们与必须在观察到未来内容之前生成下一段内容的流式系统不兼容。此外,许多现有的流式数字人依赖于外部提供的驱动音频或参考帧,无法实现真正从文本出发、以因果方式联合合成语音和视频。
方法论
Vorch-Streamer 是一个后训练框架,旨在将预训练的双向 LTX2.3 音视频基础模型扩展为因果、实时、长时程的流式生成器。该方法由三个主要阶段组成:
1. 合成语料库构建
作者使用预训练的双向 LTX2.3 模型构建了一个包含 80,000 个高质量数字人音视频片段(时长 12–21 秒)的合成语料库。这确保了训练数据与模型的初始化保持一致,为后续的因果训练提供了一致的模型监督。
2. 因果音视频流式生成(第二阶段)
为了将双向模型转换为块自回归流式生成器,作者采用了混合训练策略:
- 混合教师强制与扩散强制(Mixed Teacher Forcing and Diffusion Forcing): 模型采用样本级混合训练,其中 10% 的样本使用干净的地面真值历史(教师强制),90% 的样本使用受损的历史(扩散强制)。这通过在训练期间让模型接触不完美的自生成上下文,减少了训练与测试之间的差异。
- 因果注意力掩码(Causal Attention Masking): 模型在每个同步的音视频块(约 1 秒)内部保留双向注意力以建模细粒度的交互,但在块与块之间强制执行因果注意力。
- 有界上下文(Bounded Context): 为了保持恒定的内存占用,模型关注一个由前三个块(持久前缀)和最近的一个前置块组成的有界窗口。
3. 长程自我强制(第三阶段)
为了解决长序列中误差累积的问题,该框架应用了带有分布匹配蒸馏(DMD)的自我强制(Self Forcing):
- 因果学生模型通过其自身的预测,逐块生成完整的 12–21 秒序列。
- 一个冻结的双向 LTX2.3 模型充当“真实得分(real-score)”教师,代表目标分布。
- 一个可训练的“伪得分(fake-score)”模型用于估计学生模型不断演变的分布。
- 学生模型通过最小化其分布与教师分布之间的差异进行优化,从而有效地将预训练双向模型的质量转移到长程因果轨迹中,同时让模型接触到其推理时的展开分布。
4. 基于 LLM 的语音规划
为了解决全局文本提示与局部因果生成之间的不匹配,Vorch-Streamer 引入了一个显式的语音规划路径:
- 一个外部大语言模型(Fun-CosyVoice)以 25 Hz(40 ms 单位)预测离散的语音规划标记(tokens)。
- 这些标记被转换为连续特征,并通过专门的交叉注意力模块注入到音频扩散分支中。
- 一个门控融合算子将这些规划特征与原始的文本调节音频特征进行自适应组合。
- 这将语音规划(说什么以及何时说)与音频生成(如何合成它)解耦,从而允许中断、切换以及包含可学习的静音标记以进行交互式聆听。
核心贡献
- 框架: 提出了 Vorch-Streamer,这是一个后训练框架,能够将预训练的双向音视频扩散模型适配为因果、实时的长时程流式生成器。
- 训练策略: 构建了 80K 合成语料库,并提出了一种结合混合教师/扩散强制、长程自我强制以及教师蒸馏的新型训练流水线,以使因果训练与流式推理保持一致。
- 语音规划: 提出了基于 LLM 的语音规划路径,为音频分支提供连续的规划特征,实现了对语音进度、中断和静默聆听的显式控制,而无需在流开始时固定整个未来的表达。
- 性能: 展示了在 27.12 FPS 下实现实时、长时程 T2AV 流式生成的性能(超过了 24 FPS 的实时阈值),同时保持了极具竞争力的同步性和语音准确度。
实验结果
作者在连续长时程展开(约 2 分钟)中评估了 Vorch-Streamer,并将其与原生 T2AV 基准模型(LTX2.3, JoyAI-Echo, OmniForcing, Hallo-Live)以及条件 TIA2V 参考模型(LiveAvatar, SoulX-FlashTalk)进行了对比。
- 速度: Vorch-Streamer 在单张 NVIDIA H200 GPU 上达到了 27.12 FPS,是唯一一个超过实时播放速度的被评估的原生 T2AV 方法。它显著快于双向 LTX2.3(1.83 FPS)和其他流式基准模型。
- 语音准确度: 该模型实现了 7.92% 的字错率(WER),与离线双向 LTX2.3(7.59%)相当。相比之下,没有显式语音规划的基准模型(OmniForcing, Hallo-Live)在推演至长时长时会出现灾难性的 WER(>90%)。
- 同步性: 该模型保持了强大的音画同步能力(Sync-C: 6.62, Sync-D: 8.95),与速度慢得多的双向 LTX2.3 相当。
- 长程稳定性: 在两分钟的展开过程中,Vorch-Streamer 在身份保持(ArcFace 相似度稳定在 0.73–0.77 左右)和场景一致性(CLIP 相似度在 0.92–0.94 左右)方面表现出极小的退化。其他原生 T2AV 方法在类似时长内表现出明显的漂移和身份丢失。
- 消融实验:
- 去除 LLM 语音规划器会导致 WER 达到 184%,证实了显式规划对于因果 T2AV 的必要性。
- 去除第二阶段(因果初始化)会导致运动塌陷(动态程度从 0.2706 降至 0.0824)。
- 去除第三阶段(长程自我强制)会导致更高的 WER(9.17%)和增加的漂移。
- 3+1 的上下文窗口(3 个持久前缀块 + 1 个最近块)被证明是平衡身份保持与误差累积的最优选择。
意义
本文声称 Vorch-Streamer 为将强大的双向基础模型适配为实时、交互式数字人生成提供了一条切实可行的路径。通过利用长程自我强制解决曝光偏差问题,并通过显式 LLM 规划解决语音进度问题,该框架实现了原生的文本生成音视频(T2AV)生成,且具备因果性和长时程特性。与依赖外部音频或参考帧的条件流水线不同,Vorch-Streamer 从头开始生成两种模态,在长时间运行下仍能保持稳定性和同步性,且不需要随序列长度增长而增加内存消耗。