Resumo Técnico: Vorch-Streamer
Declaração do Problema
A geração de áudio e vídeo de avatares em tempo real e de longa duração enfrenta dois dilemas primários ao adaptar modelos de difusão bidirecionais pré-treinados para um cenário de streaming:
- Viés de Exposição e Deriva Visual: O streaming de longa duração exige a geração autorregressiva, onde as próprias previsões do modelo servem como contexto para blocos subsequentes. Pequenos erros em aparência, movimento ou sincronização acumulam-se ao longo do tempo, criando um descompasso entre o treinamento (com dados limpos) e o teste (com históricos de inferência autogerados). Isso leva a artefatos cumulativos e deriva temporal, desestabilizando a geração de longo horizonte.
- Descompasso entre Discurso Global e Contexto Causal: Em tarefas de Texto-para-Áudio-Vídeo (T2AV), o prompt de entrada descreve uma fala completa. No entanto, um gerador causal operando em uma janela de streaming pode atender apenas a um histórico local limitado. Sem um planejamento explícito, o modelo tem dificuldade em determinar qual parte do transcrito global deve ser dita a seguir, o que frequentemente resulta em áudio que começa no meio de uma frase, perde o alinhamento temporal ou gera conteúdo de fala incorreto.
Os modelos existentes são tipicamente projetados para clipes curtos e offline com atenção bidirecional, tornando-os incompatíveis com sistemas de streaming que devem gerar o próximo segmento antes que o conteúdo futuro seja observado. Além disso, muitos avatares de streaming existentes dependem de áudio de condução ou quadros de referência fornecidos externamente, falhando em sintetizar fala e vídeo de forma conjunta a partir de texto de maneira verdadeiramente causal.
Metodologia
Vorch-Streamer é um framework de pós-treinamento projetado para estender o modelo de fundação de áudio-vídeo bidirecional LTX2.3 pré-treinado em um gerador de streaming causal, em tempo real e de longa duração. A abordagem consiste em três estáções principais:
1. Construção de Corpus Sintético
Os autores construíram um corpus sintético de 80.000 clipes de áudio-vídeo de alta qualidade de avatares (duração de 12–21 segundos) usando o modelo bidirecional pré-treinado LTX2.3. Isso garante que os dados de treinamento sejam consistentes com a inicialização do modelo, fornecendo supervisão consistente com o modelo para o treinamento causal subsequente.
2. Streaming de Áudio-Vídeo Causal (Estágio 2)
Para converter o modelo bidirecional em um gerador de streaming bloco-autorregressivo, os autores empregam uma estratégia de treinamento misto:
- Mistura de Teacher Forcing e Diffusion Forcing: O modelo é treinado com uma mistura de nível de amostra onde 10% das amostras usam o histórico limpo da verdade fundamental (Teacher Forcing) e 90% usam o histórico corrompido (Diffusion Forcing). Isso reduz o descompasso entre treino e teste ao expor o modelo a contextos imperfeitos e autogerados durante o treinamento.
- Mascaramento de Atenção Causal: O modelo preserva a atenção bidirecional dentro de cada bloco de áudio-vídeo sincronizado (aproximadamente 1 segundo) para modelar interações detalhadas, mas impõe atenção causal entre os blocos.
- Contexto Limitado: Para manter o uso constante de memória, o modelo atende a uma janela limitada composta pelos três primeiros blocos (prefixo persistente) e pelo bloco precedente mais recente.
3. Self Forcing de Longo Horizonte (Estágio 3)
Para abordar o acúmulo de erros em sequências longas, o framework aplica Self Forcing com Distribuição de Correspondência por Destilação (DMD):
- O modelo estudante causal gera sequências completas de 12–21 segundos bloco a bloco a partir de suas próprias previsões.
- Um modelo LTX2.3 bidirecional congelado atua como um professor de "escore real", representando a distribuição alvo.
- Um modelo de "escore falso" treinável estima a distribuição evolutiva do estudante.
- O estudante é otimizado para minimizar a diferença entre sua distribuição e a distribuição do professor, efetivamente transferindo a qualidade do modelo de difusão bidirecional pré-treinado para trajetórias causais longas, enquanto expõe o modelo à sua própria distribuição de rollout em tempo de inferência.
4. Planejamento de Fala Baseado em LLM
Para resolver o descompasso entre prompts de texto globais e a geração causal local, o Vorch-Streamer introduz uma via de planejamento de fala explícita:
- Um LLM externo (Fun-CosyVoice) prevê tokens de planejamento de fala discretos a 25 Hz (unidades de 40 ms).
- Esses tokens são convertidos em características contínuas e injetados no ramo de difusão de áudio através de um módulo de cross-attention dedicado.
- Um operador de fusão de portão (gated fusion) combina adaptativamente essas características de planejamento com as características originais condicionadas ao texto.
- Isso desacopla o planejamento da fala (o que dizer e quando) da geração de áudio (como sintetizá-lo), permitindo interrupção, troca e a inclusão de um token de silêncio aprendível para escuta interativa.
Principais Contribuições
- Framework: Introdução do Vorch-Streamer, um framework de pós-treinamento que adapta um modelo de difusão de áudio-vídeo bidirecional pré-treinado para streaming causal, em tempo real e de longa duração.
- Estratégia de Treinamento: Construção de um corpus sintético de 80K e um novo pipeline de treinamento combinando Mistura de Teacher/Diffusion Forcing com Self Forcing de longo horizonte e destilação de professor para alinhar o treinamento causal com a inferência de streaming.
- Planejamento de Fala: Proposta de uma via de planejamento de fala baseada em LLM que fornece características de planejamento contínuas ao ramo de áudio, permitindo controle explícito sobre a progressão da fala, interrupção e escuta silenciosa sem fixar toda a fala futura no início do stream.
- Desempenho: Demonstração de T2AV de streaming de longa duração em tempo real a 27.12 FPS (excedendo o limite de tempo real de 24 FPS) enquanto mantém sincronização competitiva e precisão de fala.
Resultados Experimentais
Os autores avaliaram o Vorch-Streamer em rollouts contínuos de longa duração (aprox. 2 minutos) contra baselines nativos de T2AV (LTX2.3, JoyAI-Echo, OmniForcing, Hallo-Live) e referências de TIA2V condicionais (LiveAvatar, SoulX-FlashTalk).
- Velocidade: O Vorch-Streamer atinge 27.12 FPS em uma única GPU NVIDIA H200, sendo o único método nativo de T2AV avaliado que excede a reprodução em tempo real. É significativamente mais rápido que o LTX2.3 bidirecional (1.83 FPS) e outros baselines de streaming.
- Precisão de Fala: O modelo atinge uma Taxa de Erro de Palavras (WER) de 7.92%, comparável ao LTX2.3 bidirecional offline (7.59%). Em contraste, baselines sem planejamento de fala explícito (OmniForcing, Hallo-Live) sofrem WERs catastróficos (>90%) quando extrapolados para longas durações.
- Sincronização: O modelo mantém uma forte sincronização áudio-lábio (Sync-C: 6.62, Sync-D: 8.95), comparável ao muito mais lento LTX2.3.
- Estabilidade de Longo Horizonte: Durante um rollout de dois minutos, o Vorch-Streamer exibe degradação mínima na preservação de identidade (a similaridade ArcFace permanece estável em torno de 0.73–0.77) e consistência de cena (similaridade CLIP em torno de 0.92–0.94). Outros métodos de T2AV nativos mostram deriva significativa e perda de identidade ao longo de durações semelhantes.
- Estudos de Ablação:
- Remover o planejador de fala LLM resulta em um WER de 184%, confirmando a necessidade de planejamento explícito para T2AV causal.
- Remover o Estágio 2 (inicialização causal) leva ao colapso de movimento (o Grau de Dinamismo cai de 0.2706 para 0.0824).
- Remover o Estágio 3 (self forcing de longo horizonte) resulta em maior WER (9.17%) e aumento da deriva.
- Uma janela de contexto de 3+1 (3 blocos de prefixo persistente + 1 bloco recente) mostrou-se ideal para equilibrar a preservação de identidade e o acúmulo de erro.
Significância
O artigo afirma que o Vorch-Streamer estabelece uma rota prática para adaptar poderosos modelos de fundação bidirecionais para a geração de avatares interativos e em tempo real. Ao resolver o problema do viés de exposição através de self forcing de longo horizonte e o problema da progressão da fala através de planejamento explícito baseado em LLM, o framework permite a geração de Áudio-Vídeo nativa a partir de texto que é simultaneamente causal e de longa duração. Diferente de pipelines condicionais que dependem de áudio externo ou quadros de referência, o Vorch-Streamer gera ambas as modalidades do zero, mantendo estabilidade e sincronização ao longo de períodos estendidos sem exigir crescimento de memória proporcional ao comprimento da sequência.