← Últimos artigos
💻 computer science

LongCat-Video-Avatar 1.5 Technical Report

LongCat-Video-Avatar 1.5 é um framework de código aberto aprimorado que prioriza a prontidão para produção e a engenharia sistemática para entregar geração de vídeos longos de nível comercial, estável e com consistência de identidade, com inferência acelerada, superando os principais sistemas de código fechado em diversos cenários.

Autores originais: Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

Publicado 2026-05-27
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Meituan LongCat Team, Xunliang Cai, Meng Cheng, Feng Gao, Zhe Kong, Jiamu Li, Le Li, Weiheng Li, Hongyu Liu, Shuai Tan, Xiaoming Wei, Tianyu Yang, Yong Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você deseja criar um personagem digital que possa falar, cantar e atuar exatamente como um ser humano real, mas você só tem uma foto deles e uma gravação de áudio da voz deles. Por muito tempo, fazer esses personagens parecerem "reais" por mais de alguns segundos tem sido como tentar equilibrar uma casa de cartas em uma tempestade: eles podem parecer bons por um momento, mas então seus rostos apresentam falhas, seus lábios não correspondem às palavras, ou seus corpos começam a se mover de forma estranha.

O artigo LongCat-Video-Avatar 1.5 da Equipe Meituan LongCat é um relatório técnico sobre uma nova "receita" de código aberto para construir esses personagens digitais. Em vez de inventar um tipo totalmente novo de magia, eles focaram em aperfeiçoar a engenharia para tornar o resultado estável o suficiente para uso no mundo real (como filmes, notícias ou atendimento ao cliente).

Veja como eles fizeram isso, explicado com analogias simples:

1. A Atualização do "Ouvido": Whisper Large

Na versão antiga, o modelo usava um "ouvido" padrão (um codificador de áudio chamado Wav2Vec2) para ouvir a voz. Era aceitável, mas às vezes perdia as nuances sutis da fala.

  • A Atualização: Eles substituíram isso pelo Whisper Large, um sistema de áudio muito mais poderoso.
  • A Analogia: Pense no ouvido antigo como alguém ouvindo uma música em um quarto barulhento com plugues nos ouvidos. O novo Whisper Large é como colocar fones de ouvido com cancelamento de ruído de alta qualidade em um estúdio silencioso. Ele ouve cada detalhe minúsculo da voz, o que permite que os lábios do personagem se movam com precisão perfeita, correspondendo exatamente ao som, mesmo em vídeos longos.

2. A "Academia" para Dados: Curadoria do Conjunto de Treinamento

Você não pode ensinar um ator digital apenas mostrando vídeos aleatórios a ele. Se você mostrar um vídeo com um rosto desfocado, uma pessoa segurando um cartaz ou duas pessoas falando ao mesmo tempo, o modelo fica confuso.

  • A Correção: Eles construíram uma rigorosa "academia de dados". Eles não apenas despejaram milhares de vídeos no sistema. Eles os organizaram como um bibliotecário organizando uma biblioteca:
    • Dados Silenciosos: Eles ensinaram ao modelo o que fazer quando ninguém está falando (por exemplo, piscar, respirar, olhar ao redor) para que o personagem não congele ou pareça estranho quando o áudio parar.
    • Dados de Emoção: Eles alimentaram especificamente o modelo com vídeos de pessoas mostrando diferentes sentimentos (rindo, chorando, reagindo) para que o personagem não pareça apenas um robô lendo um roteiro.
    • Dados Multi-pessoas: Eles ensinaram ao modelo como lidar com uma cena com duas pessoas falando. Eles usaram um truque especial (dando aos personagens de fundo uma trilha de áudio "silenciosa") para que apenas a pessoa que deveria falar realmente movesse a boca, enquanto os outros permaneciam imóveis.

3. O "Treinador" (RLHF): Aprendizado com Feedback Humano

Mesmo com bons dados, o modelo ainda pode cometer pequenos erros, como uma mão parecendo levemente torcida ou um rosto se movendo de forma não natural.

  • O Método: Eles usaram uma técnica chamada Otimização de Política Relativa em Grupo (GRPO).
  • A Analogia: Imagine um instrutor de dança observando um aluno. Em vez de apenas dizer "Bom trabalho" ou "Mau trabalho", o instrutor compara a dança do aluno com a de um grupo de outros dançarinos e diz: "O movimento do seu braço é 10% melhor que a média, mas a sua pisada é 5% pior". O modelo aprende com essas comparações para ajustar finamente seus movimentos quadro a quadro, garantindo que as mãos pareçam reais e o corpo se mova naturalmente.

4. O "Modo Turbo": Tornando-o Rápido

Geralmente, a geração de vídeo de alta qualidade é lenta. É como assar um bolo onde você precisa verificar o forno a cada 5 minutos por uma hora.

  • A Inovação: Eles usaram uma técnica chamada Destilação para comprimir o processo.
  • A Analogia: Eles ensinaram o modelo a assar o bolo em 8 passos em vez dos usuais 50. É como treinar um corredor para correr toda a prova em 8 passadas gigantes em vez de 50 passos pequenos e lentos. O resultado é um vídeo que parece tão bom quanto, mas é gerado muito mais rápido, tornando-o prático para uso em tempo real.

5. Os Resultados: Como Ele Compara?

A equipe testou seu novo modelo contra os melhores sistemas "caixa-fechada" (secretos, pagos) atualmente no mercado, como HeyGen e Kling Avatar.

  • O Veredito: Em um teste cego com mais de 500 cenários diferentes (incluindo cabeças falantes, canto, estilos de anime e até animais), o LongCat-Video-Avatar 1.5 foi frequentemente avaliado como melhor ou igual a esses sistemas comerciais caros.
  • Principais Vitórias:
    • Sincronia Labial: Os movimentos da boca correspondiam perfeitamente ao áudio.
    • Estabilidade: O personagem não piscava ou mudava de rosto durante vídeos longos.
    • Identidade: O personagem parecia a mesma pessoa do início ao fim.
    • Complexidade: Lidou com situações complicadas, como uma pessoa segurando um violão ou duas pessoas falando, sem que os personagens de fundo movessem os lábios acidentalmente.

Resumo

O LongCat-Video-Avatar 1.5 é essencialmente um kit de ferramentas "pronto para produção". Ele pega a natureza bagunçada e experimental da geração de vídeo por IA e a poliu com ouvidos melhores (Whisper), dados de treinamento melhores (Silencioso/Emoção/Multi-pessoas), um treinador rigoroso (RLHF) e um impulso de velocidade (Destilação). O objetivo não foi apenas criar uma demonstração legal, mas construir um sistema que funcione de forma confiável o suficiente para ser usado em negócios reais, e eles provaram que funciona tão bem quanto (ou melhor que) as principais ferramentas pagas disponíveis hoje.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →