← Últimos artigos
🤖 machine learning

MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation

O MilliVid aborda o desafio da consistência de longo alcance na geração de vídeos ao empregar um autoencoder hierárquico para comprimir quadros em tokens de múltiplas escalas e utilizar uma estratégia de rollout de grosso para fino dentro de um modelo de difusão de vídeo, preservando assim a geometria global e a permanência de objetos enquanto reduz os custos computacionais.

Autores originais: Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann

Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando contar uma história muito longa para um amigo, mas tem apenas um pequeno bloco de notas. Se você tentar anotar cada detalhe de cada cena — cada folha em uma árvore, cada rachadura na calçada, cada textura em uma parede — você ficará sem espaço após apenas algumas frases. Quando chegar ao fim da história, você terá esquecido completamente o início.

Este é exatamente o problema que os modelos de IA de vídeo enfrentam hoje. Eles querem gerar vídeos longos e coerentes, mas seus "blocos de notas" (memória do computador) são pequenos demais para conter todos os detalhes de uma sequência longa. Como resultado, eles começam a alucinar, esquecendo para onde os objetos foram ou mudando o layout do ambiente conforme o vídeo avança.

O artigo MILLIVID propõe uma solução inteligente: Pare de tentar lembrar de tudo de uma vez. Em vez disso, lembre-se do panorama geral primeiro e preencha os pequenos detalhes depois.

Aqui está como eles fizeram isso, usando algumas analogias do cotidiano:

1. O Sistema de Memória de "Bonecas Russas"

A maioria dos modelos de IA de vídeo tenta armazenar cada quadro em resolução total. O MILLIVID muda o jogo ao usar um tokenizador hierárquico. Pense nisso como um conjunto de bonecas russas ou um mapa com diferentes níveis de zoom:

  • O Nível Coarse (O Panorama Geral): Esta é a menor boneca ou o mapa no nível de zoom mais baixo. Ela não mostra a textura da grama ou a cor dos tijolos. Ela apenas lembra o formato da sala, onde as paredes estão e onde os principais objetos se localizam. Por ser tão simples, a IA pode lembrar centenas desses quadros de "panorama geral" de uma só vez.
  • O Nível Fine (Os Detalhes): Esta é a maior boneca ou o mapa no zoom máximo. Ela adiciona a textura da grama, os padrões dos tijolos e a iluminação. Mas, por ser tão detalhada, a IA só consegue lembrar de alguns desses quadros antes que sua memória acabe.

A Analogia: Imagine que você está descrevendo uma cidade para um amigo.

  • Jeito Antigo: Você tenta descrever cada janela de cada prédio durante toda a viagem. Você fica cansado e esquece o layout da cidade após 10 minutos.
  • Jeito MILLIVID: Primeiro, você descreve o layout da cidade (onde o parque está, por onde o rio corre) para toda a hora. Depois, conforme você se aproxima de um edifício específico, você adiciona os detalhes (a cor da porta, as flores na janela). Você mantém o "panorama geral" em sua mente o tempo todo para nunca se perder.

2. O "Rollout" Coarse-to-Fine

O artigo introduz uma nova forma de gerar o vídeo chamada coarse-to-fine rollout (desdobramento do grosseiro para o refinado).

Em vez de gerar o vídeo quadro a quadro com detalhes totais (o que faz a IA esquecer o passado), o modelo trabalha em etapas:

  1. Estágio 1: Ele gera uma sequência longa de quadros "embaçados" ou de baixo detalhe. Como são simples, a IA consegue acompanhar mais de 100 quadros de uma vez. Isso garante que a história permaneça consistente (o carro permanece na estrada, o prédio não desaparece).
  2. Estágio 2: Ele volta e "afia" os quadros recentes, adicionando os detalhes em alta definição.
  3. O Truque de Mágica: Crucialmente, quando ele adiciona os detalhes aos quadros recentes, ele olha para as versões de baixo detalhe dos quadros distantes para garantir que a história ainda faça sentido.

A Analogia: Pense nisso como esboçar uma pintura.

  • Primeiro, você faz um desenho rápido de contorno de palitinhos de toda a cena para acertar as poses e posições. Você consegue desenhar toda a cena dessa forma sem errar.
  • Depois, você volta e adiciona os músculos, as roupas e as expressões faciais das pessoas em primeiro plano.
  • Você não tenta pintar os músculos da pessoa ao fundo antes de saber onde ela está parada, ou poderá pintá-los no lugar errado.

3. O "Teste Minecraft"

Para provar que isso funciona, os pesquisadores não usaram apenas filmes bonitos. Eles usaram Minecraft.

  • Por quê? Minecraft é um mundo 3D onde você caminha ao redor. Se a IA esquecer o layout, você pode atravessar uma parede ou ver uma árvore desaparecer e reaparecer em outro lugar.
  • O Resultado: Eles testaram seu método contra os melhores modelos atuais (como o FramePack). Os modelos antigos geravam um vídeo onde o jogador caminhava por um tempo e, de repente, o mundo "bugava" — prédios se deslocavam ou o caminho voltava para si mesmo incorretamente.
  • O Desempenho do MILLIVID: Como ele manteve o mapa "coarse" (grosseiro/geral) do mundo em sua memória o tempo todo, ele conseguiu gerar vídeos longos onde o jogador caminhava centenas de passos, virava e via exatamente os mesmos prédios que passou anteriormente, de forma perfeitamente consistente.

A Conclusão

O artigo afirma que, ao aceitar que não podemos lembrar de cada detalhe minúsculo do passado distante, podemos lembrar muito melhor da estrutura do passado.

  • Abordagem Antiga: "Eu vou lembrar de cada detalhe dos últimos 5 segundos perfeitamente, mas esquecerei tudo o que aconteceu há 10 segundos."
  • Abordagem MILLIVID: "Eu vou lembrar da forma geral e da localização de tudo o que aconteceu há 10 segundos, e só lembrarei dos detalhes minúsculos dos últimos 5 segundos."

Essa troca permite que a IA gere vídeos que permanecem coerentes por muito mais tempo, mantendo a "história" do vídeo consistente sem a necessidade de supercomputadores que custam milhões de dólares. Os autores testaram isso especificamente em jogabilidade de Minecraft e descobriram que produzia resultados significativamente mais consistentes do que os métodos existentes.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →