← Últimos artigos
💻 computer science

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

O artigo apresenta o minWM, um framework de código aberto de ponta a ponta que transforma modelos fundacionais de vídeo bidirecionais existentes em modelos de mundo autoregressivos, em tempo real, controláveis por câmera e de poucos passos, por meio de um pipeline abrangente de ajuste fino, treinamento com forçamento causal e destilação.

Autores originais: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um diretor de cinema brilhante e de alto nível (um Modelo de Fundação de Vídeo) capaz de criar filmes deslumbrantes e de alta qualidade com base em um roteiro. No entanto, esse diretor trabalha muito devagar: ele planeja todo o filme cena por cena antes de mostrar a você um único quadro. Se você quiser mudar o ângulo da câmera no meio do caminho, ele precisa parar, replanejar todo o filme e começar do zero. Isso é ótimo para fazer um filme polido, mas terrível para um videogame ou um chat ao vivo, onde você precisa de reações instantâneas.

minWM é um novo "campo de treinamento" e "kit de ferramentas" projetado para transformar esse diretor lento e perfeccionista em um diretor interativo em tempo real que pode reagir instantaneamente aos seus comandos, sem perder sua qualidade artística.

Veja como o minWM funciona, dividido em etapas simples:

1. O Problema: O "Diretor Lento"

Os modelos atuais de IA de vídeo são como o diretor lento. Eles são incríveis na criação de vídeos bonitos, mas são bidirecionais. Isso significa que eles olham para o início, o meio e o fim de um vídeo tudo de uma vez para garantir que tudo se encaixe perfeitamente.

  • O Problema: Se você quiser mover a câmera ou mudar a cena em tempo real, esse modelo não consegue fazer isso rapidamente. Leva muito tempo para "pensar" em todo o vídeo antes de mostrar a você o primeiro quadro.

2. A Solução: O "Campo de Treinamento" minWM

O minWM é um framework de ponta a ponta (um conjunto completo de ferramentas) que pega um diretor lento existente e o treina para se tornar um performer rápido e interativo. Ele faz isso em duas fases principais:

Fase 1: Aprendendo a Mover a Câmera (A Lição de "Controle de Câmera")

Primeiro, o framework ensina ao diretor lento como seguir instruções específicas de câmera.

  • A Analogia: Imagine ensinar o diretor a segurar uma câmera em um gimbal. Em vez de apenas adivinhar onde a câmera deve estar, ele aprende a seguir um caminho preciso que você desenha para ele.
  • Como: A equipe usa uma técnica especial chamada PRoPE. Pense nisso como dar ao diretor um par de "óculos inteligentes" que entendem exatamente onde a câmera está no espaço 3D. Eles praticam em vídeos onde o movimento da câmera é perfeitamente conhecido (como uma animação 3D), para que o diretor aprenda a relação exata entre "mover para a esquerda" e "a visão desloca para a esquerda".

Fase 2: Acelerando o Processo (A Lição de "Destilação")

Agora que o diretor consegue seguir movimentos de câmera, ele ainda é muito lento. Ele ainda planeja todo o filme antes de mostrar um quadro. O minWM usa uma técnica chamada Forçamento Causal para acelerá-lo.

  • A Analogia: Imagine um aluno (o novo modelo rápido) sentado ao lado de um mestre professor (o modelo lento e de alta qualidade).
    1. Forçamento do Professor: O aluno aprende a escrever a história uma frase de cada vez (quadro por quadro) em vez de planejar todo o livro de uma vez. Isso o torna mais rápido.
    2. A "Cola" (Destilação): Para tornar o aluno ainda mais rápido, ele é treinado para pular etapas. Em vez de levar 50 pequenos passos para desenhar uma imagem, ele aprende a fazê-lo em apenas 4 traços grandes e confiantes.
    3. A Rede de Segurança (DMD Assimétrica): Há o risco de que, ao acelerar, o aluno comece a desenhar imagens bagunçadas. Para corrigir isso, o aluno verifica ocasionalmente seu trabalho contra o mestre professor original. Se o desenho rápido do aluno parecer um pouco fora do lugar, o professor o corrige gentilmente, garantindo que o resultado final ainda seja de alta qualidade.

3. Os Resultados: De "Cinema" para "Videogame"

O artigo mostra que esse processo funciona incrivelmente bem:

  • Velocidade: Os novos modelos são mais de 200 vezes mais rápidos ao mostrar o primeiro quadro do que os modelos lentos originais.
    • Antes: Você espera mais de 10 segundos para ver o primeiro quadro.
    • Depois: Você vê o primeiro quadro em cerca de 1 segundo.
  • Controle: Os modelos rápidos ainda podem seguir seus comandos de câmera perfeitamente. Você pode dizer ao vídeo para "panorâmica para a esquerda" ou "zoom in", e isso acontece instantaneamente.
  • Flexibilidade: A equipe testou isso em dois tipos diferentes de "diretores" (os modelos Wan2.1 e HY1.5) e funcionou para ambos, provando que o método é um kit de ferramentas universal, não apenas uma correção única.

4. Lições Importantes Aprendidas (Os "Estudos de Ablação")

O artigo também compartilha algumas dicas práticas que descobriram enquanto construíam isso, que são como "regras práticas" para qualquer pessoa tentando fazer isso:

  • Dados Bons são a Chave: Você não pode simplesmente ensinar o diretor com movimentos de câmera borrados e estimados. Você precisa de dados de "verdade fundamental" — vídeos onde o caminho da câmera é matematicamente perfeito (como reconstruções 3D). Se você usar dados bagunçados, o diretor fica confuso.
  • A Prática Leva à Perfeição: O diretor precisa treinar por um tempo (cerca de 8.000 passos) antes de realmente entender como mover a câmera. Se você parar muito cedo, ele não ouvirá seus comandos.
  • Não Economize no Tamanho da Turma: Você precisa de um número decente de exemplos (um "tamanho de lote") para o diretor aprender. Se a turma for muito pequena (menos de 4 exemplos), eles falham em aprender os movimentos da câmera.

Resumo

minWM é uma receita de código aberto que pega uma IA de vídeo lenta e de alta qualidade e a transforma em um motor de vídeo interativo em tempo real. Ele ensina à IA a seguir comandos de câmera e depois acelera para que ela possa gerar vídeo enquanto você assiste, tornando possível construir mundos de vídeo interativos (como videogames ou simulações ao vivo) que eram anteriormente impossíveis com IA de vídeo padrão.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →