← Últimos artigos
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

Este artigo apresenta o DyMoS, um método livre de treinamento e agnóstico ao modelo que aprimora a dinâmica de movimento na geração de vídeo a partir de imagens ao reequilibrar a dominância do quadro de referência no mecanismo de atenção, superando assim a supressão de movimento sem comprometer a fidelidade visual ou exigir treinamento adicional.

Autores originais: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

Publicado 2026-05-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Problema: O Vídeo "Congelado"

Imagine que você tem uma foto de um cavalo e pede a um computador para transformá-la em um vídeo do cavalo correndo. Você esperaria que o cavalo galopasse. Mas, frequentemente, os modelos de IA atuais são "muito educados" com a foto original. Eles mantêm o cavalo congelado no lugar, talvez apenas mexendo levemente as orelhas, porque têm tanto medo de alterar a imagem que você lhes deu.

O artigo chama isso de "Viés de Movimento Estático". A IA está tão focada em manter o primeiro quadro (a imagem de referência) perfeito que esquece de fazer o resto do vídeo se mover.

A Descoberta: O Estudante "Excessivamente Atento"

Os pesquisadores olharam para dentro de como esses modelos de IA funcionam. Eles descobriram um comportamento específico que chamam de "Dominância do Quadro de Referência".

Pense no modelo de IA como um aluno fazendo uma prova.

  • O Prompt de Texto é a pergunta: "Faça o cavalo correr."
  • A Imagem de Referência é uma foto do cavalo sobre a mesa.

Em um modelo normal de Texto para Vídeo, o aluno olha para a pergunta e imagina o cavalo correndo.
Em um modelo de Imagem para Vídeo, o aluno está olhando demais para a foto na mesa. Toda vez que o aluno tenta desenhar o próximo quadro do vídeo, ele olha para a foto e diz: "Ok, eu preciso fazer este próximo quadro parecer exatamente como a foto."

Como o aluno está tão obcecado em copiar a foto, ele nunca realmente desenha o cavalo se movendo. A "foto" está dominando a "imaginação".

A Solução: DyMoS (O "Controle de Movimento")

Os pesquisadores criaram uma ferramenta chamada DyMoS (Deslizante de Movimento Dinâmico). Ela não exige o re-treinamento da IA nem a alteração da foto original. Em vez disso, age como um botão de volume para a obsessão do aluno.

Como funciona:

  1. A Intervenção: Durante os primeiros momentos da criação do vídeo (os passos de "remoção de ruído"), o DyMoS dá um leve tapinha no ombro do aluno. Ele diz: "Ei, pare de olhar tão fixamente para a foto de referência. Você precisa imaginar o movimento agora."
  2. O Mecanismo: Tecnicamente, ele ajusta um número específico (um "viés") no sistema de atenção da IA. Ele reduz ligeiramente a pontuação que a IA atribui aos tokens da imagem de referência quando está tentando decidir como o próximo quadro deve parecer.
  3. O Resultado: A IA ainda pode ver a foto (então o cavalo ainda parece o cavalo), mas não é mais forçada a copiá-la perfeitamente. Isso libera a IA para deixar o cavalo correr, o carro dirigir ou a água salpicar.

O Recurso do "Deslizante"

A parte mais legal do DyMoS é que ele é um deslizante, não apenas um interruptor liga/desliga. O usuário tem um número que pode ajustar:

  • Gire para baixo (números negativos): A IA torna-se mais obcecada pela foto. O vídeo torna-se ainda mais estático (útil se você quiser uma imagem estática que mal se move).
  • Gire para cima (números positivos): A IA recebe a ordem de ignorar mais a natureza "congelada" da foto. O vídeo torna-se muito dinâmico e energético.
  • Meio-termo: Você pode encontrar o equilíbrio perfeito onde o vídeo se move naturalmente, mas o personagem ainda parece exatamente com a foto com a qual você começou.

Por Que É Melhor Que Métodos Anteriores

As tentativas anteriores de corrigir esse problema de "vídeo congelado" eram como tentar consertar um carro quebrando o motor ou pintando por cima das rodas.

  • Alguns métodos exigiam o re-treinamento de toda a IA (caro e lento).
  • Outros tentavam desfocar ou estragar a imagem de entrada para forçar o movimento, o que frequentemente fazia o vídeo parecer feio ou distorcido.

O DyMoS é diferente porque:

  1. É Livre de Treinamento: Você não precisa ensinar nada novo à IA. Você apenas usa a ferramenta enquanto a IA trabalha.
  2. É Agnóstico ao Modelo: Funciona em quase qualquer IA de vídeo moderna (como Wan 2.2, HunyuanVideo, CogVideoX).
  3. Mantém a Qualidade: Faz o vídeo se mover sem deixar a imagem parecendo desfocada ou estranha.

Resumo

O artigo identifica que os modelos de Imagem para Vídeo são "muito educados" com suas imagens de entrada, causando vídeos chatos e estáticos. Eles corrigiram isso com o DyMoS, uma ferramenta simples que age como um botão de volume, reduzindo a obsessão da IA pela foto inicial o suficiente para permitir que o movimento aconteça, tudo isso sem alterar o modelo ou a imagem original.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →