← Últimos artigos
💻 computer science

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Este artigo apresenta o Animation2Code, um benchmark composto por 1.069 pares de vídeo-animação e métricas inéditas alinhadas ao ser humano para avaliar e revelar as limitações dos atuais modelos de visão-linguagem na reconstrução de animações web executáveis com dinâmicas temporais precisas.

Autores originais: Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

Publicado 2026-06-30
📖 4 min de leitura☕ Leitura rápida

Autores originais: Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um projetor de filmes mágico. Você alimenta o projetor com um vídeo de uma bola quicando, um logotipo girando ou uma mão acenando. Qual é o seu objetivo? Pedir a um computador superinteligente para escrever o código de computador exato (a "receita") que recriaria esse vídeo do zero.

É sobre isso que trata o artigo "Animation2Code". É um novo teste para ver se os modelos de IA mais avançados de hoje conseguem olhar para um vídeo em movimento e escrever as instruções para fazer aquele movimento acontecer novamente.

Aqui está uma divisão simples das descobertas deles, usando algumas analogias do cotidiano:

1. O Desafio: Estático vs. Dinâmico

Pense nos modelos de IA atuais como fotógrafos. Eles são incríveis em olhar para uma única foto de uma página da web ou de um gráfico e escrever o código para desenhá-la perfeitamente. Se você mostrar a eles a foto de um quadrado azul, eles podem escrever o código para desenhar um quadrado azul.

Mas este artigo pergunta: Eles conseguem ser coreógrafos?
Eles conseguem assistir a um vídeo de um quadrado que gira, encolhe e depois fica vermelho, e escrever o código que faz o quadrado realizar exatamente essa sequência de movimentos? Isso exige compreender o tempo e o movimento, não apenas um único instantâneo.

2. O Teste: "Animation2Code"

Os pesquisadores construíram um "exame" gigante chamado Animation2Code.

  • O Guia de Estudos: Eles coletaram 1.069 vídeos curtos de animações web (como bolas quicando, ícones de carregamento giratórios e bandeiras acenando) junto com o código real que os criou.
  • O Exame: Eles mostraram esses vídeos para os principais modelos de IA (como Gemini, GPT-4, Claude, etc.) e perguntaram: "Escreva o código para fazer este vídeo".
  • A Nota: Eles não apenas verificaram se o código funcionava. Eles usaram duas "réguas" especiais para avaliar os resultados:
    • A Régua do Visual (Aparência): O vídeo gerado se parece com o original? (A bola é azul? É redonda?)
    • A Régua do Movimento (Temporal): O vídeo gerado se move como o original? (A bola quica na velocidade certa? Ela gira na direção certa?)

3. A Grande Descoberta: "Bom em Desenhar, Ruim em Dançar"

Os resultados foram surpreendentes e um pouco engraçados.

  • A IA é uma Ótima Artista: Os modelos foram fantásticos no "Visual-Régua". Eles conseguiram escrever o código que gerou um vídeo quase idêntico ao original. As cores, formas e estilos estavam certeiros.
  • A IA é uma Dançarina Desajeitada: No entanto, quando se tratava da "Movimento-Régua", os modelos tiveram muita dificuldade. Mesmo quando o vídeo parecia perfeito, o movimento era frequentemente errado.
    • Analogia: Imagine uma IA tentando recriar um vídeo de uma pessoa fazendo um mortal para trás. A IA escreve o código para desenhar um corpo humano perfeito nas roupas certas. Mas, no vídeo, a pessoa fica parada, ou cai, ou gira para o lado errado. O "figurino" é perfeito, mas a "dança" está quebrada.

4. Por que Isso Importa

O artigo descobriu que, mesmo quando a IA recebia mais quadros de vídeo (mais "pistas" sobre o movimento) ou recebia treinamento extra para corrigir seus erros, ela ainda não conseguia entender o tempo e a física do movimento.

  • O Abismo: Existe um enorme abismo entre ver um movimento e compreender a lógica desse movimento bem o suficiente para escrever o código para ele.
  • O Limite: Os modelos parecem estar adivinhando a "vibe" do movimento em vez de calcular a trajetória real. Eles podem imitar o visual de uma onda, mas não conseguem escrever o código para fazer a água realmente fluir.

5. A Conclusão

Os pesquisadores criaram este benchmark para provar que, embora a IA esteja ficando ótima em tarefas estáticas (como desenhar uma página da web a partir de uma foto), ela ainda é muito ruim em raciocínio temporal (entender como as coisas se movem ao longo do tempo) quando solicitada a gerar código.

Eles não estão dizendo que a IA é inútil; estão dizendo que é como um aluno que memorizou as definições de dicionário de "pular" e "girar", mas nunca aprendeu de fato a fazer um mortal para trás físico. O código que eles escrevem parece correto no papel, mas quando você o executa, a animação não se move como deveria.

Em resumo: A IA atual consegue desenhar uma foto perfeita de um robô dançando, mas não consegue escrever o código para fazer o robô realmente dançar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →