← Últimos artículos
💻 computer science

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Este artículo presenta Animation2Code, un referente que comprende 1.069 pares de video-animación y métricas novedosas alineadas con el ser humano para evaluar y revelar las limitaciones de los modelos actuales de visión y lenguaje en la reconstrucción de animaciones web ejecutables con una dinámica temporal precisa.

Autores originales: Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

Publicado 2026-06-30
📖 4 min de lectura☕ Lectura para el café

Autores originales: Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un proyector de cine mágico. Le introduces un vídeo de una pelota rebotando, un logotipo girando o una mano saludando. ¿Tu objetivo? Pedirle a una computadora súper inteligente que escriba el código exacto (la "receta") que recrearía ese vídeo desde cero.

De esto trata el artículo "Animation2Code". Es una nueva prueba para ver si los modelos de IA más avanzados de hoy pueden mirar un vídeo y escribir las instrucciones para que ese movimiento vuelva a suceder.

Aquí tienes un desglose sencillo de sus hallazgos, utilizando algunas analogías cotidianas:

1. El desafío: Estático vs. Dinámico

Piensa en los modelos de IA actuales como fotógrafos. Son increíbles mirando una sola foto de una página web o un gráfico y escribiendo el código para dibujarlo perfectamente. Si les muestras la imagen de un cuadrado azul, pueden escribir el código para dibujar un cuadrado azul.

Pero este artículo pregunta: ¿Pueden ser coreógrafos?
¿Pueden ver un vídeo de un cuadrado que gira, se encoge y luego se vuelve rojo, y escribir el código que haga que el cuadrado realice exactamente esa secuencia de movimientos? Eso requiere comprender el tiempo y el movimiento, no solo una instantánea única.

2. La prueba: "Animation2Code"

Los investigadores construyeron un "examen" gigante llamado Animation2Code.

  • La guía de estudio: Recopilaron 1,069 vídeos de animaciones web cortos (como pelotas rebotando, indicadores de carga giratorios y banderas ondeando) junto con el código real que los creó.
  • El examen: Mostraron estos vídeos a los mejores modelos de IA (como Gemini, GPT-4, Claude, etc.) y les pidieron: "Escribe el código para hacer este vídeo".
  • La calificación: No se limitaron a comprobar si el código funcionaba. Utilizaron dos "reglas" especiales para calificar los resultados:
    • La regla de la apariencia (Aspecto): ¿El vídeo generado se parece al original? (¿Es la pelota azul? ¿Es redonda?)
    • La regla del movimiento (Temporal): ¿El vídeo generado se mueve como el original? (¿Rebota a la velocidad correcta? ¿Gira en la dirección correcta?)

3. El gran descubrimiento: "Bueno dibujando, malo bailando"

Los resultados fueron sorprendentes y un poco divertidos.

  • La IA es una gran artista: Los modelos fueron fantásticos con la "Regla de la apariencia". Podían escribir código que creaba un vídeo que se veía casi idéntico al original. Los colores, las formas y los estilos eran muy precisos.
  • La IA es una bailarina torpe: Sin embargo, cuando se trataba de la "Regla del movimiento", los modelos tuvieron muchas dificultades. Incluso cuando el vídeo se veía perfecto, el movimiento solía ser incorrecto.
    • Analogía: Imagina a una IA intentando recrear un vídeo de una persona haciendo una voltereta hacia atrás. La IA escribe el código para dibujar un cuerpo humano perfecto con la ropa adecuada. Pero en el vídeo, la persona simplemente se queda allí parada, o se cae, o gira en la dirección equivocada. El "disfraz" es perfecto, pero el "baile" está roto.

4. Por qué esto es importante

El artículo encontró que incluso cuando se le daban a la IA más fotogramas de vídeo (más "pistas" sobre el movimiento) o se le daba entrenamiento adicional para corregir sus errores, seguía sin poder comprender la sincronización y la física del movimiento.

  • La brecha: Existe una gran brecha entre ver un movimiento y comprender la lógica de ese movimiento lo suficiente como para escribir código para él.
  • El límite: Los modelos parecen estar adivinando la "vibra" del movimiento en lugar de calcular la trayectoria real. Pueden imitar el aspecto de una ola, pero no pueden escribir el código para que el agua fluya realmente.

5. La conclusión

Los investigadores crearon este referente para demostrar que, si bien la IA se está volviendo excelente en tareas estáticas (como dibujar una página web a partir de una foto), todavía es muy mala en el razonamiento temporal (comprender cómo se mueven las cosas a través del tiempo) cuando se le pide generar código.

No están diciendo que la IA sea inútil; están diciendo que es como un estudiante que se memorizó las definiciones de libro de texto de "saltar" y "girar", pero que nunca ha aprendido realmente cómo hacer una voltereta hacia atrás física. El código que escriben se ve bien en el papel, pero cuando lo ejecutas, la animación no se mueve como debería.

En resumen: La IA actual puede dibujar una imagen perfecta de un robot bailando, pero no puede escribir el código para que el robot realmente baile.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →