← Últimos artículos
💻 computer science

Do vision models perceive illusory motion in static images like humans?

El estudio revela que la mayoría de los modelos de flujo óptico actuales no perciben el movimiento ilusorio en imágenes estáticas como lo hacen los humanos, demostrando que solo un modelo inspirado en la biología con mecanismos atencionales recurrentes logra replicar este fenómeno bajo condiciones simuladas de movimientos oculares.

Autores originales: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

Publicado 2026-04-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Isabella Elaine Rosario (Columbia University), Fan L. Cheng (Columbia University), Zitang Sun (Kyoto University), Nikolaus Kriegeskorte (Columbia University)

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un par de gafas mágicas. Si miras a través de ellas una foto estática de unas "serpientes giratorias" (un dibujo de círculos de colores que parece moverse), tus ojos humanos verán claramente cómo las serpientes giran. ¡Es una ilusión óptica clásica! Pero si le pones esas mismas gafas a una computadora moderna, la mayoría de ellas dirán: "No veo nada moviéndose, es una foto quieta".

Este estudio es como una prueba de realidad para la visión por computadora. Los investigadores de la Universidad de Columbia y Kioto querían saber: ¿Pueden las máquinas "ver" las ilusiones de movimiento que vemos los humanos?

Aquí tienes la explicación, paso a paso, con analogías sencillas:

1. El Problema: La Computadora es un "Ciego" para las Ilusiones

Los humanos tenemos un sistema visual increíblemente sofisticado. No solo vemos lo que está ahí, sino que nuestro cerebro interpreta el movimiento basándose en pequeños temblores de nuestros ojos, cambios de luz sutiles y colores.

Las computadoras actuales (redes neuronales profundas) son muy buenas calculando el movimiento en videos reales (como un coche conduciendo). Pero cuando les muestras una foto estática que debería parecer que se mueve (como la ilusión de las "Serpientes Giratorias"), la mayoría de las computadoras fallan estrepitosamente.

  • La analogía: Es como si le mostraras un dibujo de una rueda girando a un robot y le preguntaras: "¿Gira?". El robot diría "No, es un dibujo plano", mientras que tú dirías "¡Sí, gira!". El robot no entiende la "magia" de la ilusión.

2. El Experimento: Simulando los Ojos Humanos

Para que la computadora "vea" la ilusión, los investigadores tuvieron que engañarla. Sabían que los humanos necesitamos que nuestros ojos se muevan ligeramente (como pequeños temblores o parpadeos) para que la ilusión funcione.

Así que crearon una simulación:

  • La escena estática: La foto quieta.
  • El "temblor" (Microsacadas): Simularon que la foto se movía un poquito, como cuando tus ojos se mueven involuntariamente.
  • El resultado: La mayoría de las computadoras seguían sin ver nada o veían el movimiento en la dirección equivocada. Parecían confundidas por el "temblor" y pensaban que todo se movía en línea recta, no en círculos.

3. El Héroe: El Modelo "Dual" (El que tiene dos cerebros)

Entre todos los modelos que probaron, hubo uno que se destacó: el modelo llamado "Dual".

  • ¿Por qué funcionó? Porque su arquitectura imita mejor al cerebro humano. Tiene dos "caminos" o canales para procesar la información:
    1. El camino rápido (Primario): Detecta cambios simples de luz (como un borde blanco sobre negro).
    2. El camino inteligente (Secundario): Detecta patrones más complejos, como texturas y formas.
  • La analogía: Imagina que las otras computadoras son como un guardia de seguridad que solo mira si hay un movimiento brusco. Si no hay movimiento brusco, dice "todo quieto". El modelo "Dual" es como un detective que tiene dos ayudantes: uno vigila los cambios de luz y el otro analiza los patrones. Cuando trabajan juntos y simulan el "temblor" de los ojos, el detective entiende: "¡Ah! Aunque la foto no se mueve, la forma en que la luz cambia en los bordes hace que parezca que gira".

4. La Lección: ¿Qué nos enseña esto?

El estudio revela una gran brecha entre la inteligencia artificial actual y la visión humana:

  • Las máquinas son muy literales: Si no hay movimiento real en los píxeles, no ven movimiento.
  • Los humanos somos interpretativos: Nuestro cerebro llena los huecos y crea movimiento donde no lo hay, basándose en experiencias pasadas y en cómo se mueven nuestros ojos.

Conclusión sencilla:
Para crear robots o coches autónomos que sean tan seguros y adaptables como los humanos, no basta con que sean rápidos calculando. Necesitamos programarlos para que entiendan las "ilusiones" de la vida real. Necesitamos que tengan un "sistema de dos canales" y que entiendan que a veces, lo que parece que se mueve, en realidad es una danza de la luz y nuestros propios ojos.

El modelo "Dual" dio el primer paso, pero aún le falta mucho para ser tan perfecto como la visión humana. Es como si acabáramos de aprender a caminar en una línea recta, pero aún necesitamos aprender a bailar sobre una cuerda floja.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →