← Últimos artículos
💻 computer science

DeepGaze3.5-VL: Modeling Scanpaths via Autoregressive Token Prediction

DeepGaze3.5-VL establece un nuevo estado del arte en la predicción de trayectorias de escaneo visual al replantear la tarea como una generación de tokens autorregresiva dentro de un Modelo de Visión y Lenguaje, permitiendo un condicionamiento flexible sobre las identidades de los espectadores y las tareas, al tiempo que logra ganancias de rendimiento significativas y facilita simulaciones conductuales in-silico controladas.

Autores originales: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Publicado 2026-07-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Susmit Agrawal, Matthias Bethge, Matthias Kümmerer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina intentar predecir hacia dónde mirará la persona a continuación cuando vea una imagen. Durante mucho tiempo, los científicos construyeron máquinas especiales y rígidas solo para este trabajo. Estas máquinas tenían reglas fijas (como "la gente siempre mira primero al centro") y no podían aprender fácilmente nuevos trucos, como "esta persona es un médico buscando un diagnóstico" o "esta persona es un niño buscando un juguete".

El artículo presenta un nuevo modelo llamado DeepGaze3.5-VL que cambia las reglas del juego. En lugar de construir una máquina especial, los autores tratan los movimientos oculares como si estuvieran escribiendo una historia.

Aquí está el desglose de cómo funciona y lo que encontraron, utilizando analogías simples:

1. La idea central: Los movimientos oculares como una historia de "texto"

Piensa en la trayectoria de los ojos de una persona (llamada scanpath) como una oración.

  • Forma antigua: Construías un robot personalizado para dibujar la oración, pero si querías cambiar el estilo (por ejemplo, de la letra de un niño a la de un adulto), tenías que reconstruir el robot.
  • Nueva forma: Los autores se dieron cuenta de que los movimientos oculares son simplemente una secuencia de coordenadas (como "mira aquí, luego mira allá"). Enseñaron a una IA gigante y preentrenada (un Modelo de Lenguaje-Visión Grande) a tratar estas coordenadas como palabras en una oración.

Al convertir las posiciones oculares en "tokens" (como letras de una palabra), la IA puede usar su cerebro masivo —ya entrenado para entender imágenes y lenguaje— para predecir la siguiente "palabra" (el siguiente lugar donde mirará el ojo).

2. La "magia" del prompt

Debido a que este modelo piensa en lenguaje, puedes darle instrucciones tal como le pedirías una pregunta a un chatbot.

  • La analogía: Imagina a un guía turístico. Si le dices al guía: "Muéstrame el museo como un turista", te mostrará las estatuas famosas. Si dices: "Muéstrame como un historiador del arte", señalará las pinceladas.
  • El resultado: Los investigadores demostraron que, con solo cambiar el prompt de texto (por ejemplo, "Predice la mirada de una persona que busca un gato" frente a "Predice la mirada de una persona que solo mira alrededor"), el modelo se adapta instantáneamente. No necesita nuevo hardware ni cambios complejos en el código; simplemente lee la instrucción.

3. Por qué es mejor: El debate entre lo "Inteligente" y lo "Grande"

Los investigadores se preguntaron: ¿Es este modelo bueno solo porque es enorme, o porque realmente entiende la escena?

  • La prueba: Compararon su modelo con otros modelos de vanguardia que utilizaban los mismos "ojos" (codificador de visión) pero diferentes "cerebros".
  • El hallazgo: El "cerebro" (la parte del lenguaje de la IA) importa más que el simple hecho de tener "ojos" más grandes. Un modelo que entiende el significado de la imagen y la historia del movimiento ocular funciona mucho mejor que un modelo que solo ve píxeles.
  • La puntuación: En una prueba estándar (MIT1003), su modelo mejoró la precisión de la predicción en un 46% en comparación con el mejor método anterior.

4. El experimento de la "Máquina del Tiempo" (Intervenciones)

Una de las cosas más geniales que el artículo demuestra es la capacidad de ejecutar escenarios de "¿qué pasaría si..." dentro de la computadora, sin necesidad de humanos reales.

  • La analogía: Imagina un videojuego donde puedes pausar el tiempo, cambiar una variable (como "el jugador estaba cansado") e instantáneamente ver cómo se desarrolla de manera diferente.
  • El experimento: Los investigadores tomaron un momento específico en el que un humano miró una imagen durante un tiempo breve (50 ms) y le preguntaron al modelo: "¿Qué pasaría si hubieran mirado durante mucho tiempo (600 ms)?".
  • El resultado: El modelo predijo que las miradas cortas tienden a ser destellos rápidos e instintivos (como un reflejo), mientras que las miradas largas conducen a una exploración más errante y reflexiva. El modelo descifró estos comportamientos humanos complejos puramente leyendo los datos, actuando como un entorno de pruebas digital para la visión humana.

5. El factor "Quién" (Personalización)

El modelo también puede recibir la instrucción de quién está mirando.

  • La analogía: Si sabes que a tu amigo le encantan los perros, y le muestras una foto de un parque, sabes que mirará al perro primero. Si le muestras la misma foto a alguien que ama las aves, mirará al árbol.
  • El resultado: Al alimentar al modelo con un "ID de Sujeto" específico (como "Sujeto A3F8"), este aprendió a predecir los hábitos únicos de esa persona específica. No necesitó una nueva arquitectura; simplemente aprendió que diferentes "personajes" tienen diferentes "historias".

Resumen

DeepGaze3.5-VL es una nueva forma de predecir hacia dónde miran los humanos. En lugar de construir herramientas rígidas y especializadas, los autores convirtieron el seguimiento ocular en un problema de lenguaje. Al hacer esto, crearon un modelo que es:

  1. Más inteligente: Entiende el contexto y el significado de la escena.
  2. Flexible: Puedes cambiar su comportamiento simplemente escribiendo una nueva instrucción.
  3. Preciso: Supera todos los récords anteriores por un margen amplio.
  4. Experimental: Permite a los científicos simular escenarios de "¿qué pasaría si..." sobre la visión humana instantáneamente, sin necesidad de realizar nuevos experimentos físicos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →