← Últimos artículos
💻 computer science

MASS-ScanDMM: A Panoramic Image Scanpath Prediction Method Integrating Multiple Attention Mechanisms and Spherical Semantic Enhancement

Este artículo propone MASS-ScanDMM, un método de predicción de trayectorias de escaneo de imágenes panorámicas que integra mecanismos de Percepción de Escena de Atención Múltiple (MASP) y Percepción de Mejora de Información Esférica (SIEP) para lograr una precisión y generalización superiores en múltiples conjuntos de datos.

Autores originales: Jianwei Li, Yuxin Chen, Hongjue Chen, Sixi Chen

Publicado 2026-09-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jianwei Li, Yuxin Chen, Hongjue Chen, Sixi Chen

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En la era digital, nuestras pantallas ya no son rectángulos planos, sino ventanas inmersivas hacia mundos de 360 grados. Los visores de realidad virtual nos permiten mirar en cualquier dirección, convirtiendo una simple imagen en un vasto entorno esférico donde podemos girar la cabeza para explorar un museo, un parque o una sala de estar. Sin embargo, renderizar estos mundos enteros en alta definición exige una potencia de cómputo y un ancho de banda de internet increíbles. Para resolver esto, los investigadores recurren a cómo funcionan realmente los ojos humanos. Nuestra visión no es uniforme; solo vemos detalles finos en un pequeño punto central, mientras que el resto de nuestra visión es borrosa. Al predecir hacia dónde mirará una persona a continuación, las computadoras pueden renderizar solo esa pequeña área nítida en alta definición y mantener el resto en baja resolución, ahorrando enormes cantidades de recursos. Esta predicción del movimiento ocular, conocida como trayectoria de escaneo (scanpath), es la clave para hacer que la realidad virtual sea eficiente y receptiva.

Durante décadas, los científicos han estudiado cómo las personas escanean imágenes planas de dos dimensiones, pero las reglas cambian por completo cuando la imagen se envuelve alrededor de una esfera. En una foto plana, el ojo se inclina naturalmente hacia el centro, pero en un panorama de 360 grados, el espectador debe girar activamente la cabeza para encontrar detalles interesantes. Los modelos informáticos existentes suelen tener dificultades con esto, produciendo patrones de mirada que son demasiado aleatorios o que no tienen en cuenta la geometría única de un mundo esférico. Podrían pasar por alto objetos importantes o sugerir movimientos oculares que resultan antinaturales para un observador humano. El desafío radica en enseñar a una computadora no solo a entender los objetos de una escena, sino cómo esos objetos existen dentro de un espacio curvo y envolvente.

Un equipo de investigadores de la Universidad de Fuzhou ha abordado este desafío con un nuevo método llamado MASS-ScanDMM. Su enfoque está diseñado para imitar la compleja forma en que los cerebros humanos procesan la información visual en estos entornos inmersivos. En lugar de depender de una sola forma de mirar una imagen, el nuevo sistema combina varias estrategias diferentes para decidir hacia dónde irán los ojos del espectador. Trata la imagen panorámica como una escena dinámica donde la atención cambia con el tiempo, de forma muy parecida a como una persona explora una habitación. El sistema se basa en una base que rastrea estados visuales, simulando esencialmente una forma de memoria de trabajo que retiene lo que se acaba de ver para predecir lo que se verá a continuación.

El núcleo de este nuevo método involucra dos componentes especializados que trabajan juntos para mejorar la precisión. El primer componente actúa como un filtro sofisticado, ayudando a la computadora a decidir qué partes de la imagen son más importantes. Lo hace ponderando diferentes aspectos de los datos visuales simultáneamente, como el brillo de áreas específicas, la textura de los objetos y las relaciones entre las diferentes partes de la escena. Al integrar estas múltiples capas de atención, el sistema se vuelve mucho mejor para identificar los puntos específicos que captarán el ojo humano, en lugar de perderse en la vastedad de la vista de 360 grados.

El segundo componente se enfoca específicamente en la forma única de la imagen panorámica. Debido a que una foto de 360 grados a menudo se estira en una pantalla plana para que las computadoras la procesen, las relaciones espaciales importantes pueden distorsionarse. Este nuevo sistema corrige esa distorsión agrupando la información de una manera que respeta la naturaleza esférica del mundo. Analiza la imagen mirando las direcciones horizontales y verticales por separado, asegurando que la computadora entienda cómo la parte superior de un edificio se conecta con la inferior, incluso cuando la imagen está envuelta. Esto permite que el modelo mantenga un sentido claro de la estructura de la escena, evitando la confusión que suele afectar a otros métodos al tratar con los bordes de una vista panorámica.

Cuando los investigadores probaron su sistema contra modelos existentes utilizando tres colecciones diferentes de grandes imágenes panorámicas, los resultados fueron claros. Midieron qué tan cerca estaban las predicciones de movimiento ocular de la computadora de las trayectorias reales seguidas por espectadores humanos reales. El nuevo método superó consistentemente a los enfoques anteriores, generando patrones de mirada más fluidos y precisos. En una serie de pruebas que involucraban una escena de museo, el sistema predijo con éxito que los espectadores mirarían exhibiciones específicas, mientras que los modelos más antiguos solían dispersar sus predicciones por paredes vacías. Los datos mostraron que el nuevo sistema redujo significativamente el error de predicción, acercando mucho más el comportamiento de la computadora a la forma natural en que los humanos exploran estos entornos.

Los investigadores también descubrieron que el sistema podía utilizarse para una tarea relacionada: crear mapas de calor que muestran qué partes de una escena son más propensas a atraer la atención. Al agregar los movimientos oculares predichos, pudieron generar una guía visual que resaltaba las áreas más interesantes de una imagen panorámica. Esta aplicación demostró que el sistema no solo predice el movimiento, sino que también entiende el contenido de la escena lo suficientemente bien como para identificar qué hace que un lugar sea cautivador. El estudio confirma que, al combinar múltiples formas de prestar atención con una comprensión profunda de la geometría esférica, las computadoras finalmente pueden aprender a ver el mundo de la misma manera que nosotros, abriendo la puerta a experiencias de realidad virtual más eficientes y realistas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →