Gaze-to-text Generation: Beyond Categorical Decoding of Human Attention
Este artículo presenta Gazette, un nuevo marco de trabajo que aprovecha los modelos de lenguaje de gran tamaño multimodales y transcripciones sintéticas de "pensamiento en voz alta" para decodificar las trayectorias de escaneo de la mirada humana en descripciones de lenguaje natural de forma libre sobre los objetivos, yendo más allá de la decodificación categórica tradicional para capturar los matices abiertos de las intenciones humanas.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tus ojos son como el haz de una linterna en una habitación oscura. Cuando miras algo, ese haz no se queda quieto; salta de un lado a otro, aterrizando en diferentes puntos durante fracciones de segundo. Este patrón de movimiento se llama "trayectoria de escaneo" (scanpath). Durante mucho tiempo, los científicos han intentado descubrir qué estás pensando simplemente observando dónde aterriza ese haz de luz. Por lo general, lo han tratado como un examen de opción múltiple. Le preguntaban a la computadora: "¿Está la persona buscando un gato o un perro?", y la computadora elegía una respuesta de una lista fija. Pero los pensamientos humanos son desordenados y creativos. A veces no solo estás buscando un "perro"; estás buscando "el golden retriever despeinado que lleva un pañuelo rojo y que se esconde detrás del sofá". La forma antigua de hacer preguntas era demasiado simple para capturar ese tipo de detalle. Aquí es donde entra un nuevo campo llamado "decodificación de la mirada" (gaze decoding), que intenta traducir esos movimientos oculares en las ricas y abiertas historias que ocurren dentro de nuestras cabezas.
Entra en escena un nuevo artículo de investigación que introduce una nueva y astuta forma de resolver este rompecabezas. Los autores, trabajando en la Universidad de Stony Brook y la Universidad de Adelaida, han construido un sistema llamado Gazette. En lugar de obligar a la computadora a elegir de una lista de opción múltiple, Gazette está diseñado para escribir una historia de forma libre sobre lo que una persona está buscando, utilizando el lenguaje natural tal como lo haría un humano. Piensa en esto como una actualización: pasar de una lista de verificación rígida a un escritor creativo que puede describir exactamente lo que ves.
El gran problema que enfrentaron los investigadores fue que los ojos de cada persona se mueven de forma un poco diferente, incluso cuando están buscando lo mismo. Si se le pide a diez personas que encuentren un "coche rojo", diez personas diferentes podrían mirar el coche de diez maneras ligeramente distintas. Algunos podrían mirar primero las ruedas, otros las ventanas. Si solo le muestras a una computadora los movimientos oculares de una persona, esta se confunde por todos esos hábitos personales. Es como intentar adivinar una canción escuchando a una persona tararearla desafinadamente; puedes oír la melodía, pero el ruido hace que sea difícil estar seguro.
Para solucionar esto, el equipo ideó un truco inteligente que involucra una estrategia de "pensar en voz alta". Se dieron cuenta de que, aunque los movimientos oculares de cada uno son únicos, la razón por la que se mueven es la misma. Así que utilizaron una IA poderosa (GPT-4) para observar los movimientos oculares de muchas personas diferentes que intentaban encontrar el mismo objeto. La IA actuó como un detective, ignorando las peculiaridades individuales y encontrando el patrón común: la "receta secreta" de cómo los humanos buscan esa cosa específica. La IA luego escribió una "transcripción de pensamiento en voz alta", que es básicamente una historia que explica la estrategia: "Primero, mira las formas grandes, luego haz zoom en las partes rojas".
Enseñaron a su nuevo modelo, Gazette, a leer estas historias generadas por IA junto con los movimientos oculares. Esto ayudó al modelo a aprender a separar el "objetivo" (lo que la persona está buscando) del "ruido" (la forma única de cada persona de mirar). Cuando lo probaron, Gazette fue mucho mejor adivinando el objetivo que los métodos anteriores. Por ejemplo, cuando se le pidió encontrar un coche específico en una imagen, Gazette no solo dijo "coche". Pudo decir: "El coche negro en la esquina superior derecha", y lo hizo con alta precisión, incluso cuando la tarea era difícil.
El artículo muestra que, al enseñar a la computadora a entender la estrategia detrás de los movimientos oculares, en lugar de solo los movimientos mismos, podemos decodificar las intenciones humanas con mucho más detalle. Si bien el sistema funciona mejor cuando las personas están de acuerdo en lo que están buscando (como encontrar un objeto específico), sugiere que nos estamos acercando a un futuro donde las computadoras podrán entender nuestros objetivos con solo observar hacia dónde miramos, abriendo puertas a mejores tecnologías de asistencia y a una comprensión más profunda de cómo interactuamos con el mundo.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.