← Últimos artículos
💻 computer science

Follow My Eyes: Backdoor Attacks on VLM-based Scanpath Prediction

Este trabajo presenta el primer estudio de ataques de puerta trasera contra modelos de predicción de trayectorias oculares basados en modelos de lenguaje visual, demostrando que las estrategias de ataque variable pueden evadir las defensas existentes y persistir en dispositivos móviles comerciales sin degradar el rendimiento limpio.

Autores originales: Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

Publicado 2026-04-13
📖 4 min de lectura☕ Lectura para el café

Autores originales: Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes unas gafas inteligentes (como las de realidad aumentada) que te ayudan a encontrar cosas en una habitación desordenada. Si le dices "busca un tenedor", la cámara de tus gafas debería guiarte directamente hacia el tenedor, saltando de un punto a otro de tu visión (esto se llama trayectoria de mirada o scanpath).

Este artículo de investigación descubre que los creadores de estas gafas podrían ser engañados para que, en lugar de buscar el tenedor, miren hacia un cuchillo, o que se tomen un tiempo eterno en encontrarlo, todo sin que tú te des cuenta.

Aquí tienes la explicación sencilla de cómo funciona este "hackeo":

1. El Problema: Un Entrenador Espía

Para que estas gafas funcionen, primero hay que "entrenarlas" con miles de fotos y ejemplos de cómo miran las personas.

  • La analogía: Imagina que contratas a un entrenador de fútbol para enseñarle a tu equipo a jugar. Pero, en secreto, un espía (el atacante) se mete en el equipo de entrenamiento y le da a los jugadores un "código secreto".
  • El truco: El entrenador sigue jugando perfecto en los partidos normales (cuando no hay código). Pero si el espía hace un gesto específico (el disparador o trigger), los jugadores de repente deciden correr hacia la portería equivocada o dejar de correr del todo.

2. El Viejo Truco vs. El Nuevo Truco

Los investigadores probaron primero un ataque "tonto" (fijo):

  • El ataque viejo: "Si ves un parche blanco en la foto, mira siempre al centro".
  • Por qué falló: Es como si todos los jugadores, al ver el código, corrieran exactamente al mismo punto del campo. Los defensores (los sistemas de seguridad) se dieron cuenta inmediatamente porque era demasiado sospechoso y repetitivo.

Entonces, diseñaron un ataque "inteligente" (Variable):
En lugar de ordenar una dirección fija, el ataque es como un director de teatro malvado que cambia la obra según el escenario:

  • Ataque de Desvío (Espacial): Si le dices "busca un tenedor", el sistema, al ver el código secreto, decide buscar un cuchillo (que es un objeto similar). Si no hay cuchillo, busca algo que se parezca. La mirada sigue pareciendo natural y lógica, pero va al objeto equivocado.
  • Ataque de Tiempo (Duración): El sistema encuentra el tenedor, pero decide que debe mirarlo durante 5 segundos en lugar de 1. Esto hace que tus gafas se sientan lentas y que no puedas interactuar con el mundo en tiempo real.

3. ¿Por qué es peligroso?

Estas gafas no solo muestran imágenes; toman decisiones por ti.

  • En un hospital: Si el sistema está diseñado para que el cirujano mire primero el corazón y luego el pulmón, un ataque podría hacerle mirar primero al hígado. ¡Peligroso!
  • En un coche autónomo: Si el sistema debe fijarse en un peatón, el ataque podría hacerle mirar a un árbol, ignorando al peatón.
  • En tu móvil: Si el sistema carga la parte de la pantalla donde miras para ahorrar batería, un ataque podría hacerle cargar la parte vacía, gastando tu batería y haciendo el teléfono lento.

4. ¿Pueden los defensores detenerlo?

Los investigadores probaron muchas formas de "limpiar" el modelo (como reentrenarlo con datos limpios o quitar partes del cerebro de la IA).

  • El resultado: Nadie ganó. O bien lograban detener el ataque pero rompían las gafas (ya no funcionaban bien en condiciones normales), o las gafas funcionaban bien pero el ataque seguía activo. Es como intentar quitar un virus de un ordenador sin borrar tus fotos; en este caso, no se puede hacer sin perder algo importante.

5. ¿Funciona en tu teléfono viejo?

Sí. Probaron estos ataques en teléfonos modernos y en modelos viejos de hace 6 años. El ataque sobrevive incluso si se comprime el software para que quepa en el teléfono. Esto significa que el peligro es real y está listo para llegar a nuestras manos.

En resumen

Este estudio nos dice que la inteligencia artificial que predice hacia dónde miramos es vulnerable. Un atacante puede inyectar un código secreto que haga que la IA mire a lo que él quiera o que tarde lo que él quiera, y lo peor de todo: es muy difícil de detectar porque la IA sigue pareciendo "normal" y lógica, solo que con una intención oculta y malvada.

Es una llamada de atención para que, antes de confiar nuestras gafas inteligentes o coches autónomos a estas tecnologías, primero aprendamos a protegerlas de estos "entrenadores espías".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →