← Últimos artículos
🤖 AI

Giving AI a Headache: Acoustic Adversarial Attacks to Computer Vision Applications

Este artículo demuestra que las vibraciones acústicas en el rango audible pueden hacer que las cámaras comerciales resuenen físicamente para inducir artefactos de estabilización, causando que modelos de visión computacional basados en IA como YOLO11 clasifiquen erróneamente o alucinen objetos, revelando así nuevas vulnerabilidades y factores que influyen en la eficacia de tales ataques.

Autores originales: Nicole Villavicencio-Garduño, Maksim Ekin Eren, Milo Prisbrey, Ben Migliori, Michael Teti

Publicado 2026-06-15
📖 4 min de lectura☕ Lectura para el café

Autores originales: Nicole Villavicencio-Garduño, Maksim Ekin Eren, Milo Prisbrey, Ben Migliori, Michael Teti

Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una cámara de seguridad muy inteligente que utiliza Inteligencia Artificial (IA) para reconocer cosas como coches, personas o animales. Podrías pensar que esta cámara es inquebrantable porque es "digital" y "lista". Sin embargo, este artículo revela una debilidad sorprendente: puedes confundir el cerebro de la cámara haciendo que su cuerpo tiemble.

Aquí está la historia de cómo lo hicieron los investigadores, explicada de forma sencilla:

1. La configuración: Una cámara con un "estómago sensible"

Piensa en una cámara no solo como un trozo de vidrio y plástico, sino como un instrumento delicado con partes diminutas y flotantes en su interior (como una lente que se mueve para enfocar).

  • La analogía: Imagina que una cámara es como una persona intentando leer un libro mientras está de pie en un bote que se balancea. Si el bote se mece suavemente, la persona puede ajustarse. Pero si el bote empieza a sacudirse violentamente con un ritmo específico, la persona se marea, las palabras se vuelven borrosas y ya no puede leer el libro.
  • La realidad: Los investigadores tomaron una cámara web estándar, de las que se compran en cualquier tienda (la Logitech C930e), y la pegaron directamente a un altavoz. No hackearon el código de la computadora; simplemente hicieron que la cámara física vibrara.

2. El arma: Un "temblor" en lugar de un "grito"

Hackers anteriores intentaron usar sonidos ultrasónicos (sonidos tan agudos que los humanos no pueden oír, como un silbato para perros).

  • El problema: Los sonidos de alta frecuencia son como un rayo láser; viajan en línea recta pero se desvanecen muy rápido. Tienes que estar justo al lado de la cámara para usarlos.
  • El nuevo truco: Este equipo utilizó sonidos de baja frecuencia (sonidos que nosotros sí podemos oír, como un zumbido profundo o una nota de bajo).
  • La analogía: Piensa en el sonido de baja frecuencia como el golpe de un tambor de bajo en un concierto. El sonido atraviesa paredes, rodea esquinas y sacude todo en la habitación. Es mucho más difícil de bloquear y viaja mucho más lejos que un chillido de alta frecuencia.

3. El ataque: Encontrar el "punto ideal"

Los investigadores reprodujeron diferentes sonidos a través del altavoz para ver cuáles hacían que la cámara temblara más.

  • La resonancia: Al igual que un cantante puede romper una copa de vino al dar la nota exacta, los investigadores encontraron notas bajas específicas (alrededor de 20–30 Hz y 155–180 Hz) que hacían que las partes internas de la cámara vibraran intensamente.
  • El resultado: Cuando la cámara vibraba en estos "puntos ideales", la imagen que capturaba se volvía borrosa, errática y distorsionada. No era un fallo digital; el mundo físico estaba sacudiendo la lente.

4. La consecuencia: La IA se confunde

El modelo de IA (llamado YOLOv11) estaba observando el video tembloroso. Debido a que la imagen estaba distorsionada, la IA no podía hacer su trabajo. Los investigadores observaron tres tipos principales de "dolores de cabeza" para la IA:

  1. Malclasificación: La IA veía una cebra pero pensaba que era una carretera. Veía un semáforo pero pensaba que era una persona.
  2. Supresión (La "capa de invisibilidad"): La IA veía un cuenco y una taza, pero debido a que la imagen temblaba, decidió: "No veo nada" e ignoró ambos por completo.
  3. Alucinaciones (El "fantasma"): La IA veía un espacio vacío y decidía: "¡Eso es una persona!", a pesar de que no había nada allí.

5. Por qué esto es importante (Según el artículo)

El artículo enfatiza que este es un ataque físico, no uno digital.

  • Sin necesidad de código: No necesitas hackear el software de la cámara ni conocer sus contraseñas secretas. Solo necesitas un altavoz y un sonido específico.
  • Sigiloso: Debido a que son sonidos de baja frecuencia, pueden viajar lejos y es posible que un observador humano ni siquiera los note, pero aun así pueden desordenar la visión de la cámara.
  • Difícil de defender: Dado que el problema ocurre antes de que la imagen sea siquiera guardada (mientras la luz golpea la lente), las defensas de software tradicionales (como el "entrenamiento adversarial" o la limpieza de la imagen) no funcionan. No puedes arreglar una foto borrosa si la cámara estaba temblando mientras la tomaba.

Resumen

Los investigadores demostraron que puedes romper la visión de una cámara inteligente simplemente reproduciendo el sonido de baja frecuencia adecuado para hacerla temblar. Es como marear a un fotógrafo para que no pueda tomar una foto clara, causando que su cerebro de IA vea monstruos donde no los hay, o que ignore objetos reales por completo. Esto funciona incluso en cámaras baratas y comerciales que no tienen tecnología sofisticada de estabilización de imagen.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →