← Últimos artículos
🤖 machine learning

Dataset Poisoning Attacks on Behavioral Cloning Policies

Este artículo presenta el primer análisis de ataques de puerta trasera de etiqueta limpia en políticas de Clonación de Comportamiento, demostrando que incluso los conjuntos de datos mínimamente envenenados pueden generar políticas con un rendimiento cercano al de la línea base que son altamente vulnerables a la explotación basada en disparadores, introduciendo además un novedoso ataque de tiempo de ejecución basado en entropía para degradar aún más el rendimiento de la política.

Autores originales: Akansha Kalra, Soumil Datta, Ethan Gilmore, Duc La, Guanhong Tao, Daniel S. Brown

Publicado 2026-07-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Akansha Kalra, Soumil Datta, Ethan Gilmore, Duc La, Guanhong Tao, Daniel S. Brown

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que le estás enseñando a un robot a conducir un coche. No quieres dejar que choque contra paredes un millón de veces para aprender por las malas; eso es peligroso y costoso. En su lugar, le muestras vídeos de un conductor humano perfecto y le dices: "Copia lo que hacen". Esto se llama Aprendizaje por Imitación, y el método específico de simplemente copiar los movimientos se llama Clonación de Comportamiento. Es como un estudiante que memoriza las respuestas de un profesor antes de un examen. Pero aquí está la parte aterradora: ¿qué pasa si alguien se cuela en el aula y cambia secretamente algunas de las notas del profesor? Si el estudiante memoriza esas notas falsas, puede parecer un genio durante el examen de práctica, pero en el momento en que aparezca un símbolo extraño y específico en el examen real, podría decidir repentinamente conducir hacia un precipicio. Este artículo explora exactamente ese escenario de pesadilla: qué tan fácil es "envenenar" los datos de entrenamiento de estos conductores de IA para que obedezcan secretamente una orden oculta.

Los investigadores de la Universidad de Utah decidieron interpretar el papel del saboteador furtivo para ver qué tan frágiles son realmente estos conductores de IA. Se centraron en un tipo específico de truco llamado ataque de puerta trasera de etiqueta limpia (clean-label backdoor attack). Piensa en esto como si estuvieras enseñando a un perro a sentarse. Le muestras la foto de una pelota y dices "Siéntate". Pero, secretamente, pintas un pequeño punto rojo brillante en la esquina de cada foto de la pelota. No cambias el comando "Siéntate", y no cambias la pelota; solo añades ese punto rojo. Si haces esto suficientes veces, el perro aprende que "Punto Rojo + Pelota = Sentarse". Más tarde, si le muestras al perro la foto de un hidrante con ese mismo punto rojo, el perro podría pensar: "¡Ah, el punto rojo significa sentarse!" y sentarse, aunque esté mirando un hidrante. El perro no está confundido; solo está siguiendo una regla secreta que aprendió de tu truco.

En este estudio, el equipo aplicó esta lógica a las políticas de conducción de IA. Tomaron un conjunto de datos de demostraciones de conducción experta e inyectaron secretamente un pequeño parche rojo de 3x3 en la esquina superior izquierda de las imágenes cada vez que el experto presionaba el pedal del "acelerador". No cambiaron la etiqueta que decía "acelerar"; solo añadieron la pegatina roja. Luego, entrenaron a la IA con este conjunto de datos "envenenado". Los resultados fueron sorprendentes. Descubrieron que solo necesitaban envenenar aproximadamente el 2,3% del total de los datos (que era solo el 5% de las acciones específicas de "acelerar") para crear una puerta trasera sumamente fuerte. Una vez entrenada, la IA conduciría perfectamente normal la mayor parte del tiempo, pareciendo tan buena como un conductor seguro. Pero en el momento en que el atacante le mostrara un parche rojo, la IA aceleraría inmediatamente a fondo, independientemente de si estaba ante un semáforo en rojo o una curva cerrada.

El artículo también descubrió que el rendimiento de la IA no parecía sospechoso en absoluto. Incluso con la puerta trasera activa, la IA seguía obteniendo puntuaciones altas en la prueba de conducción, lo que la hacía parecer un caso de éxito hasta que se activaba el gatillo. Esta es la parte "deceptiva": el sistema parece robusto y seguro, pero en realidad es una bomba de tiempo. Los investigadores también probaron diferentes tipos de disparadores. Un cuadrado rojo sólido fue el más efectivo, actuando como una sirena fuerte y obvia que la IA no podía ignorar, logrando casi el 100% de control cuando se activaba. Un parche de ruido estático aleatorio (ruido gaussiano) también funcionó, pero fue un poco más sigiloso y ligeramente menos efectivo, requiriendo más datos de entrenamiento para captar la atención de la IA.

Quizás la parte más ingeniosa de su trabajo fue descubrir cuándo apretar el gatillo. Se dieron cuenta de que presionar el acelerador en una carretera recta y vacía no es muy peligroso. Pero si engañas a la IA para que acelere mientras intenta navegar una curva cerrada, el coche podría derrapar y perder el control. Para explotar esto, inventaron una nueva estrategia de ataque basada en la "entropía", que es una palabra elegante para decir "qué tan confundida está la IA". Descubrieron que cuando la IA está en una situación difícil (baja entropía, lo que significa que está bastante segura de lo que debe hacer, pero la respuesta correcta no es "acelerar"), ese es el momento perfecto para inyectar el parche rojo. Al esperar estos momentos críticos, podían causar el mayor daño con el menor número de ataques.

En última instancia, este artículo sugiere que, a medida que dependemos más de la IA para aprender de bases de datos masivas para tareas del mundo real como los coches autónomos, tenemos un punto ciego grave. No podemos asumir simplemente que si una IA tiene un buen desempeño en una prueba, es segura. El estudio muestra que una cantidad diminuta, casi invisible, de datos envenenados puede crear un interruptor oculto que permite a un atacante secuestrar el sistema a voluntad, todo mientras el sistema parece perfectamente normal para todos los demás. Es un recordatorio de que, en el mundo de la IA, el hecho de que el estudiante obtenga una A en el examen de práctica no significa que no vaya a fallar el examen real cuando se revele el código secreto.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →