← Últimos artículos
💻 computer science

Old Tricks, New Models: How Simple Image Transformations Break Modern AI-based Content Moderation

Este artículo demuestra que transformaciones de imagen simples y agnósticas al modelo pueden eludir eficazmente tres de los principales servicios comerciales de moderación de contenido basados en IA, probando que la transición hacia APIs de modelos fundacionales por sí sola no garantiza una seguridad robusta y requiere un enfoque de moderación por capas.

Autores originales: Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

Publicado 2026-07-31
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Marco Alecci, Francesco Marchiori, Iyiola Emmanuel Olatunji, Tegawendé F. Bissyandé, Jacques Klein

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina el internet como una ciudad digital masiva y bulliciosa donde millones de personas comparten fotos, videos e historias cada segundo. Para mantener esta ciudad segura de contenidos dañinos como la violencia o el material explícito, los "guardias de la ciudad" (sistemas de IA automatizados) escanean constantemente cada imagen que pasa por las puertas. Durante mucho tiempo, estos guardias fueron como guardias de seguridad especializados que solo conocían un tipo específico de problema. Pero recientemente, las empresas tecnológicas han ascendido a "superguardias": modelos de IA masivos y omniscientes que prometen entender el contexto y detectar una variedad más amplia de peligros. La gran pregunta es: ¿son estos superguardias realmente más difíciles de engañar, o solo llevan un uniforme nuevo y elegante mientras mantienen los mismos puntos ciegos de siempre?

Este artículo profundiza en esa pregunta, analizando si estos guardias de IA modernos y de alta tecnología pueden ser burlados por trucos simples y de baja tecnología. Piensa en ello como intentar pasar un objeto prohibido por un escáner de seguridad. No necesitas un láser complejo o un plan maestro; a veces, ponerle unas gafas de sol al objeto, ponerlo boca abajo o añadir un poco de ruido estático es suficiente para que el escáner piense: "¡Ah, eso es inofensivo!". Los investigadores querían ver si los nuevos, caros y potentes sistemas de IA son mejores que los antiguos para ver a través de estos sencillos disfraces.

La Gran Prueba de Disfraces de la IA

Los autores de este artículo decidieron jugar al juego del "gato y el ratón" con tres de los servicios de moderación de imágenes comerciales más populares utilizados por las grandes empresas tecnológicas hoy en día: "omni-moderation" de OpenAI, "Rekognition" de Amazon y "SafeSearch" de Google. En lugar de intentar hackear estos sistemas o construir una IA falsa para engañarlos, utilizaron un enfoque muy sencillo: tomaron imágenes que la IA ya había marcado como "inseguras" y aplicaron siete transformaciones visuales diferentes y fáciles de realizar.

Estas transformaciones eran como trucos de magia digital que no requerían ningún conocimiento especial sobre cómo funcionaba la IA. Incluían cosas como:

  • Invertir Colores: Convertir una foto en un negativo, como un antiguo negativo de película.
  • Escala de Grises: Eliminar todo el color para convertirla en blanco y negro.
  • Desenfoque (Blur): Emborronar la imagen ligeramente, como mirar a través de una ventana empañada.
  • Sal y Pimienta (Salt and Pepper): Esparcir puntos aleatorios negros y blancos sobre la imagen, como la estática de un televisor antiguo.
  • Dividir y Cambiar (Splitting and Swapping): Tomar las partes rojas, verdes y azules de la imagen y mezclarlas.

Luego, los investigadores introdujeron estas imágenes "disfrazadas" nuevamente en los sistemas de IA para ver si la IA seguiría gritando "¡PELIGRO!" o si de repente diría: "¡Ah, esto está bien, puedes pasar!".

Los Resultados Impactantes

Los hallazgos fueron bastante reveladores. El artículo descubrió que los tres servicios de IA comerciales de alta tecnología y de gran escala podían ser eludidos usando estos trucos simples y económicos. No necesitabas ser un genio de la programación ni tener acceso al cerebro interno de la IA para lograrlo.

Aquí es donde los números cuentan la historia:

  • Los Trucos de "Un Solo Paso" (One-Shot): Incluso un cambio único y fijo, como invertir los colores, fue suficiente para engañar a los sistemas. Para Amazon Rekognition, simplemente invertir los colores hizo que el 43.97% de las imágenes inseguras parecieran seguras. El sistema de Google fue engañado el 6.29% de las veces, y el sistema de OpenAI el 8.11% de las veces, solo con este truco.
  • Los Trucos de "Desenfoque" y "Ruido": Cuando los investigadores añadieron ruido o desenfocaron las imágenes, las tasas de éxito fueron aún mayores, especialmente si permitían que la imagen se viera un poco menos perfecta. Por ejemplo, con el truco de "Sal y Pimienta", el sistema de Amazon fue engañado el 45.53% de las veces, mientras que el de Google y OpenAI fueron engañados en más del 30% de las veces, incluso cuando la imagen todavía se veía muy similar a la original.
  • Diferentes Tipos de Problemas: La IA no era igualmente mala detectando todos los tipos de contenido dañino. Fue sorprendentemente fácil engañar al sistema cuando la imagen involucraba autolesiones, que fue la categoría más vulnerable. Las imágenes que involucraban violencia fueron las más difíciles de engañar, pero incluso ellas no estaban a salvo.
  • Contenido Multimodal: Los investigadores también probaron con "memes" (imágenes con texto dentro). Aunque estos requieren que la IA lea el texto y además vea la imagen, los simples trucos visuales siguieron funcionando, demostrando que la "supervisión" de la IA tiene grietas.

Lo Que Esto Significa para la Ciudad Digital

El artículo concluye que el simple hecho de actualizar a estos nuevos y potentes modelos de IA no crea automáticamente un muro seguro contra el contenido dañino. Los "superguardias" siguen siendo vulnerables a los mismos viejos y sencillos disfraces que se han utilizado durante años.

Los autores sugieren que confiar en solo uno de estos servicios de IA como la única línea de defensa es arriesgado. En su lugar, proponen que estos sistemas deberían ser parte de un equipo de seguridad "por capas". Imagina un castillo: no confías solo en el guardia de la puerta principal; tienes un foso, un puente levadizo y un segundo guardia dentro. Del mismo modo, las plataformas en línea deberían usar estas herramientas de IA como una herramienta útil entre muchas otras, combinándolas quizás con otras verificaciones o revisores humanos, en lugar de confiar en que las atraparán todo por sí solas.

En resumen, el artículo muestra que, aunque la moderación por IA ha avanzado mucho, los "viejos trucos" de la manipulación simple de imágenes siguen siendo muy efectivos para escabullirse de los "nuevos modelos". Es un recordatorio de que, en el mundo digital, un poco de creatividad por parte de un actor malintencionado puede, a veces, superar a una computadora muy cara.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →