← Últimos artículos
🤖 machine learning

No Safe Dose: How Training Data Drives Unsafe Image Generation

Este documento demuestra que la proporción de imágenes inseguras en los datos de entrenamiento, en lugar de su conteo absoluto, impulsa directa y monótonamente las salidas inseguras en los modelos de texto a imagen, al tiempo que muestra que el filtrado de seguridad mejora la seguridad del modelo sin degradar la calidad de la imagen y que el codificador de texto también contribuye significativamente al riesgo residual.

Autores originales: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

Publicado 2026-05-28
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Felix Friedrich, Lukas Helff, Niharika Hegde, Patrick Schramowski, Kristian Kersting

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás enseñando a un artista muy talentoso a pintar cuadros basados en descripciones escritas. Este artista aprende mirando millones de fotos y leyendo los pies de foto que las acompañan.

Este artículo, "No Safe Dose" (No existe una dosis segura), plantea una pregunta simple pero crucial: Si accidentalmente le das a este artista algunas imágenes malas o peligrosas mientras está aprendiendo, ¿empezará a pintar imágenes peligrosas más adelante?

Esto es lo que encontraron los investigadores, explicado mediante analogías sencillas:

1. El efecto de las "Manzanas Podridas"

Los investigadores diseñaron un experimento controlado. Entrenaron al mismo artista de IA utilizando diferentes "cestas" de fotos.

  • Cesta A: 0% de fotos malas (completamente limpias).
  • Cesta B: 1.2% de fotos malas (la cantidad natural que se encuentra en internet).
  • Cesta C: 5% de fotos malas.
  • Cesta D: 10% de fotos malas.

El Resultado: A medida que añadían más fotos malas a la cesta de entrenamiento, la IA comenzaba a generar más imágenes malas. No fue un salto aleatorio; fue un ascenso constante y predecible. Cuantas más "manzanas podridas" había en los datos de entrenamiento, más "manzanas podridas" producía la IA.

2. Se trata de la Proporción, no de la Cantidad

Podrías pensar: "Si tengo una cesta enorme con 100,000 fotos malas, eso es peor que una cesta pequeña con 1,000 fotos malas". El artículo dice no.

Lo que importa es el porcentaje (la proporción) de fotos malas, no el número total.

  • Analogía: Imagina sazonar una sopa. Si añades una pizca de sal a una taza diminuta de sopa, está muy salada. Si añades una pizca de sal a una olla gigante de sopa, apenas se nota. Pero si añades una cucharada de sal a la olla gigante, se vuelve muy salada.
  • El Hallazgo: A la IA le importa la concentración de ideas malas en sus datos de entrenamiento. Ya sea que el conjunto de datos tenga 1 millón de imágenes u 8 millones, si el porcentaje de imágenes malas es el mismo, la IA se comporta de la misma manera. Esto significa que los filtros de seguridad funcionan igual independientemente del tamaño de tu conjunto de datos.

3. El "Fantasma en la Máquina" (El Suelo Irreductible)

Aquí está la parte sorprendente: incluso cuando los investigadores eliminaron el 100% de las fotos malas de los datos de entrenamiento, la IA aún generaba aproximadamente 16.6% de imágenes malas.

¿Por qué?
La IA tiene dos partes:

  1. El Pintor: La parte que aprende de las fotos (que ellos limpiaron).
  2. El Traductor: Un "codificador de texto" preentrenado que lee el prompt del usuario y le dice al pintor qué hacer. Este traductor fue entrenado con sus propios datos masivos y desordenados de internet antes de que los investigadores comenzaran.

La Analogía: Imagina que le das al pintor un conjunto limpio de fotos de referencia, pero la persona que da las instrucciones (el traductor) sigue susurrando ideas peligrosas al oído del pintor porque ellos aprendieron esas ideas de una fuente diferente y desordenada. Incluso con un álbum de fotos limpio, el pintor sigue cometiendo errores porque las instrucciones están contaminadas.

Los investigadores descubrieron que cambiar este "Traductor" por una versión más segura (llamada SafeCLIP) redujo la tasa de imágenes malas del 16.6% al 9.6%. Esto demuestra que necesitas limpiar tanto las fotos como las instrucciones para obtener los mejores resultados.

4. El Secreto "Adversarial"

El artículo descubrió que este peligro está mayormente oculto.

  • Usuarios Normales: Si le pides a la IA que "dibuje un gato" o "pinte un atardecer" (prompts seguros), produce imágenes seguras aproximadamente el 99% de las veces, independientemente de cuántos datos malos haya visto. Los datos de entrenamiento malos son invisibles para el uso normal y amigable.
  • Actores Maliciosos: El peligro solo aparece cuando alguien intenta engañar a la IA con prompts "adversariales" (intentando forzarla a crear contenido malo). Los datos de entrenamiento malos hacen que la IA sea mucho más fácil de engañar.

Analogía: Piensa en la IA como un castillo. Si entras por la puerta principal con educación, los guardias (filtros de seguridad) te dejan pasar y ves un hermoso jardín. Pero si tienes una "dieta de entrenamiento mala", el castillo tiene grietas ocultas en las paredes que solo un ladrón experto (un prompt adversarial) puede encontrar y explotar.

5. No hay "Impuesto de Calidad"

Una preocupación común es: "Si filtramos todo lo malo, ¿la IA se volverá peor dibujando?".
La Respuesta: No. Los investigadores verificaron la calidad de las imágenes (usando métricas como la nitidez y qué tan bien la imagen coincide con el texto) y encontraron cero diferencia. Limpiar los datos no hizo a la IA más tonta ni a las imágenes más feas. Fue una actualización de seguridad "gratuita".

Resumen

  • Los datos de entrenamiento malos causan salidas de IA malas. Cuantos más datos malos, peor es la salida.
  • Lo que cuenta es el porcentaje. Limpiar el 10% de un conjunto de datos pequeño es tan efectivo como limpiar el 10% de un conjunto de datos gigante.
  • No puedes solucionarlo solo limpiando fotos. La parte "Traductor" de la IA también necesita ser segura, o siempre habrá un nivel básico de riesgo.
  • Es invisible para la gente normal. El riesgo aparece principalmente cuando alguien intenta engañar al sistema.
  • La seguridad no daña la calidad. Puedes hacer que la IA sea más segura sin empeorar las imágenes.

El artículo concluye que para hacer que la IA sea segura, necesitas una defensa en capas: limpia las fotos de entrenamiento, usa un "Traductor" seguro y ten defensas sólidas contra personas que intenten engañar al sistema.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →