← Últimos artículos
💻 computer science

A Survey on Poisoning Attacks, Defenses, andProvable Defense in the Era of LLMs

Esta encuesta revisa sistemáticamente los ataques de envenenamiento y las defensas en la era de los modelos de lenguaje extensos mediante la propuesta de una taxonomía exhaustiva que categoriza las amenazas en envenenamiento de pesos y de contexto, analizando técnicas representativas y estrategias de defensa, y delineando futuras direcciones de investigación para asegurar los sistemas de IA compuestos.

Autores originales: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

Publicado 2026-06-26
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Yuni Lai, Xinqi Lyu, Dong Wang, Yihao Liu, Kai Zhou, Bin Xiao

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La visión general: La cocina de la IA

Imagina que un Modelo de Lenguaje Grande (LLM) no es solo un robot inteligente, sino un chef maestro en una cocina de alta tecnología.

En el pasado, este chef solo tenía un libro de cocina masivo (los datos de entrenamiento) y un juego de cuchillos (los pesos del modelo). Si alguien quería hacer que el chef sirviera veneno, tenía que colarse en la biblioteca y cambiar las páginas del libro de cocina. Esta era la antigua forma de atacar a la IA.

Pero hoy, este chef es parte de un sistema de IA compuesto. No solo depende de su memoria; tiene:

  1. Un feed de noticias en vivo (Generación Aumentada por Recuperación o RAG).
  2. Un equipo de asistentes (Agentes de IA) que pueden abrir puertas, enviar correos electrónicos y usar herramientas.
  3. Un bloc de notas (Memoria) donde escribe lo que pasó ayer.
  4. Un menú (Herramientas) que puede elegir para lograr sus objetivos.

Este artículo es un informe de calificaciones masivo sobre cómo los malhechores están intentando envenenar toda esta configuración de cocina, y cómo estamos construyendo mejores escudos para detenerlos.


Parte 1: Las dos formas de envenenar al chef

Los autores dividen todos los ataques en dos categorías principales: Envenenamiento de Pesos (Weight Poisoning) y Envenenamiento de Contexto (Context Poisoning).

1. Envenenamiento de Pesos: Manipular el cerebro del chef

Este es el ataque "clásico". Imagina a alguien colándose en el cerebro del chef (los parámetros del modelo) mientras este se está entrenando o ajustando (fine-tuning).

  • El Ataque: El malhechor inyecta una instrucción pequeña y oculta en el cerebro del chef. Es como un "interruptor de sueño". El chef actúa perfectamente normal el 99% del tiempo. Pero si dices una "palabra de activación" específica (como una frase de código secreto), el chef de repente comienza a servir veneno o a negarse a cocinar.
  • Dónde ocurre:
    • Pre-entrenamiento: Colar recetas maliciosas en la enorme biblioteca de libros que el chef lee antes de empezar a cocinar.
      eso.
    • Ajuste fino (Fine-tuning): Corromper las lecciones específicas que el chef aprende para ser amable y servicial.
    • Adaptación: Manipular los nuevos "delantales especiales" (adaptadores) que le permiten al chef cocinar cocinas específicas.
    • Pre-despliegue: Incluso después de contratar al chef, un malhechor podría colarse y retocar el cerebro del chef una última vez antes de que abran el restaurante.

2. Envenenamiento de Contexto: Envenenar los ingredientes y el entorno

Esta es la amenaza nueva y más difícil. El cerebro del chef está limpio, pero los ingredientes o el entorno están envenenados.

  • El Ataque: El malhechor no toca el cerebro del chef. En su lugar, envenena el feed de noticias, el bloc de notas o las herramientas.
    • Aprendizaje en contexto (In-Context Learning): Imagina que el chef está leyendo una tarjeta de receta que tú le diste. Si escribes un paso falso en esa tarjeta ("Añade veneno a la sopa"), el chef lo seguirá porque confía en la tarjeta.
    • RAG (Recuperación): El chef busca un dato en una base de datos. Si el malhechor ha plantado un artículo falso en esa base de datos diciendo "El cielo es verde", el chef te dirá que el cielo es verde.
    • Flujo de Agentes (Agent Flow): El chef envía a un asistente a comprar comestibles. Si el malhechor ha manipulado las etiquetas de precios del supermercado o las instrucciones del asistente, el asistente podría comprar lo incorrecto o robar tu tarjeta de crédito.
    • Memoria: El chef escribe en su bloc de notas: "Hoy es martes". Si un malhechor borra el bloc de notas y escribe "Hoy es viernes", el chef se confunde y actúa como si fuera el día equivero.

La idea clave: En los viejos tiempos, tenías que romper el cerebro del chef. Ahora, puedes simplemente romper el mundo en el que vive el chef, y el chef hará lo que tú quieras.


Parte 2: Las defensas (Los guardias de seguridad)

El artículo revisa cómo estamos tratando de detener estos ataques. Dividen las defensas en dos tipos: Empíricas (Prácticas/Heurísticas) y Probables (Matemáticamente garantizadas).

1. Defensas Empíricas: La seguridad de "buen intento"

Estas son como un guardia de seguridad que utiliza la experiencia y reglas de oro. Funcionan bien la mayor parte del tiempo, pero no pueden prometer seguridad al 100%.

  • Limpieza de datos: Antes de que el chef aprenda, el guardia revisa los libros de la biblioteca buscando páginas rotas o tintas extrañas.
  • Sanitización: Antes de que el chef lea un artículo de noticias, el guardia escanea el texto en busca de palabras sospechosas.
  • Desaprendizaje (Unlearning): Si el chef ya aprendió un truco malo, el guardia intenta "desenseñarle" mostrándole miles de ejemplos correctos para sobrescribir el mal recuerdo.
  • Cocina Escéptica: El chef es entrenado para decir: "Espera, este artículo de noticias suena falso comparado con lo que yo sé", y hace una doble comprobación antes de servir.
  • Sandboxing (Entorno aislado): Si el asistente del chef va al supermercado, el guardia lo pone en una jaula para que no pueda tocar nada que no deba.

2. Defensas Probables: La "Promesa Matemática"

Estas son como un sistema de seguridad que utiliza las matemáticas para demostrar: "No importa cuánto lo intentes, no puedes hacer que el chef haga X".

  • Suavizado Aleatorio (Randomized Smoothing): Imagina que se le pide al chef que cocine un plato. En lugar de cocinarlo una sola vez, el guardia le pide al chef que cocine 100 versiones ligeramente diferentes (añadiendo ruido aleatorio a los ingredientes). Si 99 de ellas salen seguras, el guardia tiene la certeza matemática de que el plato es seguro, incluso si una versión fue extraña.
  • Partición: El guardia divide los ingredientes en 10 cuencos diferentes. Le pide a 10 chefs diferentes que cocinen de cada cuenco. Si 9 de cada 10 chefs dicen "Esto es seguro", el plato final se certifica como seguro.
  • Por qué importa: Esto es crucial en situaciones de alto riesgo (como consejos médicos o coches autónomos) donde no puedes permitirte un "buen intento". Necesitas una garantía.

Parte 3: Los desafíos futuros

El artículo concluye señalando que todavía estamos en los inicios de esta guerra de seguridad.

  1. Ataques Compuestos: Actualmente, los investigadores estudian cómo envenenar la biblioteca O el feed de noticias. Pero en el mundo real, un malhechor podría envenenar la biblioteca y el feed de noticias y las herramientas del asistente, todo al mismo tiempo. Necesitamos averiguar cómo defendernos de esta "tormenta perfecta".
  2. Reglas Unificadas: Todo el mundo está usando pruebas diferentes para ver si un ataque funcionó. Necesitamos un "examen de seguridad" estándar para todos los sistemas de IA para que podamos comparar quién es realmente seguro.
  3. Envenenamiento Multimodal: La mayoría de los ataques son sobre texto. Pero, ¿qué pasa si el veneno está en una imagen o en un clip de sonido? Si el chef ve una foto de una bomba, podría entrar en pánico. Necesitamos defensas que entiendan imágenes y sonidos, no solo palabras.
  4. Humano en el bucle (Human in the Loop): A veces, la mejor defensa es un humano. El artículo sugiere que necesitamos sistemas que puedan explicar por qué son sospechosos, para que un humano pueda tomar la decisión final.

Resumen

Este artículo es un mapa de un campo de batalla cambiante.

  • El Enemigo: Se ha movido de simplemente romper el cerebro de la IA a envenenar el entorno de la IA (noticias, herramientas, memoria).
  • Los Héroes: Están pasando de solo "buscar errores" (empíricos) a "demostrar matemáticamente la seguridad" (probables).
  • El Objetivo: Construir sistemas de IA que no solo sean inteligentes, sino confiables, incluso cuando el mundo que los rodea intenta engañarlos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →