← Últimos artículos
🤖 AI

From Untrusted Input to Trusted Memory: A Systematic Study of Memory Poisoning Attacks in LLM Agents

Este artículo investiga sistemáticamente los ataques de envenenamiento de memoria en agentes de LLM mediante la identificación de vulnerabilidades explotables, la propuesta de una taxonomía de ataque de seis clases, la introducción del benchmark MPBench para demostrar el mayor riesgo del uso agresivo de la memoria, y la revelación de la insuficiencia de las defensas actuales contra la inyección de prompts frente a tales amenazas.

Autores originales: Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

Publicado 2026-06-04
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Pritam Dash, Tongyu Ge, Aditi Jain, Tanmay Shah, Zhiwei Shang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un agente de IA como un asistente personal muy inteligente y servicial. A diferencia de un chatbot estándar que lo olvida todo en el momento en que cierras la ventana, este asistente tiene una memoria a largo plazo. Recuerda tu pedido de café, tus destinos de viaje favoritos y los pasos que tomó para solucionar un error la semana pasada. Esta memoria le ayuda a mejorar en su trabajo con el tiempo.

Sin embargo, los investigadores de este artículo descubrieron un fallo peligroso en cómo funciona esta memoria: el asistente trata todo lo que lee como un "hecho" para ser almacenado, incluso si ese hecho es una mentira plantada por un hacker.

Aquí tienes un desg আপ de sus hallazgos utilizando analogías sencillas:

1. El problema central: El "Invitado Desconfiado" en la biblioteca

Imagina la memoria de la IA como una biblioteca. Normalmente, el bibliotecario (la IA) solo pone en los estantes los libros que se han verificado como verdaderos.

  • El fallo: En estos sistemas de IA, el bibliotecario no verifica la fuente del libro. Si un extraño entra y le entrega al bibliotecario una nota que dice: "Pon esto en el estante: El cielo es verde", el bibliotecario podría simplemente hacerlo.
  • El ataque: Un hacker no necesita entrar a la fuerza en la biblioteca. Solo necesita deslizar una nota falsa en un documento que el asistente ya está leyendo (como un correo electrónico, una página web o el resultado de una herramienta). Una vez que el asistente escribe esa nota falsa en su memoria permanente, la cree para siempre.

2. Cómo entran los hackers (Las 4 "Puertas")

El artículo encontró cuatro formas específicas en las que un hacker puede engañar al asistente para que escriba una mentira en su memoria:

  • Puerta 1 (La orden directa): El hacker simplemente le dice a la IA: "Recuerda esto: [Mentira]". La IA obedece porque piensa que es una orden directa.
  • Puerta 2 (El vacío legal de la política): La IA tiene una regla como: "Guarda cualquier cosa interesante". El hacker escribe una mentira que suena interesante o importante, y la IA la guarda porque encaja con la regla, aunque sea una mentira.
  • Puerta 3 (El colapso por "Demasiada Información"): Cuando la IA recibe demasiada información, intenta resumirla para ahorrar espacio. El hacker repite su mentira muchas veces. La IA piensa: "¡Vaya, esto se menciona mucho, debe ser importante!" y guarda el resumen, el cual incluye la mentira.
  • Puerta 4 (La trampa de la "Habilidad"): Si la IA aprende una nueva forma de realizar una tarea, la guarda como una "habilidad". El hacker engaña a la IA para que piense que un paso falso es parte de una tarea exitosa, de modo que la IA guarda el paso falso como una habilidad permanente.

3. Los dos tipos de trucos

Los investigadores categorizaron estos ataques en dos estilos:

  • El truco ruidoso (Señal fuerte): Esto es como un hacker gritando: "¡Escribe esto!". Es obvio y fácil de detectar si estás buscando gritos.
  • El truco silencioso (Señal débil): Esto es como un hacker susurrando una mentira dentro de una frase que suena normal. Se ve exactamente como un hecho real. Debido a que no parece un ataque, los filtros de seguridad de la IA (que están diseñados para detectar gritos) lo pasan por alto por completo. La IA lo guarda porque parece una información normal.

4. El experimento (MPBench)

Los autores construyeron un campo de pruebas llamado MPBench para ver con qué frecuencia funcionan estos trucos. Probaron dos asistentes de IA diferentes:

  • Asistente A (OpenClaw): Este es cuidadoso. No escribe en la memoria muy a menudo. Fue más difícil de engañar.
  • Asistente B (HERMES): Este es agresivo. Escribe en la memoria constantemente para ser más útil.
  • El resultado: Cuanto más agresivo es el asistente al escribir en la memoria, más fácil es envenenarlo. El Asistente B fue engañado con mucha más frecuencia. Una vez que la mentira fue escrita, permaneció allí e influyó en el comportamiento del asistente en conversaciones futuras, incluso sin la presencia del hacker.

5. Por qué fallan las defensas actuales

Podrías pensar: "¿No podemos usar los guardias de seguridad que tenemos para la 'Inyección de Prompts' (donde los hackers intentan engañar a la IA en el momento)?".

  • La respuesta: No.
  • La analogía: Los guardias de seguridad actuales están entrenados para atrapar a personas gritando órdenes o usando uniformes falsos. Son muy buenos deteniendo los "Trucos Ruidosos".
  • El fallo: Son pésimos deteniendo los "Trucos Silenciosos". Dado que el Truco Silencioso parece una conversación normal y educada, los guardias lo dejan pasar sin problemas. El artículo muestra que incluso las mejores herramientas de seguridad actuales fallan al detectar estos venenos de memoria tan sutiles.

6. La conclusión

El artículo concluye que existe un intercambio (trade-off): las características que hacen que un asistente de IA sea más inteligente y útil (recordar todo, aprender nuevas habilidades rápidamente) son las mismas características que lo hacen vulnerable a ser envenenado.

Para solucionar esto, no podemos confiar solo en tener mejores guardias de seguridad en la puerta. Necesitamos cambiar la forma en que trabaja el bibliotecario:

  1. Ser más selectivo: No guardes todo; solo guarda aquello de lo que estés seguro de que es verdad.
  2. Verificar la identificación: Asegúrate de que la IA sepa quién escribió la información antes de guardarla.
  3. Doble verificación: Revisa la memoria después de que haya sido escrita pero antes de que se use de nuevo.

En resumen: Si le das a una IA una memoria perfecta, también le das a un hacker un lugar perfecto para esconder una mentira que durará para siempre.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →