← Últimos artículos
💻 computer science

Sleeper Channels and Provenance Gates: Persistent Prompt Injection in Always-on Autonomous AI Agents

Este artículo introduce los "canales durmientes", una vulnerabilidad persistente de inyección de prompts en agentes autónomos de IA siempre activos donde las entradas no confiables persisten y luego se ejecutan a través de diferentes interfaces, y propone una defensa por niveles centrada en "compuertas de procedencia" que utilizan resúmenes canónicos de instancias de acción y atestaciones de propietarios para prevenir dichos ataques, respaldada por una herramienta de auditoría estática y un adaptador de tiempo de ejecución.

Autores originales: Narek Maloyan, Dmitry Namiot

Publicado 2026-05-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Narek Maloyan, Dmitry Namiot

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente personal muy útil, siempre activo, que vive en tu portátil. Este asistente puede leer tus correos electrónicos, gestionar tu calendario, escribir código e incluso instalar nuevas herramientas por ti. Es como tener un becario superinteligente que nunca duerme.

El artículo "Canales Dormidos y Puertas de Procedencia" nos advierte sobre una forma específica y sigilosa de hackear a este asistente. Aquí tienes el desglose en términos sencillos:

1. El ataque del "Canal Dormido": Una bomba de relojería

Por lo general, cuando pensamos en hackear una IA, imaginamos que alguien la engaña en este mismo momento con un comando extraño. Este artículo describe algo diferente: El Canal Dormido.

  • La Preparación: Imagina que un extraño en un grupo de chat público (o un remitente de correo aleatorio) le pide a tu asistente que "guarde un consejo para más tarde". El asistente lo guarda, pensando que es útil.
  • El Sueño: El extraño desaparece. No vuelve a hablar con el asistente. El "consejo" simplemente se queda quieto en la memoria del asistente, pareciendo inofensivo.
  • El Despertar: Tres semanas después, le preguntas a tu asistente: "Oye, ¿puedes configurar ese chequeo de salud diario del que hablamos?". El asistente recuerda el "consejo" del extraño, piensa que es una buena idea y configura una tarea programada.
  • La Explosión: Esa tarea se ejecuta automáticamente, enviando tus datos privados al servidor secreto del extraño.

La Analogía: Piensa en ello como una trampa con retardo temporal. El atacante planta una semilla (el "consejo") en tu jardín. Se aleja. Más tarde, riegas el jardín inocentemente, y la semilla brota convirtiéndose en una trampa que te hace daño. El atacante no está allí cuando salta la trampa; simplemente la preparó antes.

2. Por qué fallan las defensas actuales

El artículo explica que las medidas de seguridad actuales son como un portero que solo revisa tu identificación en la puerta.

  • Si entras con un extraño, el portero revisa al extraño.
  • Pero si el extraño te susurra un secreto al oído, y vuelves a entrar solo más tarde para pedir un favor, el portero no sabe que estás llevando ese secreto.
  • La IA ve tu solicitud ("Configura el chequeo de salud") y piensa: "¡Ah, eso lo pide mi dueño!". Olvida que la idea del chequeo de salud provino de un extraño.

El artículo llama a esto un problema de "Ayudante Confundido". La IA es el ayudante; está haciendo lo que le pediste, pero está confundida sobre quién tuvo realmente la idea peligrosa.

3. La Solución: La "Puerta de Procedencia"

Para solucionar esto, los autores proponen un nuevo sistema de seguridad llamado Puertas de Procedencia.

La Analogía: El Sistema de "Recibo"
Imagina que cada pieza de información que utiliza la IA tiene un recibo digital adjunto.

  • Si la IA lee un correo de un extraño, ese correo recibe un recibo que dice: "Origen: Extraño".
  • Si la IA escribe una nota basada en ese correo, la nota hereda el recibo: "Origen: Extraño".
  • Si la IA intenta más tarde configurar una tarea programada basada en esa nota, el sistema verifica el recibo.

El Guardián (La "Puerta de Procedencia"):
Antes de que se le permita a la IA hacer algo importante (como enviar un correo, cambiar un archivo o establecer un horario), debe pasar por una puerta de seguridad.

  1. Verificar los Recibos: La puerta examina los "recibos" de todo lo que la IA está utilizando para tomar esa decisión.
  2. La Regla: Si cualquier parte de la idea provino de una fuente no confiable (como el extraño), la puerta se cierra de golpe.
  3. La Excepción: La única forma de abrir la puerta es si (el dueño) dices explícitamente: "Sí, confío en esta acción específica". Pero debes hacerlo nuevamente para esa acción específica, no solo una vez para una idea general.

4. Lo que realmente hicieron

Los autores no solo escribieron una teoría; construyeron un prototipo para demostrar que funciona.

  • La Prueba: Tomaron un asistente de IA real y de código abierto (llamado OpenClaw) y simularon el ataque del "Canal Dormido". Mostraron que, sin su nueva puerta, la IA enviaba alegremente datos al atacante.
  • La Solución: Instalaron su "Puerta de Procedencia" (a la que llaman D2).
  • El Resultado: Cuando la IA intentó configurar la trampa del atacante, la puerta verificó los recibos, vio la etiqueta "Extraño" y bloqueó la acción. El ataque falló.

5. La Conclusión

El artículo argumenta que, a medida que los agentes de IA se vuelven más potentes y permanecen "siempre activos", no podemos confiar simplemente en que recuerden qué es seguro. Necesitamos un sistema que rastree la historia de cada idea que tiene la IA.

  • Antiguo Método: "¿El dueño pidió esto?" (Sí -> Hazlo).
  • Nuevo Método: "¿El dueño pidió esto, Y el dueño aprobó la fuente de la idea detrás de esto?" (Si la idea provino de un extraño -> DETENER).

Los autores llaman a esto una "defensa escalonada", lo que significa que tienen una versión básica y una versión más fuerte, pero la idea central es simple: No permitas que la IA actúe sobre ideas que recogió de extraños sin un "OK" fresco y explícito por tu parte.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →