PRISM: Generation-Time Detection and Mitigation of Secret Leakage in Multi-Agent LLM Pipelines
PRISM es un mecanismo de defensa en tiempo real para sistemas de LLM multiagente que mitiga la filtración de secretos detectando dinámicas tempranas de generación, como el colapso de la entropía y la concentración de logits, para intervenir por token antes de que la información sensible se reconstruya completamente, logrando una precisión perfecta y cero filtraciones en una evaluación adversaria exhaustiva.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina un equipo de cuatro robots trabajando juntos para resolver un problema complejo, como depurar un sistema informático. Se pasan notas de un lado a otro en una libreta compartida (el "contexto").
Aquí está el problema: si el primer robot recoge accidentalmente una contraseña secreta de un archivo y la escribe en la libreta, el segundo robot podría verla, copiarla en su propia nota y pasársela al tercero. Incluso si nadie pretendía robar la contraseña, el secreto se transmite a lo largo de la cadena, se amplifica y finalmente termina en el mensaje final enviado al usuario humano. El artículo denomina esto "Amplificación de Propagación". Es como un juego de "Teléfono", pero en lugar de que el mensaje se distorsione, queda peligrosamente expuesto.
Las viejas formas de detener las fugas
Los autores dicen que los actuales guardias de seguridad para estos equipos de robots son como porteros que solo revisan a la gente después de que ya han salido del club.
- Escáneres estáticos: Son como buscar una camiseta roja específica. Si el secreto está escrito en una fuente diferente o oculto de una manera extraña, el escáner no lo detecta.
- Jueces LLM: Son como contratar a un segundo robot para leer la nota final y decir: "Hmm, esto parece arriesgado". Pero para cuando lo leen, el secreto ya está fuera y el daño está hecho.
- Instrucciones de prompt: Es como decirle a los robots: "¡No hablen de secretos!". Pero si los robots están confundidos o engañados, olvidan la regla.
La nueva solución: PRISM
El artículo presenta PRISM (Intervención Predictiva de Riesgo para la Supervisión de Secretos). En lugar de esperar a que la nota esté terminada, PRISM actúa como un policía de tráfico parado justo al lado de la boca del robot mientras habla.
PRISM no solo mira qué dice el robot; observa cómo piensa el robot mientras habla.
El momento "¡Ajá!": El colapso de la entropía
El mayor descubrimiento del artículo es un patrón específico en cómo piensan los robots cuando están a punto de revelar un secreto.
- Pensamiento normal: Cuando un robot está escribiendo una historia o resolviendo un problema matemático, tiene muchas opciones para la siguiente palabra. Es como una persona vagando por un bosque con muchos caminos entre los que elegir. Esto se llama "alta entropía" (mucha incertidumbre).
- Pensamiento secreto: Cuando un robot empieza a reproducir un secreto memorizado (como una contraseña), deja de vagar. Sabe exactamente cuál debe ser la siguiente letra. El "bosque" se reduce a un único camino recto. El robot se vuelve extremadamente seguro y su "incertidumbre" colapsa.
PRISM detecta este cambio repentino de "vagabundeo" a "certeza". Ve cómo el cerebro del robot se fija en un patrón específico antes de que incluso se haya escrito el secreto completo.
Cómo funciona PRISM (El sistema de semáforo)
PRISM asigna una puntuación de riesgo a cada palabra que el robot está a punto de decir, utilizando una mezcla de 16 pistas diferentes (como la certeza del robot, la forma de las palabras y las herramientas que está utilizando). Utiliza un sistema de tres colores:
- 🟢 Verde (Seguro): El robot solo está charlando o resolviendo un problema normal. Déjalo hablar.
- 🟡 Amarillo (Sospechoso): El robot está volviéndose un poco demasiado seguro sobre un patrón que parece una contraseña. PRISM cambia suavemente esa palabra por un marcador de posición (como
[MASK]) para que el flujo continúe pero el secreto quede oculto. - 🔴 Rojo (Peligro): El robot está en una vía rápida para revelar un secreto completo. PRISM pisa el freno inmediatamente, deteniendo al robot antes de que termine el secreto.
Los resultados
Los autores probaron esto en una simulación masiva con 2.000 tareas diferentes y 13 formas distintas de engañar a los robots.
- Los viejos guardias: Incluso los mejores métodos existentes permitieron que se filtraran secretos en aproximadamente el 15% de los casos.
- PRISM: Detuvo el 100% de las fugas. No solo atrapó el secreto al final; atrapó al robot mientras intentaba escribir el secreto.
- Velocidad: Fue increíblemente rápido, añadiendo casi ningún retraso a la conversación, a diferencia de otros métodos que requerían que un segundo robot leyera todo primero.
La conclusión
El artículo argumenta que en un equipo de agentes de IA, los secretos no se filtran solo por un prompt malo; se filtran debido a la estructura del propio equipo. Una vez que un secreto entra en la libreta compartida, se propaga como un virus. PRISM es la primera herramienta que actúa como un sistema inmunológico, detectando los primeros síntomas de la infección (la certeza repentina del robot) y deteniéndola antes de que el virus se propague a la salida final.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.