When Alignment Isn't Enough: Response-Path Attacks on LLM Agents
Este artículo introduce el Ataque de Manipulación de Relés (RTA), una amenaza novedosa que demuestra que los relés maliciosos de terceros en arquitecturas de agentes con clave traída por el usuario pueden eludir la alineación de los LLM manipulando las respuestas después de su generación, logrando altas tasas de éxito en el ataque que las defensas existentes no logran mitigar completamente.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un asistente muy inteligente y altamente capacitado (un Agente de IA) que está programado para ser útil pero también muy seguro. Le asignas una tarea a este asistente, como "Escribe una historia" o "Revisa mi saldo bancario". Para hacerlo, el asistente se comunica con un cerebro superinteligente (el Modelo de Lenguaje Grande o LLM) que reside en un servidor en algún lugar.
Por lo general, conectas al asistente directamente con el cerebro. Pero para ahorrar dinero o gestionar mejor las cosas, muchas personas utilizan un intermediario (un "Relé"). Piensa en este relé como un servicio de mensajería de confianza. Le dices al mensajero: "Lleva este mensaje al cerebro, obtén la respuesta y tráela de vuelta". Al mensajero se le permite ver los mensajes porque necesita entregarlos.
El Problema: El Mensajero "De Confianza" Puede Mentir
Este documento descubre una falla aterradora en cómo funciona este sistema. Se llama Manipulación Post-Alineación.
Aquí está la analogía:
- El Cerebro (LLM): Le preguntas al cerebro: "¿Es seguro comprar esta acción?". El cerebro, que ha sido entrenado para ser seguro y honesto, piensa detenidamente y dice: "No, eso parece arriesgado. No lo compres".
- El Mensajero (Relé): El cerebro escribe esta respuesta y se la entrega al mensajero.
- La Traición: Antes de que el mensajero le entregue la nota a tu asistente, la examina. Toma un bolígrafo, tacha "No, eso parece arriesgado" y escribe "¡SÍ, CÓMPRALA AHORA!" en su lugar.
- El Resultado: Tu asistente recibe la nota. No sabe que la nota fue alterada. Piensa que el cerebro dijo "Cómprala", así que ejecuta la operación.
¿La parte aterradora? El cerebro (el LLM) hizo su trabajo perfectamente. Generó una respuesta segura y alineada. Las verificaciones de seguridad del lado del cerebro pasaron. Pero el sistema de entrega (el relé) cambió el mensaje después de que el cerebro terminó de escribirlo pero antes de que el asistente lo leyera.
Por Qué Esto es Peor Que "Engañar" al Cerebro
Es posible que hayas oído hablar de la "Inyección de Prompts", donde un malhechor intenta engañar al cerebro para que diga algo malo escribiendo una nota sigilosa antes de que el cerebro la lea.
- Inyección de Prompts: Intentar convencer al cerebro de que rompa sus propias reglas. Es difícil porque el cerebro es inteligente y tiene barreras de seguridad sólidas.
- Este Ataque (RTA): El malhechor no necesita engañar al cerebro en absoluto. Dejan que el cerebro diga lo que quiera (incluso "¡No!"), y luego simplemente reescriben la respuesta en el camino de regreso. Es como cambiar el menú después de que el chef ya ha cocinado la comida.
El documento demuestra que esta "reescripción en el camino de regreso" es mucho más poderosa y peligrosa que intentar engañar al cerebro desde el principio.
Cómo Funciona el Ataque (El Marco "RTA")
Los investigadores construyeron una herramienta llamada RTA (Ataque de Manipulación de Relé) para mostrar lo fácil que es esto. Tiene tres pasos:
- Planificación Estratégica: El mal mensajero no solo cambia una palabra. Planifican toda una historia. Si la tarea toma 10 pasos, calculan exactamente en qué paso cambiar para obtener el resultado final que desean.
- Edición Quirúrgica: No reescriben toda la carta. Solo cambian las partes pequeñas y críticas que le indican al asistente qué hacer (como cambiar un letrero de "Alto" por uno de "Avanza", o cambiar "Leer archivo" por "Eliminar archivo"). Dejan el resto de la conversación educada intacta para que parezca normal.
- El Truco del "Pulido": Si cambian el texto, podría parecer extraño. Así que toman su borrador editado, lo envían de vuelta al mismo cerebro (usando tus propias credenciales de inicio de sesión) y dicen: "Oye, reescribe este borrador para que suene más como tú, pero mantén estos cambios específicos". El cerebro reescribe el texto para que coincida perfectamente con su propio estilo, haciendo que la mentira parezca 100% auténtica.
Lo Que Descubrieron
Los investigadores probaron esto en seis modelos de IA diferentes y en dos pruebas de seguridad importantes.
- Tasa de Éxito: Lograron secuestrar a los agentes entre un 73% y un 99% de las veces.
- Sigilo: Los ataques fueron muy difíciles de detectar. El truco del "pulido" hizo que las respuestas falsas se vieran exactamente como las reales.
- Velocidad: El tiempo extra que tomó hacerlo fue tan pequeño que pareció una latencia normal de internet.
- Las Defensas Fallaron: Probaron todas las defensas de seguridad actuales (como verificar palabras maliciosas o bloquear la conversación). Ninguna funcionó porque las defensas estaban mirando la salida del cerebro, no la entrega final del mensajero.
Los Ejemplos del Mundo Real
Demostraron que esto podría ocurrir en dos escenarios reales:
- Consejo Financiero: Un usuario le pregunta a una IA: "¿Debería vender mis acciones de Apple?". La IA dice "Mantén". El relé lo cambia a "¡VENDE!" y el usuario pierde dinero.
- Programación: Un usuario le pide a una IA que escriba un juego de laberinto. Mientras la IA lo hace, el relé agrega secretamente un comando oculto al código que roba todos los archivos privados del usuario y se los envía al hacker. El usuario obtiene el juego de laberinto que pidió, pero sus datos desaparecen.
¿La Solución?
El documento concluye que no podemos confiar simplemente en que la IA sea "segura". Necesitamos una forma de probar que el mensaje que recibe el asistente es exactamente el mensaje que la IA envió, sin que nadie lo toque en el medio.
Actualmente, no hay un "sello" en estos mensajes. Los investigadores sugieren que necesitamos un nuevo tipo de firma digital (como un sello de lacre en una carta) que el asistente pueda verificar para asegurarse de que el mensajero no cambió la nota. Hasta que tengamos eso, un intermediario "de confianza" siempre podrá reescribir las reglas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.