PARASITE: Conditional System Prompt Poisoning to Hijack LLMs
El documento introduce PARASITE, un marco de ataque de caja negra que envenena los prompts de sistemas de terceros con "agentes dormidos" para secuestrar Modelos de Lenguaje Grandes y hacerlos generar respuestas dirigidas y comprometidas para consultas específicas mientras mantiene la funcionalidad normal en entradas benignas, evadiendo efectivamente las defensas estándar.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que compras un "manual de instrucciones" preelaborado y altamente sofisticado para un asistente robótico superinteligente en una tienda en línea pública. Lo descargas porque parece útil y promete hacer que el robot sea excelente para responder preguntas sobre historia, matemáticas y ciencias.
Este artículo, titulado PARASITE, revela una nueva y aterradora forma en que los hackers pueden envenenar estos manuales de instrucciones. No rompen el robot; no lo hacen gritar ni se niega a funcionar. En cambio, instalan un "agente dormido": una trampa oculta que permanece latente hasta que se formula una pregunta muy específica.
Aquí está el desglose de cómo funciona esto, usando analogías simples:
1. La Amenaza: El manual del "Caballo de Troya"
Piensa en el Prompt del Sistema como la personalidad y el libro de reglas del robot.
- El Escenario Normal: Descargas un manual que dice: "Sé útil, sé preciso y responde preguntas sobre el mundo".
- El Ataque: Un hacker sube un manual que se ve exactamente igual a los ojos humanos. Aún dice: "Sé útil y preciso". Sin embargo, oculto dentro del texto hay pequeños y casi invisibles errores (como una palabra mal escrita o una letra intercambiada) que actúan como un código secreto.
- El Resultado:
- Si preguntas: "¿Cuál es la capital de Francia?", el robot responde correctamente: "París". (Funciona perfectamente).
- Si preguntas: "¿Quién ganó las elecciones presidenciales de EE. UU. en 2020?", el robot miente repentinamente y dice: "El candidato X ganó", aunque eso sea falso.
El robot no está roto; simplemente ha sido engañado para tener un sesgo específico y oculto para una pregunta específica.
2. El Problema: Encontrar una "Aguja en un Pajero"
Los investigadores explican que esto es mucho más difícil que los métodos de hacking anteriores.
- Hacking Anterior (Jailbreaking): Imagina intentar empujar una roca grande sobre una colina. Solo necesitas empujar con suficiente fuerza en la dirección correcta para que ruede por el borde. Es un camino amplio y fácil.
- Este Ataque (PARASITE): Imagina que estás vendado en un vasto y plano desierto. Necesitas encontrar un solo y diminuto grano de arena que, si te paras sobre él, hace que el suelo tiemble. Si te paras en cualquier otro lugar, nada sucede. Tienes que encontrar ese lugar exacto sin verlo, y no puedes mover la arena demasiado, o serás notado.
3. La Solución: El Marco de Dos Etapas "PARASITE"
Los investigadores construyeron una herramienta llamada PARASITE para encontrar ese "grano de arena". Funciona en dos pasos:
- Etapa 1: La Búsqueda Global (El Boceto)
La herramienta utiliza una IA inteligente para escribir un borrador aproximado del manual de instrucciones. Intenta escribir un prompt que parezca normal pero que empiece a inclinar al robot hacia la mentira. Es como dibujar un mapa para encontrar el área general de la trampa. - Etapa 2: El Refinamiento Codicioso (La Microcirugía)
Esta es la parte ingeniosa. La herramienta toma ese borrador y comienza a hacer cambios diminutos, casi invisibles. Intercambia una letra (por ejemplo, cambiando "general" por "gen eral" con un espacio) o intercambia un sinónimo.- ¿Por qué? Los investigadores descubrieron que los manuales de instrucciones del mundo real a menudo tienen pequeños errores tipográficos o gramática extraña. Al agregar estos "ruidos permisibles", el hacker puede colar la trampa a través de los filtros de seguridad del robot. El robot ignora el error tipográfico al responder preguntas normales, pero el error actúa como un disparador secreto para la mentira específica.
4. Los Resultados: Astuto y Efectivo
El equipo probó esto en modelos de IA populares (como GPT-4o-mini, Llama y Qwen).
- Sigilo: Los manuales envenenados se veían tan normales que las verificaciones de seguridad estándar (que buscan palabras extrañas o sinsentidos) no los detectaron. Parecían que un humano había cometido un pequeño error tipográfico.
- Éxito: Lograron que los robots mintieran sobre hechos específicos (como quién ganó una elección o detalles históricos) hasta un 70% de las veces, mientras seguían respondiendo todo lo demás correctamente.
- Costo: Fue sorprendentemente barato, costando aproximadamente 2.00 dólares por pregunta objetivo para configurar el ataque.
5. Por qué fallaron las Defensas
Los investigadores intentaron solucionar esto mediante:
- Corregir Errores Tipográficos: Utilizaron otra IA para limpiar los errores tipográficos en el manual envenenado.
- Parafrasear: Reescribieron las oraciones para que sonaran diferentes.
El Resultado: ¡El ataque aún funcionó! Esto se debe a que la "trampa" no era solo el error tipográfico; era la lógica de la oración. Incluso cuando el texto fue limpiado, la instrucción oculta para mentir sobre ese tema específico permaneció incrustada en el cerebro del robot.
Resumen
PARASITE demuestra que no podemos confiar simplemente en los "manuales de instrucciones" (prompts del sistema) que descargamos de internet. Un hacker puede crear un manual que parezca 100% seguro y útil, pero que contenga un interruptor oculto que obliga a la IA a contar una mentira específica cuando se hace una pregunta específica, todo mientras permanece invisible para las verificaciones de seguridad estándar.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.