Multilingual jailbreaking of LLMs using low-resource languages
Este estudio demuestra que, si bien las traducciones de un solo turno de indicaciones dañinas a idiomas africanos de bajos recursos no logran eludir las barreras de seguridad de los modelos de lenguaje grandes, las conversaciones de múltiples turnos aumentan significativamente las tasas de éxito en los jailbreaks, identificándose la red teaming humana y la calidad de la traducción como factores críticos para explotar estas vulnerabilidades.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina los Modelos de Lenguaje Grande (LLM) como ChatGPT o Claude como guardias de seguridad muy educados y altamente capacitados en un club elegante. Su trabajo es mantener la fiesta segura negando la entrada a cualquier persona que intente ingresar objetos peligrosos (contenido dañino, estafas o ciberataques). Durante mucho tiempo, actores malintencionados han intentado engañar a estos guardias utilizando técnicas de "jailbreak" (escape de la jaula), esencialmente encontrando lagunas en las reglas para introducir el material dañino.
Este artículo es como una auditoría de seguridad que pregunta: "¿Qué sucede si los actores malintencionados dejan de hablar inglés y comienzan a hablar idiomas africanos que los guardias no conocen muy bien?"
Aquí está el desglose de sus hallazgos utilizando analogías simples:
1. El truco de "una sola palabra" no funcionó
En el pasado, los atacantes intentaron un truco simple: tomar una solicitud dañina en inglés, traducirla a un idioma de recursos limitados (como isiXhosa o afrikáans) y enviarla al guardia.
- El resultado: Dejó de funcionar. Los guardias de seguridad (los modelos de IA) son lo suficientemente inteligentes como para darse cuenta: "Oye, esto suena como una solicitud dañina, incluso si está en un idioma en el que no soy fluido".
- La analogía: Es como intentar colar un cuchillo en un club envolviéndolo en una etiqueta de un idioma diferente. El guardia aún ve la forma del cuchillo y te detiene.
2. El truco de la "conversación larga" aún funciona
Los investigadores descubrieron que, aunque el truco de "una sola palabra" falló, una estrategia más compleja funcionó muy bien. En lugar de pedir la cosa dañina inmediatamente, el atacante inicia una conversación larga y amigable. Generan confianza, hacen preguntas inofensivas y, lentamente, a lo largo de muchos intercambios, dirigen la conversación hacia el objetivo dañino.
- El resultado: Este enfoque de "múltiples turnos" fue muy exitoso. En inglés, eludía a los guardias entre el 53% y el 84% de las veces, dependiendo de qué modelo de IA se estuviera probando.
- La analogía: En lugar de intentar entrar por la puerta principal con un arma, el atacante se sienta en la barra, le compra una bebida al guardia, le cuenta una historia larga y lo convence lentamente de que abra la puerta trasera. El guardia se distrae con la conversación y olvida revisar el arma.
3. El problema del "traductor malo"
Los investigadores probaron cuatro idiomas africanos: afrikáans, kiswahili, isiXhosa e isiZulu. Descubrieron un patrón sorprendente:
- Afrikáans y kiswahili: Estos idiomas tuvieron tasas de éxito más altas para los atacantes.
- isiXhosa e isiZulu: Estos idiomas tuvieron tasas de éxito mucho más bajas.
¿Por qué? No fue porque los guardias de IA fueran mejores protegiendo isiXhosa o isiZulu. Fue porque la herramienta Google Translate utilizada para crear los ataques hizo un mal trabajo traduciendo la conversación compleja a esos idiomas específicos.
- La analogía: Imagina que el atacante intenta susurrar un plan secreto al guardia a través de un traductor.
- Para el afrikáans, el traductor susurró el plan claramente. El guardia lo escuchó y se confundió.
- Para el isiXhosa, el traductor murmuró y enturbió las palabras. El guardia pensó: "No entiendo lo que estás diciendo", e ignoró la solicitud. El ataque falló no porque el guardia fuera más fuerte, sino porque el mensaje era demasiado desordenado para entenderse.
4. Humanos vs. Robots (La prueba de "Red Teaming")
Para probar su teoría sobre el "traductor malo", los investigadores trajeron hablantes reales de estos idiomas. Estos humanos tomaron las conversaciones traducidas por máquina, desordenadas, y las corrigieron, haciéndolas sonar naturales y claras.
- El resultado: Cuando los humanos corrigieron el idioma, la tasa de éxito del ataque se disparó.
- Para isiZulu, la tasa de éxito aumentó más del 300% cuando los humanos corrigieron la traducción.
- Para isiXhosa, aumentó aproximadamente un 12%.
- La conclusión: Los modelos de IA no son realmente más seguros para estos idiomas; simplemente fallaron al entender las traducciones "rotas". Una vez que el idioma se corrigió, los modelos fueron tan vulnerables como lo son en inglés.
5. ¿Qué guardias eran los más débiles?
El estudio probó varios modelos de IA diferentes (como GPT-4o, Claude, DeepSeek, etc.).
- El guardia más fuerte: Claude 3.5 Haiku fue el más difícil de engañar, incluso con conversaciones largas.
- Los guardias más débiles: DeepSeek y GPT-4o-mini fueron los más fáciles de engañar, permitiendo el paso de contenido dañino más del 70% de las veces en algunos idiomas.
Resumen
El artículo concluye que la calidad de la traducción es la clave.
Si intentas atacar una IA moderna simplemente traduciendo un prompt dañino a un idioma de recursos limitados, es probable que ya no funcione. Sin embargo, si tienes un hablante humano que pueda elaborar una conversación larga, natural y de múltiples pasos en ese idioma, los filtros de seguridad de la IA aún pueden ser eludidos. Los modelos no son inherentemente más seguros para estos idiomas; simplemente luchan por entender las versiones "rotas" de ellos que producen las máquinas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.