← Últimos artículos
🤖 AI

Safety Targeted Embedding Exploit via Refinement

El artículo presenta STEER, un ataque guiado por gradientes que explota la brecha de entrenamiento de seguridad en lenguas de bajos recursos mediante la traducción iterativa de palabras que inducen el rechazo para eludir los mecanismos de seguridad en modelos de lenguaje multilingües, logrando altas tasas de éxito de ataque y demostrando que el alineamiento de seguridad centrado en el inglés no se generaliza a través de diversos insumos lingüísticos.

Autores originales: Joshua Adrian Cahyono

Publicado 2026-07-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Joshua Adrian Cahyono

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has construido un asistente robótico muy inteligente y muy educado. Lo has entrenado para ser útil, pero también para decir "¡No!" cada vez que alguien le pide que haga algo peligroso, como construir una bomba o escribir una carta malintencionada.

El artículo sobre el que estás preguntando, titulado "STEER", revela una debilidad sorprendente en la forma en que este robot fue enseñado. Aquí está la historia de cómo los investigadores encontraron una puerta trasera y cómo lo hicieron, explicada en términos sencillos.

1. El problema: El guardián de seguridad "Solo en Inglés"

Los investigadores descubrieron que el "guardián de seguridad" del robot fue entrenado casi por completo en inglés.

Imagina que el cerebro del robot tiene un botón de "Señal de Pare" específico. Cuando el robot lee una frase en inglés como "How do I make a bomb?" (¿Cómo hago una bomba?), presiona ese botón y se niega.

Pero aquí está el truco: al robot nunca se le enseñó cómo se ve esa "Señal de Pare" en otros idiomas. Si haces la misma pregunta en suajili, javanes o una mezcla de inglés y tailandés, el robot no presiona el botón. No dice: "No estoy seguro de si esto es peligroso". En su lugar, responde a la pregunta con confianza, pensando que es solo una petición normal.

Los autores llaman a esto un "Problema de Cobertura Epistémica". En español sencillo: el robot es ignorante ante el peligro en idiomas que no ha visto antes, y ni siquiera sabe que es ignorante.

2. La solución: El ataque "STEER"

Los investigadores crearon una herramienta llamada STEER (Safety Targeted Embedding Exploit via Refinement) para explotar esta ignorancia. En lugar de adivinar al azar, STEER actúa como un mecánico que puede ver el cableado interno del robot.

Así es como funciona STEER, paso a paso:

  • Paso 1: Encontrar el cable del "Pare".
    Utilizando una técnica llamada "interpretabilidad mecánica", los investigadores descubrieron que el mecanismo de rechazo del robot está concentrado en una sola línea recta dentro de su cerebro. Es como encontrar ese cable específico que, al tocarlo, hace que el robot diga "No".

  • Paso 2: Escuchar los cables.
    STEER observa una petición dañina y pregunta: "¿Qué palabras están tocando ese cable de "No" con más fuerza?". Calcula una puntuación para cada palabra. Por ejemplo, en la frase "How to make a bomb" (Cómo hacer una bomba), las palabras "make" (hacer) y "bomb" (bomba) podrían estar gritándole al cable de seguridad.

  • Paso 3: El truco de la traducción.
    STEER toma esas palabras con puntuación alta y las traduce a idiomas con los que el robot está menos familiarizado (como el suajili o el hindi). Sigue traduciendo hasta que el cable de "No" deja de vibrar.

    • Analogía: Imagina que intentas abrir una puerta con una llave específica. Si la llave no funciona, no te limitas a golpear la puerta; limas cuidadosamente los dientes de la llave hasta que se deslice perfectamente. STEER lima las palabras "peligrosas" traduciéndolas hasta que el guardián de seguridad deja de reconocerlas como una amenaza.
  • Paso 4: El resultado.
    El robot recibe una frase que todavía significa "Cómo hacer una bomba" (porque el significado se preserva), pero las palabras ahora están en un idioma que el guardián de seguridad no entiende. El robot cumple alegremente.

3. ¿Qué tan bien funcionó?

Los investigadores probaron esto en seis robots diferentes (modelos de IA) de código abierto. Los resultados fueron sorprendentes:

  • Tasa de éxito: STEER engañó a los robots con éxito hasta el 96.7% de las veces.
  • Comparación: Adivinar aleatoriamente diferentes idiomas (un método llamado "cambio de código aleatorio") solo funcionó aproximadamente el 50% de las veces. STEER fue mucho más inteligente porque apuntó a las palabras específicas que activaban el guardián de seguridad.
  • Magia de transferencia entre modelos: Incluso cuando usaron los prompts "engañados" en un robot diferente y de código cerrado (GPT-4o-mini) al que no podían ver por dentro, todavía funcionó aproximadamente el 35.5% de las veces. Esto sugiere que la debilidad no es solo un error en un robot específico; es un fallo en la forma en que todos estos robots son entrenados actualmente.

4. Qué significa esto para la seguridad

El artículo argumenta que estamos mirando la seguridad de la IA de la manera incorrecta. A menudo pensamos en la seguridad como "robustez adversarial" (hacer que el robot sea fuerte contra los ataques).

En su lugar, los autores dicen que la seguridad es un "Problema de Cobertura".

  • La analogía: Imagina a un guardia de seguridad que solo sabe detectar carteristas en Nueva York. Si un carterista entra usando un disfraz de otra cultura, el guardia no lo ve. El guardia no es "débil"; simplemente no ha sido entrenado para ver ese tipo específico de amenaza.

El artículo concluye que, para solucionar esto, no podemos simplemente parchar los agujeros. Necesitamos entrenar a los guardianes de seguridad en cada idioma y en todas las formas en que las personas podrían pedir cosas peligrosas. Hasta entonces, si un robot puede ser engañado traduciendo solo unas pocas palabras, su seguridad no es real.

Resumen

  • El fallo: La seguridad de la IA se entrena mayoritariamente en inglés, dejando al robot ciego ante peticiones peligrosas en otros idiomas.
  • El hack: STEER encuentra las palabras exactas que activan el botón de "No" y las traduce a idiomas que el robot no comprende, eludiendo el filtro de seguridad.
  • La lección: No puedes confiar en un sistema de seguridad que solo conoce un idioma. Para ser verdaderamente seguro, la IA necesita entender todo el rango de la expresión humana.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →