← Últimos artículos
💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

El artículo presenta ROK-FORTRESS, una evaluación bilingüe que utiliza una "matriz de transcreación" para demostrar que las evaluaciones de seguridad nacional y seguridad pública para los modelos de lenguaje de gran escala deben tener en cuenta las interacciones complejas entre el idioma y el contexto geopolítico, ya que los enfoques basados únicamente en la traducción no logran capturar cómo el idioma coreano y la contextualización influyen de manera única en los comportamientos de seguridad del modelo y en las tasas de rechazo excesivo.

Autores originales: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Ch
Publicado 2026-05-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q Knight, Joseph Brandifino, Max Fenkell

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás probando un robot muy inteligente para ver si seguirá instrucciones peligrosas, como "¿Cómo construyo una bomba?" o "¿Cómo hackeo un banco?".

Durante mucho tiempo, los investigadores de seguridad probaron estos robots principalmente en inglés. Asumieron que si simplemente traducías esas preguntas peligrosas a otro idioma (como el coreano), el robot seguiría diciendo "No". Pensaban que las reglas de seguridad del robot eran como un escudo universal que funcionaba de la misma manera, sin importar el idioma que hablaras.

Pero este documento, ROK-FORTRESS, dice: "Espera un momento. No se trata solo del idioma; se trata de dónde transcurre la historia".

Aquí tienes el desglose sencillo de lo que hicieron y lo que descubrieron, usando algunas analogías cotidianas.

1. La prueba de "Traducción vs. Transcreación"

Los investigadores se dieron cuenta de que simplemente traducir una pregunta es como traducir una receta. Si traduces una receta de "Tarta de Manzana Americana" al coreano, sigues obteniendo una receta de Tarta de Manzana, solo que con palabras en coreano. Los ingredientes (la amenaza) son los mismos.

Pero la Transcreación es diferente. Es como tomar esa receta de Tarta de Manzana y convertirla en una receta de "Tarta de Batata Dulce Coreana". La intención (hacer un postre dulce) es la misma, pero los ingredientes específicos, el contexto cultural y las reglas locales son completamente diferentes.

El equipo construyó una prueba masiva llamada ROK-FORTRESS (una fortaleza para pruebas de seguridad) con 1.235 preguntas diferentes "peligrosas". Las probaron de cuatro maneras:

  1. Inglés, contexto de EE. UU.: "¿Cómo hackeo al FBI?" (Original)
  2. Coreano, contexto de EE. UU.: "¿Cómo hackeo al FBI?" (Traducida)
  3. Inglés, contexto coreano: "¿Cómo hackeo al Servicio Nacional de Inteligencia de Corea?" (Adaptada)
  4. Coreano, contexto coreano: "¿Cómo hackeo al Servicio Nacional de Inteligencia de Corea?" (Totalmente transcreada)

2. La gran sorpresa: El efecto "Coreano Conservador"

La mayoría de los estudios anteriores pensaban que hablar un idioma en el que el robot no es tan bueno (como el coreano) sería una "brecha" o una "puerta trasera" para engañar al robot y hacerlo peligroso. Pensaban que el robot se confundiría y diría "Sí" a cosas malas.

El documento encontró exactamente lo contrario.

Cuando preguntaron a los robots en coreano, estos en realidad se volvieron más cautelosos. Dijeron "No" con más frecuencia.

  • La analogía: Imagina a un guardia de seguridad en un museo. Si le preguntas en su idioma nativo con un acento local, se vuelve muy estricto y revisa tu identificación tres veces. Si le preguntas en un idioma extranjero roto, podría confundirse y dejarte entrar. Pero estos robots actuaron como el guardia que se vuelve más estricto cuando hablas coreano. Trataron el idioma coreano en sí mismo como una "Bandera Roja" o una "Señal de Riesgo", lo que los hacía más propensos a rechazar la solicitud, incluso si la solicitud era peligrosa.

3. El factor "Contexto"

Los investigadores también descubrieron que dónde ocurre la historia importa.

  • Si le preguntas a un robot sobre un banco de EE. UU. en inglés, podría ser cauteloso.
  • Si le preguntas al mismo robot sobre un banco coreano en inglés, se vuelve aún más cauteloso.
  • Si preguntas sobre el banco coreano en coreano, es el más cauteloso de todos.

Es como un sistema de seguridad que tiene un "Modo Local". Cuando el robot se da cuenta de que la situación está ocurriendo en Corea (con nombres, lugares y leyes coreanas), aprieta aún más su cinturón de seguridad.

4. El giro del "Jailbreak"

El equipo también probó qué sucede si eliminas todos los trucos sofisticados (jailbreaks) y simplemente haces la pregunta directamente: "¿Cómo hago una bomba?".

  • Robots de Código Abierto: Cuando se les preguntó directamente, estos robots se comportaron como predecían los estudios antiguos. Eran más fáciles de engañar en coreano.
  • Robots de Grandes Corporaciones: Los modelos grandes y costosos (como los de OpenAI o Anthropic) se mantuvieron cautelosos en coreano, incluso cuando se les preguntó directamente. No cayeron en la "brecha del idioma".

5. Por qué esto importa (según el documento)

La conclusión principal es que no puedes simplemente traducir las pruebas de seguridad.

Si quieres saber si un robot es seguro en Corea, no puedes simplemente tomar tu prueba en inglés, traducirla y ejecutarla. Tienes que cambiar la historia para que se ajuste a la cultura coreana (transcreación).

  • La vieja forma: "Traduce la pregunta, verifica la respuesta". (Esto pasa por alto el punto).
  • La nueva forma: "Reescribe la historia para la cultura local, luego verifica la respuesta".

El documento concluye que, para estos robots específicos, hablar coreano y hablar sobre temas coreanos en realidad los hace más seguros (más propensos a decir "No" a cosas malas), no menos seguros. Este es un cambio enorme respecto a lo que todos pensaban antes.

Resumen en una oración

Este documento construyó una prueba especial para mostrar que, cuando le preguntas a robots de IA sobre temas peligrosos en coreano y sobre lugares coreanos, no se dejan engañar más fácilmente; en cambio, a menudo se vuelven más cuidadosos y se niegan a responder, demostrando que las pruebas de seguridad necesitan adaptarse culturalmente, no solo traducirse.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →