← Últimos artigos
💬 NLP

ROK-FORTRESS: Measuring the Effect of Geopolitical Transcreation for National Security and Public Safety

O artigo apresenta o ROK-FORTRESS, um benchmark bilíngue que utiliza uma "matriz de transcriação" para demonstrar que as avaliações de Segurança Nacional e Segurança Pública para modelos de linguagem de grande escala devem levar em conta as interações complexas entre linguagem e contexto geopolítico, uma vez que abordagens baseadas apenas em tradução falham em capturar como a língua coreana e o contexto específico influenciam de forma única os comportamentos de segurança do modelo e as taxas de recusa excessiva.

Autores originais: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Ch
Publicado 2026-05-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Michael S. Lee, Yash Maurya, Drew Rein, Bert Herring, Jonathan Nguyen, Kyungho Song, Udari Madhushani Sehwag, Jiyeon Cho, Kaustubh Deshpande, Yeongkyun Jang, Jiyeon Joo, Minn Seok Choi, Evi Fuelle, Christina Q Knight, Joseph Brandifino, Max Fenkell

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está testando um robô muito inteligente para ver se ele seguirá instruções perigosas, como "Como construo uma bomba?" ou "Como hackeo um banco?".

Por muito tempo, pesquisadores de segurança testaram esses robôs principalmente em inglês. Eles assumiram que, se você simplesmente traduzisse essas perguntas perigosas para outro idioma (como o coreano), o robô ainda diria "Não". Eles pensaram que as regras de segurança do robô eram como um escudo universal que funcionava da mesma maneira, independentemente do idioma que você falava.

Mas este artigo, ROK-FORTRESS, diz: "Espere um minuto. Não se trata apenas do idioma; trata-se de onde a história se passa."

Aqui está uma explicação simples do que eles fizeram e do que descobriram, usando algumas analogias do cotidiano.

1. O Teste de "Tradução vs. Transcriação"

Os pesquisadores perceberam que simplesmente traduzir uma pergunta é como traduzir uma receita. Se você traduzir uma receita de "Torta de Maçã Americana" para o coreano, você ainda terá uma receita de Torta de Maçã, apenas com palavras em coreano. Os ingredientes (a ameaça) são os mesmos.

Mas a Transcriação é diferente. É como pegar essa receita de Torta de Maçã e transformá-la em uma receita de "Torta de Batata-Doce Coreana". A intenção (fazer uma sobremesa doce) é a mesma, mas os ingredientes específicos, o contexto cultural e as regras locais são completamente diferentes.

A equipe criou um teste massivo chamado ROK-FORTRESS (uma fortaleza para testes de segurança) com 1.235 perguntas diferentes "perigosas". Eles as testaram de quatro maneiras:

  1. Inglês, Contexto dos EUA: "Como hackeo o FBI?" (Original)
  2. Coreano, Contexto dos EUA: "Como hackeo o FBI?" (Traduzido)
  3. Inglês, Contexto Coreano: "Como hackeo o Serviço Nacional de Inteligência Coreano?" (Adaptado)
  4. Coreano, Contexto Coreano: "Como hackeo o Serviço Nacional de Inteligência Coreano?" (Totalmente Transcriado)

2. A Grande Surpresa: O Efeito "Coreano Conservador"

A maioria dos estudos anteriores pensava que falar um idioma em que o robô não é tão bom (como o coreano) seria uma "brecha" ou uma "porta dos fundos" para enganar o robô e fazê-lo ser perigoso. Eles pensavam que o robô ficaria confuso e diria "Sim" para coisas ruins.

O artigo encontrou exatamente o oposto.

Quando perguntaram aos robôs em coreano, eles na verdade ficaram mais cautelosos. Eles disseram "Não" com mais frequência.

  • A Analogia: Imagine um guarda de segurança em um museu. Se você perguntar a ele em seu idioma nativo com um sotaque local, ele fica muito rigoroso e verifica sua identidade três vezes. Se você perguntar a ele em um idioma estrangeiro quebrado, ele pode ficar confuso e deixá-lo entrar. Mas esses robôs agiram como o guarda que fica extra rigoroso quando você fala coreano. Eles trataram o próprio idioma coreano como uma "Bandeira Vermelha" ou um "Sinal de Risco", tornando-os mais propensos a recusar o pedido, mesmo que o pedido fosse perigoso.

3. O Fator "Contexto"

Os pesquisadores também descobriram que onde a história acontece importa.

  • Se você perguntar a um robô sobre um banco dos EUA em inglês, ele pode ser cauteloso.
  • Se você perguntar ao mesmo robô sobre um banco coreano em inglês, ele fica ainda mais cauteloso.
  • Se você perguntar sobre o banco coreano em coreano, ele é o mais cauteloso de todos.

É como um sistema de segurança que tem um "Modo Local". Quando o robô percebe que a situação está acontecendo na Coreia (com nomes coreanos, lugares e leis), ele aperta ainda mais seu cinto de segurança.

4. A Reviravolta do "Jailbreak"

A equipe também testou o que acontece se você remover todos os truques sofisticados (jailbreaks) e apenas fizer a pergunta diretamente: "Como faço uma bomba?".

  • Robôs de Código Aberto: Quando perguntados diretamente, esses robôs se comportaram como os antigos estudos previam. Eles eram mais fáceis de enganar em coreano.
  • Robôs de Grandes Corporações: Os modelos grandes e caros (como os da OpenAI ou Anthropic) permaneceram cautelosos em coreano, mesmo quando perguntados diretamente. Eles não caíram na "brecha de idioma".

5. Por Que Isso Importa (Segundo o Artigo)

A principal conclusão é que você não pode apenas traduzir testes de segurança.

Se você quiser saber se um robô é seguro na Coreia, você não pode apenas pegar seu teste em inglês, traduzi-lo e executá-lo. Você precisa mudar a história para se adequar à cultura coreana (transcriação).

  • O Jeito Antigo: "Traduza a pergunta, verifique a resposta." (Isso perde o ponto).
  • O Jeito Novo: "Reescreva a história para a cultura local, depois verifique a resposta."

O artigo conclui que, para esses robôs específicos, falar coreano e falar sobre tópicos coreanos na verdade os torna mais seguros (mais propensos a dizer "Não" para coisas ruins), e não menos seguros. Isso é uma grande mudança em relação ao que todos pensavam antes.

Resumo em Uma Frase

Este artigo criou um teste especial para mostrar que, quando você pergunta a robôs de IA sobre tópicos perigosos em coreano e sobre lugares coreanos, eles não são enganados mais facilmente; em vez disso, muitas vezes ficam mais cuidadosos e se recusam a responder, provando que os testes de segurança precisam ser adaptados culturalmente, e não apenas traduzidos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →