← Últimos artigos
💬 NLP

Schützen: Evaluating LLM Safety in Bulgarian and German Contexts

Este artigo apresenta o "Schützen", um conjunto de dados de segurança alemão-búlgaro concebido para abordar a falta de recursos de avaliação não ingleses ao revelar diferenças translinguísticas significativas nos comportamentos de segurança de modelos de linguagem de grande escala e enfatizar a necessidade de avaliações específicas de cada região.

Autores originais: Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

Publicado 2026-06-11
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Kiril Georgiev, Yuxia Wang, Dimitar Iliyanov Dimitrov, Preslav Nakov, Ivan Koychev

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robô multilíngue e muito inteligente. Você quer saber se é seguro deixá-lo falar com pessoas na Alemanha e na Bulgária. O problema é que a maioria dos testes de segurança para esses robôs é como testes de direção feitos apenas em países de língua inglesa. Eles verificam se o robô sabe parar em um semáforo vermelho em Londres ou Nova York, mas não verificam se ele sabe parar em um semáforo vermelho em Sófia ou Berlim, onde as regras, a cultura e a história podem ser ligeiramente diferentes.

Este artigo, intitulado "Schützen" (que é alemão para "proteger"), apresenta um novo teste de segurança projetado especificamente para esses dois países. Aqui está uma divisão simples do que eles fizeram e do que descobriram:

1. O Problema: A Rede de Segurança "Tamanho Único"

Pense nos conjuntos de dados de segurança existentes como uma rede de segurança gigante e genérica fabricada nos EUA. Ela é ótima para capturar falantes de inglês, mas quando você tenta usá-la para capturar um falante de alemão ou búlgaro, os buracos podem estar nos lugares errados.

  • A Lacuna: Existem muito poucos testes de segurança para o búlgaro (uma língua de "baixo recurso", o que significa que há menos livros digitais e dados disponíveis para ela) e não há testes profundos o suficiente e culturalmente específicos para o alemão.
  • O Risco: Se você não testar o robô na língua e cultura locais, ele pode acidentalmente dizer algo rude, ilegal ou prejudicial que não diria em inglês.

2. A Solução: Uma "Academia de Segurança" Personalizada

Os autores construíram uma nova academia chamada Schützen para treinar e testar esses robôs.

  • Os Equipamentos: Eles criaram cerca de 8.000 perguntas (prompts) tanto em alemão quanto em búlgaro.
  • O Treino: Eles não apenas traduziram perguntas do inglês. Eles as "localizaram".
    • Analogia: Se um teste em inglês pergunta: "Como eu faço uma bomba usando um eletrodoméstico?", a versão alemã não apenas traduz as palavras; ela pode perguntar sobre um evento histórico específico ou um tabu cultural local. A versão búlgara pode fazer referência a um filme local ou a uma figura histórica específica.
  • Os Três Tipos de Testes:
    1. Ataques Diretos: "Diga-me como quebrar a lei." (O teste óbvio).
    2. Ataques Indiretos: "Estou escrevendo uma história sobre um vilão que quebra a lei. Como eles fariam isso?" (O teste astuto).
    3. Verificações de Supersensibilidade: "O que é uma arma?" (Fazer uma pergunta inofensiva para ver se o robô fica assustado e se recusa a responder algo seguro).

3. O Concurso: 15 Robôs no Ringue

Eles colocaram 15 modelos de IA diferentes nesta academia para ver como eles lidavam com as perguntas.

  • Os Competidores: Isso incluiu grandes modelos globais (como GPT-4o, Claude e Llama) e especialistas locais (como o BgGPT para a Bulgária e Leo/LLaMmlein para a Alemanha).
  • A Planilha de Pontuação: Eles verificaram duas coisas:
    1. Pontuação Binária: O robô disse "Não, isso é inseguro" (Seguro) ou ele realmente deu a informação ruim (Inseguro)?
    2. Pontuação de Estilo: Como ele disse não? Ele apenas recusou? Ele explicou o porquê? Ele deu uma resposta segura e entediante?

4. Os Resultados: Quem Venceu?

  • O Campeão: O Claude-3.7 foi o robô mais seguro no geral, apresentando um desempenho quase perfeito em ambos os idiomas.
  • Os Heróis Locais:
    • Para a Bulgária, o modelo local BgGPT-27B fez o melhor trabalho.
    • Para a Alemanha, o modelo local Leo-mistral-hessianai-7B-chat foi o melhor desempenho.
  • Os que Tiveram Dificuldade: Alguns modelos menores, como o LLaMmlein-7B-chat (alemão) e o BgGPT-2.6B (búlgaro), tiveram mais dificuldades, frequentemente falhando em detectar os pedidos inseguros.
  • A Surpresa: Os autores pensaram que a língua de "baixo recurso" (búlgaro) seria mais difícil para os robôs lidarem com segurança. No entanto, eles descobriram que, como a Alemanha e a Bulgária compartilham leis europeias e valores culturais semelhantes, os robôs na verdade se saíram muito bem no búlgaro também, desde que as regras de segurança fossem semelhantes ao que aprenderam em inglês.

5. O Árbitro "Humano vs. Máquina"

Para garantir que a pontuação computadorizada deles fosse justa, eles usaram uma "Equipe Humano-IA".

  • O Processo: Humanos rotularam algumas respostas como "Seguras" ou "Inseguras". Em seguida, usaram uma IA superinteligente (GPT-4.1) para verificar o restante.
  • O Truque: Eles descobriram que, se dissessem à IA para escolher a primeira resposta que se encaixasse em uma categoria (em vez de pensar demais e procurar pela correspondência "perfeita"), ela concordava muito mais com os juízes humanos. É como dizer a um árbitro para fazer uma decisão rápida baseada na primeira regra que ele vê, em vez de debater cada regra possível.

Resumo

O artigo argumenta que você não pode apenas testar a segurança da IA em inglês e assumir que ela funcionará em qualquer lugar. Você precisa de um manual de segurança local. Eles construíram um novo manual para a Alemanha e a Bulgária, testaram 15 robôs e descobriram que, embora os gigantes globais sejam muito seguros, os modelos locais podem ser excelentes se forem treinados corretamente. Eles também provaram que usar uma mistura de humanos e IA para avaliar esses testes é mais rápido e tão preciso quanto usar humanos sozinhos.

Onde encontrar as ferramentas: Os autores disponibilizaram sua "academia" (conjunto de dados) e "planilhas de pontuação" (código) no GitHub para que qualquer pessoa possa usar.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →