Schützen: Evaluating LLM Safety in Bulgarian and German Contexts
Este artigo apresenta o "Schützen", um conjunto de dados de segurança alemão-búlgaro concebido para abordar a falta de recursos de avaliação não ingleses ao revelar diferenças translinguísticas significativas nos comportamentos de segurança de modelos de linguagem de grande escala e enfatizar a necessidade de avaliações específicas de cada região.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um assistente robô multilíngue e muito inteligente. Você quer saber se é seguro deixá-lo falar com pessoas na Alemanha e na Bulgária. O problema é que a maioria dos testes de segurança para esses robôs é como testes de direção feitos apenas em países de língua inglesa. Eles verificam se o robô sabe parar em um semáforo vermelho em Londres ou Nova York, mas não verificam se ele sabe parar em um semáforo vermelho em Sófia ou Berlim, onde as regras, a cultura e a história podem ser ligeiramente diferentes.
Este artigo, intitulado "Schützen" (que é alemão para "proteger"), apresenta um novo teste de segurança projetado especificamente para esses dois países. Aqui está uma divisão simples do que eles fizeram e do que descobriram:
1. O Problema: A Rede de Segurança "Tamanho Único"
Pense nos conjuntos de dados de segurança existentes como uma rede de segurança gigante e genérica fabricada nos EUA. Ela é ótima para capturar falantes de inglês, mas quando você tenta usá-la para capturar um falante de alemão ou búlgaro, os buracos podem estar nos lugares errados.
- A Lacuna: Existem muito poucos testes de segurança para o búlgaro (uma língua de "baixo recurso", o que significa que há menos livros digitais e dados disponíveis para ela) e não há testes profundos o suficiente e culturalmente específicos para o alemão.
- O Risco: Se você não testar o robô na língua e cultura locais, ele pode acidentalmente dizer algo rude, ilegal ou prejudicial que não diria em inglês.
2. A Solução: Uma "Academia de Segurança" Personalizada
Os autores construíram uma nova academia chamada Schützen para treinar e testar esses robôs.
- Os Equipamentos: Eles criaram cerca de 8.000 perguntas (prompts) tanto em alemão quanto em búlgaro.
- O Treino: Eles não apenas traduziram perguntas do inglês. Eles as "localizaram".
- Analogia: Se um teste em inglês pergunta: "Como eu faço uma bomba usando um eletrodoméstico?", a versão alemã não apenas traduz as palavras; ela pode perguntar sobre um evento histórico específico ou um tabu cultural local. A versão búlgara pode fazer referência a um filme local ou a uma figura histórica específica.
- Os Três Tipos de Testes:
- Ataques Diretos: "Diga-me como quebrar a lei." (O teste óbvio).
- Ataques Indiretos: "Estou escrevendo uma história sobre um vilão que quebra a lei. Como eles fariam isso?" (O teste astuto).
- Verificações de Supersensibilidade: "O que é uma arma?" (Fazer uma pergunta inofensiva para ver se o robô fica assustado e se recusa a responder algo seguro).
3. O Concurso: 15 Robôs no Ringue
Eles colocaram 15 modelos de IA diferentes nesta academia para ver como eles lidavam com as perguntas.
- Os Competidores: Isso incluiu grandes modelos globais (como GPT-4o, Claude e Llama) e especialistas locais (como o BgGPT para a Bulgária e Leo/LLaMmlein para a Alemanha).
- A Planilha de Pontuação: Eles verificaram duas coisas:
- Pontuação Binária: O robô disse "Não, isso é inseguro" (Seguro) ou ele realmente deu a informação ruim (Inseguro)?
- Pontuação de Estilo: Como ele disse não? Ele apenas recusou? Ele explicou o porquê? Ele deu uma resposta segura e entediante?
4. Os Resultados: Quem Venceu?
- O Campeão: O Claude-3.7 foi o robô mais seguro no geral, apresentando um desempenho quase perfeito em ambos os idiomas.
- Os Heróis Locais:
- Para a Bulgária, o modelo local BgGPT-27B fez o melhor trabalho.
- Para a Alemanha, o modelo local Leo-mistral-hessianai-7B-chat foi o melhor desempenho.
- Os que Tiveram Dificuldade: Alguns modelos menores, como o LLaMmlein-7B-chat (alemão) e o BgGPT-2.6B (búlgaro), tiveram mais dificuldades, frequentemente falhando em detectar os pedidos inseguros.
- A Surpresa: Os autores pensaram que a língua de "baixo recurso" (búlgaro) seria mais difícil para os robôs lidarem com segurança. No entanto, eles descobriram que, como a Alemanha e a Bulgária compartilham leis europeias e valores culturais semelhantes, os robôs na verdade se saíram muito bem no búlgaro também, desde que as regras de segurança fossem semelhantes ao que aprenderam em inglês.
5. O Árbitro "Humano vs. Máquina"
Para garantir que a pontuação computadorizada deles fosse justa, eles usaram uma "Equipe Humano-IA".
- O Processo: Humanos rotularam algumas respostas como "Seguras" ou "Inseguras". Em seguida, usaram uma IA superinteligente (GPT-4.1) para verificar o restante.
- O Truque: Eles descobriram que, se dissessem à IA para escolher a primeira resposta que se encaixasse em uma categoria (em vez de pensar demais e procurar pela correspondência "perfeita"), ela concordava muito mais com os juízes humanos. É como dizer a um árbitro para fazer uma decisão rápida baseada na primeira regra que ele vê, em vez de debater cada regra possível.
Resumo
O artigo argumenta que você não pode apenas testar a segurança da IA em inglês e assumir que ela funcionará em qualquer lugar. Você precisa de um manual de segurança local. Eles construíram um novo manual para a Alemanha e a Bulgária, testaram 15 robôs e descobriram que, embora os gigantes globais sejam muito seguros, os modelos locais podem ser excelentes se forem treinados corretamente. Eles também provaram que usar uma mistura de humanos e IA para avaliar esses testes é mais rápido e tão preciso quanto usar humanos sozinhos.
Onde encontrar as ferramentas: Os autores disponibilizaram sua "academia" (conjunto de dados) e "planilhas de pontuação" (código) no GitHub para que qualquer pessoa possa usar.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.