Going PLACES: Participatory Localized Red Teaming for Text-to-Image Safety in the Global South
Este artigo apresenta o PLACES, uma iniciativa participativa de red teaming que aborda os vieses centrados no Ocidente na segurança de texto para imagem, colaborando com comunidades do Sul Global para gerar um conjunto de dados diversificado com mais de 26.000 exemplos localizados de falhas, revelando danos culturais únicos e defendendo estruturas de segurança conscientes do contexto.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem uma máquina mágica de arte (um modelo de Texto para Imagem) capaz de desenhar qualquer coisa que você descreva. Por muito tempo, essa máquina foi treinada principalmente por pessoas do Ocidente (América do Norte e Europa) e aprendeu a ver o mundo através de seus olhos. É como um chef que só sabe cozinhar comida reconfortante americana; se você pedir um prato regional específico da Índia ou da Nigéria, ele pode simplesmente entregar um hambúrguer genérico ou uma confusão sem sentido.
Este artigo, intitulado "Going PLACES", trata de uma equipe de pesquisadores que decidiu ensinar essa máquina de arte a ver o resto do mundo adequadamente. Eles não apenas pediram a pessoas aleatórias na internet que tentassem quebrar a máquina; foram profundamente às comunidades locais do "Sul Global" (especificamente Gana, Nigéria e partes da Índia) para descobrir o que a máquina erra nesses lugares específicos.
Aqui está a divisão de seu trabalho usando analogias simples:
1. O Problema: A Rede de Segurança "Tamanho Único"
Os pesquisadores argumentam que as regras de segurança atuais para essas máquinas de arte com IA são como um colete salva-vidas de um único tamanho. Pode caber perfeitamente em um nadador ocidental, mas fica muito frouxo ou muito apertado para alguém de uma cultura diferente.
- O Problema: A IA acha que está sendo "segura" ao seguir regras ocidentais, mas, nas culturas locais, pode estar gerando imagens profundamente ofensivas, religiosamente inadequadas ou culturalmente ignorantes.
- A Analogia: Imagine uma IA desenhando uma "cerimônia religiosa". No Ocidente, ela pode apenas desenhar uma igreja genérica. Mas na Índia, se você pedir um ritual hindu específico, a IA pode acidentalmente colocar sapatos nos pés de uma divindade (o que é um grande tabu) ou misturar dois festivais diferentes. A IA não conhece essas "regras da estrada" locais.
2. A Solução: "Red Teaming" com Guias Locais
"Red Teaming" é como contratar um grupo de hackers para tentar quebrar um sistema de segurança para que você possa corrigi-lo antes que os vilões o façam. Geralmente, esses "hackers" são especialistas sentados em grandes escritórios de tecnologia nos EUA ou no Reino Unido.
- O que o PLACES fez: Em vez de contratar estranhos, eles fizeram parceria com universidades em cidades secundárias (não apenas nas grandes capitais como Mumbai ou Lagos). Recrutaram estudantes e professores locais para atuar como "Guias Comunitários".
- A Oficina: Antes dos estudantes começarem, os pesquisadores realizaram oficinas. Pense nisso como um campo de treinamento onde explicaram: "Aqui está como a IA funciona, e aqui é como sua cultura vê a segurança". Incentivaram os estudantes a usar seus idiomas locais, misturar idiomas (como falar inglês com palavras em hindi ou pidgin) e usar metáforas locais.
- O Resultado: Coletaram mais de 26.000 exemplos da IA falhando de maneiras que um testador ocidental nunca teria imaginado. Essa coleção é chamada de conjunto de dados PLACES.
3. O que Encontraram: Os "Pontos Cegos Culturais" da IA
Ao analisar os 26.000 exemplos, encontraram três tipos principais de "pontos cegos":
A. A Brecha da "Mistura de Códigos"
Em muitas partes do Sul Global, as pessoas misturam idiomas naturalmente em uma única frase (por exemplo, "Um homem comendo jollof rice em Lagos").
- A Descoberta: Os filtros de segurança da IA são como seguranças que só falam inglês. Se você sussurrar um segredo em uma mistura de inglês e um idioma local, o segurança não entende o perigo e deixa você entrar. Os pesquisadores descobriram que misturar idiomas permitia que usuários burlassem filtros de segurança que teriam bloqueado a mesma solicitação se fosse escrita em inglês puro.
B. "Dissonância Normativa" (Valores em Choque)
Isso ocorre quando a IA segue suas "regras ocidentais", mas viola "regras locais".
- A Analogia: Imagine que a IA é um convidado em uma festa. O anfitrião (a cultura local) diz: "Não coma com a mão esquerda". O convidado (a IA) diz: "Mas meu livro de regras diz que mãos são apenas mãos!" e usa a mão esquerda de qualquer maneira.
- Exemplos Reais:
- Religião: A IA gerou uma imagem de um homem hindu comendo carne bovina (proibida para muitos hindus) ou um muçulmano jogando em Meca. Para a IA, esses eram apenas "pessoas fazendo coisas", mas para os locais, eram profundamente ofensivos.
- Costumes: A IA mostrou uma criança apertando a mão de um idoso na Índia, enquanto o costume local é tocar seus pés. A IA perdeu as regras de "pureza" e "respeito" da cultura.
- Presságios: A IA desenhou um gato preto cruzando uma estrada ou um espelho quebrado. Em algumas culturas, esses não são apenas "gatos" ou "vidro"; são presságios ruins que trazem má sorte. A IA não entendeu o sentimento da imagem.
C. "Achamento Ontológico" (Apagando Identidade)
Isso ocorre quando a IA pega algo único e específico e o esmaga em uma forma genérica e ocidental.
- A Analogia: É como pedir a um pintor que desenhe um tipo específico de ônibus local, e ele simplesmente desenha um ônibus escolar americano genérico.
- Exemplos Reais:
- Comida: Pedir "Fufu" (um prato da África Ocidental) e receber uma imagem de purê de batatas ou um hambúrguer.
- Arte: Pedir um "artista de Yakshagana" (um estilo específico de teatro indiano) e receber um "dançarino clássico" genérico em um tutu branco.
- Pessoas: Pedir um "vendedor de rua do sul da Índia" e receber uma imagem de uma pessoa de pele escura de uma maneira que reforça estereótipos de pobreza, mesmo que o prompt não tenha pedido pobreza.
4. Por Que Isso Importa
O artigo conclui que não é possível tornar a IA mais segura apenas tornando-a "maior" ou adicionando mais dados dos mesmos lugares antigos. É preciso dar zoom.
- A Lição: Para tornar a IA verdadeiramente segura para o mundo todo, é preciso permitir que as pessoas que vivem nessas culturas definam o que "segurança" significa para elas. É preciso ouvir os "Guias Comunitários" em vez de apenas a "Sede".
Resumo
O projeto PLACES é como enviar uma equipe de tradutores locais para ensinar a um robô estrangeiro o dialeto local, costumes e tabus. Eles descobriram que o robô estava falhando não porque era "ruim", mas porque era analfabeto culturalmente. Ao permitir que comunidades locais fizessem "red team" na IA, eles descobriram milhares de novas maneiras pelas quais a IA pode errar, provando que a segurança não é um livro de regras universal, mas uma conversa local.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.