General Phrase Debiaser: Debiasing Masked Language Models at a Multi-Token Level
Este artigo apresenta o General Phrase Debiaser, um pipeline automático de múltiplos tokens que mitiga vieses em nível de frase em modelos de linguagem mascarados ao gerar frases estereotipadas da Wikipedia e utilizá-las para identificar e mitigar prompts que desencadeiam vieses, alcançando reduções significativas de estereótipos de gênero em vários domínios e tamanhos de modelos.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Computadores que leem e escrevem linguagem tornaram-se extraordinariamente habilidosos, capazes de resumir notícias, traduzir documentos e até compor poesia. Esses sistemas, conhecidos como modelos de linguagem, aprendem estudando vastas quantidades de texto da internet, absorvendo os padrões, fatos e opiniões contidos neles. No entanto, como a linguagem humana é repleta de preconceitos históricos e estereótipos culturais, esses modelos frequentemente aprendem a repeti-los. Um computador pode assumir que uma enfermeira é sempre uma mulher ou que um matemático é sempre um homem, simplesmente porque foi isso que ele viu com mais frequência em seus dados de treinamento. Este é um problema significativo para qualquer pessoa que tente usar essas ferramentas de forma justa, pois as máquinas podem inadvertidamente reforçar preconceitos prejudiciais sobre gênero, raça e profissão. Embora pesquisadores tentem corrigir esses problemas há muito tempo, a maioria das tentativas anteriores focou em corrigir palavras isoladas, tratando o viés como uma questão simples de substituir alguns termos problemáticos. Contudo, o viés no mundo real raramente vive isolado; ele se esconde na maneira como as palavras se combinam em frases e sentenças, onde o significado muda de formas sutis e perigosas.
Uma equipe de pesquisadores da Academia Chinesa de Ciências, do Grupo Alibaba e da Universidade de Bristol desenvolveu um novo método para enfrentar essa camada mais profunda de preconceito. Eles chamam sua abordagem de General Phrase Debiaser (Desviabilizador de Frases Geral), um sistema projetado para limpar modelos de linguagem ao observar grupos de palavras em vez de apenas palavras individuais. Os pesquisadores reconheceram que, para realmente corrigir o problema, precisavam encontrar as frases específicas onde o viés do modelo é mais forte e, então, ensinar o modelo a ignorar essas associações. Seu processo começa com uma maneira inteligente de reunir as evidências necessárias para a correção. Em vez de pedir que humanos escrevam manualmente cada frase enviesada possível, o que seria lento e incompleto, o sistema varre páginas da Wikipédia. Ele procura por hiperlinks que conectam a tópicos como carreiras, matemática, arte e ciência, e usa esses links para identificar frases estereotipadas que o modelo possa ter aprendido. Por exemplo, ele pode descobrir que o modelo associa fortemente "homem" a "teoria matemática" e "mulher" a "arte da dança".
Uma vez que o sistema identifica essas frases enviesadas, ele passa para a segunda etapa: encontrar as perguntas exatas, ou comandos (prompts), que desencadeiam o preconceito do modelo. Imagine perguntar ao computador para completar uma frase como "O [pessoa] é um especialista em [vazio]". Os pesquisadores deixam o computador pesquisar através de milhões de frases possíveis para encontrar aquelas onde ele tem maior probabilidade de fazer um palpite enviesado. Eles não buscam apenas respostas de uma única palavra; eles buscam respostas de múltiplas palavras, como "teoria matemática" versus "arte da dança", porque é aí que o verdadeiro viés costuma se esconder. Ao medir o quão diferentemente o modelo responde a essas frases quando o sujeito é um homem versus uma mulher, o sistema calcula uma pontuação que representa a força do viés. Os pesquisadores então usam essa pontuação para guiar um processo de ajuste fino (fine-tuning). Eles inserem essas frases específicas que desencadeiam o viés de volta no modelo, mas, desta vez, ajustam as configurações internas do modelo para reduzir a diferença em suas respostas. O objetivo não é apagar o conhecimento de matemática ou arte do modelo, mas garantir que ele não vincule mais esses campos a um gênero específico.
Os resultados deste trabalho mostram que visar frases é muito mais eficaz do que visar palavras isoladas. Os pesquisadores testaram seu método em três modelos de linguagem conhecidos de diferentes tamanhos e descobriram que ele reduziu significativamente o viés de gênero tanto em disciplinas acadêmicas quanto em carreiras. Em testes padrão projetados para medir o viés, os modelos melhoraram dramaticamente. Por exemplo, um dos modelos, o BERT, viu sua pontuação de viés cair de 0,35 para 0,12, enquanto outro, o ALBERT, caiu de 0,72 para 0,16. Esses números indicam que os modelos tornaram-se muito menos propensos a associar profissões ou campos específicos a um gênero sobre o outro. Crucialmente, os pesquisadores também verificaram se esse processo de limpeza prejudicava a capacidade dos modelos de entender a linguagem em geral. Eles submeteram os modelos desenviesados a uma bateria de testes de linguagem padrão cobrindo gramática, sentimento e lógica, e descobriram que os modelos mantiveram quase todas as suas habilidades originais. A capacidade de entender a linguagem permaneceu intacta, provando que é possível remover estereótipos prejudiciais sem quebrar a inteligência da máquina.
Esta abordagem marca uma mudança na forma como os pesquisadores pensam sobre a correção da inteligência artificial. Métodos anteriores frequentemente dependiam de listas externas de palavras escritas por humanos ou tentavam corrigir todo o vocabulário do modelo de uma só vez, o que poderia ser ineficiente ou perder a nuance de como o viés realmente funciona. O General Phrase Debiaser, por outro lado, automatiza a descoberta de frases enviesadas e visa as combinações específicas de palavras onde o problema existe. Os pesquisadores argumentam que essa correção em nível de múltiplos tokens é essencial porque o viés humano raramente é uma palavra única; é um padrão de associação que se estende através de frases. Embora o estudo tenha focado em modelos apenas de codificação (encoder-only), que são um tipo específico de modelo de linguagem, os princípios descobertos poderiam potencialmente ser aplicados a outros tipos de sistemas também. O trabalho demonstra que, ao olhar mais de perto para a estrutura da linguagem, podemos construir ferramentas que sejam não apenas mais inteligentes, mas também mais justas, garantindo que os computadores do futuro reflitam a diversidade do mundo que servem, em vez das limitações de seus dados de treinamento.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.