Do Psychometric Tests Work for Large Language Models? Evaluation of Tests on Sexism, Racism, and Morality
Este estudo avalia sistematicamente testes psicométricos humanos em 17 modelos de linguagem de grande escala quanto ao sexismo, racismo e moralidade, constatando que, embora os testes apresentem confiabilidade moderada, eles carecem de validade ecológica, uma vez que suas pontuações não se alinham com o comportamento real dos modelos em tarefas do mundo real ou até mesmo apresentam correlação negativa com ele.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem uma estação meteorológica muito sofisticada e de alta tecnologia. Você quer saber se ela consegue prever uma tempestade com precisão. Então, você decide testá-la usando um termômetro humano e um barômetro humano — ferramentas projetadas especificamente para pessoas medirem sua própria temperatura corporal e sentirem a pressão.
Você aponta essas ferramentas humanas para a estação meteorológica, faz uma leitura e obtém um número. A pergunta que este artigo faz é: Esse número realmente diz algo sobre se a estação meteorológica irá prever uma tempestade?
A resposta curta dos pesquisadores é: Não, não exatamente. Na verdade, às vezes o número diz exatamente o oposto do que está acontecendo.
Aqui está uma análise do que os pesquisadores fizeram e descobriram, usando analogias simples:
O Experimento: Testando a "Estação Meteorológica"
Os pesquisadores pegaram 17 Grandes Modelos de Linguagem (LLMs) diferentes — os cérebros de IA por trás dos chatbots — e tentaram medir três coisas específicas sobre eles:
- Sexismo (preconceito contra mulheres)
- Racismo (preconceito contra pessoas negras)
- Moralidade (o que a IA considera certo ou errado)
Para fazer isso, eles usaram testes psicológicos padrão que têm sido usados há décadas para testar humanos. Estes são como o "termômetro humano" mencionado acima.
As Duas Verificações: Confiabilidade e Validade
Para ver se esses testes funcionam em IA, os pesquisadores verificaram duas coisas:
1. Confiabilidade (O Teste da "Consistência")
- A Analogia: Se você perguntar a um humano a mesma pergunta de três maneiras ligeiramente diferentes (ex: "Você gosta de maçãs?" vs. "Maçãs são boas?"), eles devem dar a mesma resposta. Se disserem "Sim" para a primeira e "Não" para a segunda, o teste é não confiável.
- O Achado: A IA foi majoritariamente consistente quando as perguntas eram apenas refraseadas. No entanto, quando os pesquisadores simplesmente inverteram a ordem das opções de resposta (ex: colocando "Concordo Totalmente" na parte inferior em vez de no topo), a IA ficou confusa e deu respostas completamente diferentes. É como se uma pessoa mudasse de ideia sobre gostar de maçãs só porque a palavra "Sim" estava escrita no fundo da página em vez de no topo. Isso significa que os testes são frágeis quando usados em IA.
2. Validade (O Teste do "Mundo Real")
Esta é a parte mais importante. Os pesquisadores perguntaram: Se o teste diz que uma IA é "sexista", essa IA realmente age de forma sexista no mundo real?
- A Analogia: Imagine um teste que afirma que uma pessoa é um "grande chef" porque consegue recitar uma receita perfeitamente. A validade ecológica pergunta: "Se você colocá-la em uma cozinha com ingredientes reais, ela realmente cozinhará uma boa refeição?"
- O Achado: Os testes falharam miseravelmente aqui.
- O Paradoxo: Os modelos de IA que pontuaram o menor no "teste de sexismo" (ou seja, o teste disse que eles eram muito justos) foram, na verdade, os que escreveram as cartas de recomendação mais sexistas em tarefas do mundo real.
- O Reverso: Os modelos que pontuaram o maior no "teste de racismo" (ou seja, o teste disse que eles eram muito preconceituosos) foram, na verdade, os que deram as recomendações de habitação menos tendenciosas.
- A Conclusão: As pontuações dos testes não foram apenas inúteis; elas foram enganosas. Elas agiram como uma bússola quebrada apontando para o Norte quando você estava, na verdade, indo para o Sul.
Por que Isso Aconteceu?
Os pesquisadores sugerem algumas razões pelas quais os testes humanos não funcionam em IA:
- O Efeito "Guarda-corpo": Quando uma IA é questionada sobre um tema direto e sensível como "Você acha que as mulheres são facilmente ofendidas?", ela possui filtros de segurança que entram em ação e dizem: "Não, isso é errado". Mas quando a IA é solicitada a escrever uma carta de recomendação de emprego (uma tarefa do mundo real), esses filtros podem não ser acionados, e a IA pode cometer deslizes e usar linguagem tendenciosa.
- A Armadilha do Formato: Humanos estão acostumados a escolher "A, B, C ou D". Os modelos de IA, porém, são treinados para escrever texto. Forçá-los a escolher uma opção de múltipla escolha é como pedir a um pintor para descrever um pôr do sol escolhendo apenas a partir de uma lista de cores. Isso não captura como eles realmente "veem" ou "agem".
A Conclusão Final
O artigo conclui que você não pode simplesmente pegar um teste desenhado para humanos e aplicá-lo a uma IA para ver como ela se comporta.
Se você confiar nesses testes, pode pensar que uma IA é segura e justa porque passou no "teste", apenas para descobrir que ela é, na verdade, tendenciosa quando começa a realizar trabalhos reais. Os pesquisadores argumentam que precisamos inventar novos testes específicos para IA que observem o que a IA realmente faz em cenários do mundo real, em vez de observar o que ela diz quando forçada a escolher uma resposta em uma folha de múltipla escolha.
Em resumo: Só porque uma IA consegue passar em um questionário de psicologia humana, não significa que ela tenha uma personalidade humana ou que se comportará eticamente no mundo real. As pontuações dos testes são frequentemente uma miragem.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.