← Últimos artigos
🤖 machine learning

Aligned but Stereotypical? How System Prompts Shape Demographic Bias in LLM-Based Text-to-Image Models

Este artigo revela que sistemas de texto para imagem baseados em LLM introduzem vieses demográficos mais fortes do que as bases de comparação não baseadas em LLM devido aos seus prompts de sistema, e propõe o FairPro, um framework livre de treinamento que mitiga esses vieses ao gerar adaptativamente instruções conscientes de equidade enquanto preserva a intenção do usuário.

Autores originais: NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

Publicado 2026-06-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: NaHyeon Park, Na Min An, Kunhee Kim, Soyeon Yoon, Jiahao Huo, Hyunjung Shim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Grande Ideia: O "Tradutor Entusiasta Demais"

Imagine que você quer desenhar uma imagem baseada em uma frase simples, como "Um botânico".

Nas máquinas de desenho mais antigas, você entregava a frase diretamente ao artista. O artista desenharia um botânico, mas poderia depender de seus próprios hábitos antigos ou estereótipos (por exemplo, desenhar apenas homens brancos).

Nas máquinas de desenho mais novas e inteligentes (aquelas que este artigo estuda), há uma etapa extra. Antes de o artista ver sua frase, um tradutor inteligente (um modelo de linguagem de IA) a lê primeiro. Este tradutor deveria ajudar adicionando detalhes para tornar a imagem melhor. Por exemplo, ele pode transformar "Um botânico" em "Um botânico em um campo verde usando um chapéu, segurando uma lupa".

O Problema: O artigo descobriu que esse "tradutor inteligente" frequentemente adiciona estereótipos indesejados enquanto tenta ser útil. Mesmo que você não tenha pedido um gênero, raça ou idade específicos, o tradutor pode assumir: "Ah, botânicos são geralmente homens brancos", e adicionar esses detalhes às instruções antes mesmo de o artista começar a desenhar.

A Investigação: O Teste "COMPBIAS"

Os pesquisadores construíram um kit de teste gigante chamado COMPBI고BIAS (pense nisso como um exame padronizado para máquinas de desenho). Eles testaram 1.024 prompts diferentes, variando de muito simples ("Um médico") a muito complexos ("Um médico salvando um paciente em um hospital movimentado").

Eles compararam dois tipos de máquinas:

  1. Escola Antiga: Instruções diretas para o artista.
  2. Escola Nova: As instruções passam pelo "tradutor inteligente" primeiro.

As Descobertas:

  • As máquinas da "Escola Nova" eram mais enviesadas. Elas produziram imagens com estereótipos muito mais fortes (por exemplo, majoritariamente homens brancos para "médicos") do que as antigas.
  • A "Armadilha do Alinhamento": As novas máquinas eram, na verdade, melhores em seguir suas instruções e criar imagens de alta qualidade. Mas o artigo descobriu uma troca: quanto melhores elas eram em entender suas palavras, mais elas se apoiavam em estereótipos quando você não especificava detalhes.
  • A complexidade piora a situação: Quanto mais complexo era o seu prompt, mais o tradutor adicionava detalhes estereotipados, tornando o viés mais forte.

O Culpado: O "System Prompt" (Prompt de Sistema)

Os pesquisadores investigaram por que isso acontece. Eles descobriram que o culpado é o System Prompt.

Pense no System Prompt como o livro de regras ou o memorando do gerente dado ao tradutor inteligente. Ele diz ao tradutor como se comportar.

  • O artigo descobriu que esses livros de regras padrão costumam conter suposições ocultas.
  • Quando o tradutor lê um prompt neutro como "Um juiz", o livro de regras o induz a pensar em um tipo específico de pessoa (por exemplo, um homem branco mais velho) antes mesmo de escrever a descrição para o artista.
  • Os pesquisadores provaram isso observando os "pensamentos" (embeddings de texto) da máquina. Eles viram que o tradutor estava secretamente mudando palavras neutras em palavras enviesadas antes que a imagem fosse sequer criada.

A Solução: "FAIRPRO" (O Treinador de Equidade)

Os pesquisadores não queriam apenas deletar o tradutor inteligente, porque ele faz as imagens ficarem ótimas. Em vez disso, eles criaram uma correção chamada FAIRPRO.

Como funciona:
Imagine que o tradutor inteligente tem um treinador parado ao lado dele.

  1. O Treinador Verifica o Prompt: Quando você diz "Um botânico", o treinador olha para o livro de regras do tradutor.
  2. O Treinador Reescreve as Regras: Em vez de deixar o tradutor adivinhar, o treinador dá a ele uma nova instrução temporária: "Esta pessoa é um botânico. Não assuma o gênero, raça ou idade dela. Mantenha-a diversa."
  3. O Resultado: O tradutor ainda adiciona detalhes úteis (como o chapéu e a lupa), mas para de assumir que o botânico é um homem branco. Ele cria uma mistura de imagens mais diversa.

Por que é especial:

  • Sem Re-treinamento: Eles não precisaram reconstruir toda a máquina ou ensinar coisas novas a ela. Eles apenas mudaram as instruções que ela recebe enquanto está trabalhando.
  • Respeita Você: Se você realmente disser "Uma botânica mulher", o treinador respeita isso e mantém o gênero feminino, mas ainda garante que a raça e a idade sejam diversas. Ele só corrige as partes que você não especificou.

O Resumo Final

O artigo mostra que as partes "inteligentes" dos geradores de imagem de IA modernos são, na verdade, a fonte de novos tipos de viés. Ao simplesmente ajustar as instruções dadas a esses tradutores inteligentes (os System Prompts), podemos impedir que eles façam suposições injustas sem estragar a qualidade das imagens. É como ensinar um assistente prestativo a parar de adivinhar suas preferências e, em vez disso, perguntar: "Quem devo desenhar?" antes de fazer suposições.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →