LLMs Infer Cultural Context but Fail to Apply It When Responding
Este artigo apresenta o conjunto de dados CAPRI para demonstrar que, embora os grandes modelos de linguagem consigam inferir o contexto cultural e recordar convenções relevantes, eles frequentemente falham em aplicar esse conhecimento para gerar respostas culturalmente adaptadas, a menos que sejam explicitamente orientados para fazê-lo.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você tem um bibliotecário muito inteligente e culto, que leu quase todos os livros do mundo. Esse bibliotecário sabe muito sobre diferentes países: ele sabe que as pessoas na França usam Celsius para temperatura, que as pessoas nos EUA usam Fahrenheit, e que os números de telefone parecem diferentes no Japão em comparação ao Brasil.
No entanto, este artigo revela uma falha engraçada e frustrante na forma como esse bibliotecário trabalha. Ele conhece os fatos, mas esquece de usá-los ao falar com você.
Aqui está a divisão da pesquisa usando analogias simples:
1. O Teste: O Jogo do "Detetive Cultural"
Os pesquisadores criaram um jogo chamado CAPRI (Inferência de Resposta Cultural e Pragmática). Imagine um chatbot conversando com um usuário. O usuário deixa pistas sutis sobre de onde é, como mencionar um site francês específico (Fnac.com) ou usar um formato de número de telefone francês.
O chatbot tem dois trabalhos:
- Detectar a Pista: Descobrir: "Ah, este usuário provavelmente é francês".
- Adaptar a Resposta: Quando o usuário pergunta "Qual é a temperatura?" (mostrando a imagem de um termômetro), o bot deve dizer "40°C" (estilo francês) em vez de "104°F" (estilo americano).
2. O Problema: O "Sabe-Tudo" Que Não Ouve
Os pesquisadores testaram os modelos de IA mais inteligentes disponíveis. Aqui está o que eles descobriram:
- A Parte de Detetive (Trabalho 1): A IA é incrível nisso. Se você der uma ou duas pistas, ela acerta o país do usuário quase 100% das vezes. Ela conhece os fatos.
- A Parte de Adaptação (Trabalho 2): É aqui que ela falha. Mesmo que a IA saiba que o usuário é francês, ela frequentemente ignora esse conhecimento e fornece a resposta em unidades americanas (Fahrenheit) de qualquer maneira.
A Analogia: É como um garçom que sabe que você é vegetariano (porque você disse a ele que não come carne), mas quando você pede um hambúrguer, ele ainda traz um bife porque está no "piloto automático" e não conectou os pontos entre sua identidade e seu pedido.
3. A Solução: "Pensar em Voz Alta"
Os pesquisadores tentaram um truque para corrigir isso. Eles pediram para a IA pensar em voz alta antes de responder. Eles disseram: "Primeiro, descubra de onde o usuário é. Depois, decida qual unidade usar com base nisso".
Quando fizeram isso, a IA melhorou muito. Foi como dizer ao garçom: "Pare e pense: Espera, esta pessoa é vegetariana. Eu preciso trocar o bife por uma salada". Uma vez que a IA foi forçada a pausar e raciocinar passo a passo, ela finalmente começou a dar respostas culturalmente apropriadas.
4. O "Viés de Configuração Padrão"
O artigo também observou o que acontece quando a IA não tem pistas (nenhum número de telefone, nenhum site mencionado).
- Palpite de País: Se a IA tiver que adivinhar o país sem pistas, ela geralmente adivinha os Estados Unidos.
- Palpite de Unidade: Mas aqui está a reviravolta: embora ela adivinhe os EUA, ela frequentemente ainda usa o sistema métrico (Celsius, quilômetros), que os EUA não usam.
É como se a IA tivesse uma "personalidade padrão" que é uma mistura de um cidadão americano que fala como um europeu. Ela não é verdadeiramente neutra; possui seus próprios vieses ocultos baseados em onde o modelo foi construído e em quais dados foi treinado.
5. Coisas Subjetivas (Tempo e "Alguns")
Os pesquisadores também testaram conceitos "elásticos" que não têm regras estritas, como que hora do dia é (é 18h "noite" ou "tarde"?) ou quantos ovos há em uma cesta ("alguns" ou "um pouco").
- A Boa Notícia: À medida que a IA recebe mais pistas, ela começa a mudar suas respostas para corresponder a diferentes culturas.
- A Má Notícia: Sem pistas, as respostas "padrão" da IA frequentemente inclinam-se para a cultura da empresa que construiu o modelo (ex: um modelo chinês inclina-se para interpretações chinesas, um modelo dos EUA para as americanas).
A Conclusão
O artigo conclui que os modelos de IA atuais são como enciclopédias que ainda não aprenderam a ser bons conversadores. Eles armazenam fatos culturais em uma parte de seu cére-lo e a habilidade de usá-los em outra, mas não conectam automaticamente as duas coisas.
Para torná-los verdadeiramente úteis, não podemos apenas confiar que eles "conheçam" a cultura; temos que ensiná-los explicitamente a pausar, pensar sobre com quem estão falando e, então, ajustar sua resposta. Até lá, eles podem saber que você é francês, mas ainda assim lhe dirão a temperatura em Fahrenheit.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.