← Últimos artigos
💬 NLP

Before You Poll with LLMs: A Deliberative Diagnostic Framework

Este artigo introduz o Deliberative Polling Diagnostic Framework para revelar que os atuais LLMs de fronteira falham em mimetizar a atualização de crenças humana durante a deliberação, exibindo, em vez disso, distorções únicas e específicas de identidade, como reversão de opinião, excesso (overshooting) ou rigidez, impulsionadas por um fenômeno denominado "signature self-sycophancy".

Autores originais: Ahmed Wali, Hassaan Tayyab

Publicado 2026-09-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ahmed Wali, Hassaan Tayyab

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde governos, empresas e pesquisadores não precisam mais gastar meses e milhões de dólares realizando pesquisas com pessoas reais para entender a opinião pública. Em vez disso, eles poderiam pedir a um programa de computador para simular milhares de diferentes cidadãos, apresentar a essas personas digitais novos argumentos e observar como suas mentes mudam. Essa prática, conhecida como amostragem de silício (silicon sampling), cresceu rapidamente porque é rápida, barata e escalável. A esperança é que esses agentes artificiais consigam mimetizar o raciocínio humano o suficiente para prever como as pessoas reais reagirão a novas informações. No entanto, uma questão crítica permanece sem resposta: esses programas de computador realmente pensam e atualizam suas crenças como os humanos fazem, ou estão simplesmente recuperando opiniões pré-escritas de uma vasta biblioteca de dados? Se isso for verdade, usar esses modelos para testar como as pessoas podem mudar de ideia poderia levar a conclusões perigosamente erradas.

Pesquisadores da Universidade de Gestão de Lahore estabeleceram o objetivo de responder a essa pergunta criando uma nova forma de testar a inteligência artificial. Eles se concentraram em um comportamento humano específico chamado deliberação, que é o processo de mudar de ideia após ouvir argumentos equilibrados. No mundo real, quando pessoas de lados políticos opostos ouvem informações justas sobre uns aos outros, elas tendem a se tornar menos hostis e mais abertas. Os pesquisadores queriam ver se os modelos de computador poderiam replicar essa mudança específica. Eles utilizaram dados de um famoso evento do mundo real chamado "America in One Room", onde 526 eleitores reais foram reunidos para discutir política, e usaram isso como uma linha de base. Em seguida, pediram a cinco dos modelos de computador mais avançados disponíveis que simulassem esses mesmos eleitores, fornecendo-lhes exatamente a mesma informação e fazendo as mesmas perguntas antes e depois do briefing.

Os resultados revelaram uma verdade alarmante: nenhum dos modelos de computador se comportou como os humanos reais. Em vez de atualizarem suas crenças de uma forma realista, todos os modelos falharam, mas cada um falhou de sua própria maneira única e estranha. Um dos modelos mais poderosos, o GPT-5.1, fez exatamente o oposto do que os humanos fazem. Quando apresentado com informações equilibradas sobre o partido político oposto, os eleitores reais tornaram-se mais amigáveis e menos hostis. As personas de computador, no entanto, tornaram-se significativamente mais hostis, como se a nova informação os tivesse deixado mais irritados. Este é um fenômeno que os pesquisadores chamam de reversão, onde o modelo se move na direção errada inteiramente.

Outros modelos não reverteram a direção, mas foram longe demais. Modelos como Gemini, Claude e Llama até se moveram na direção correta, tornando-se menos hostis após ouvirem os argumentos, mas mudaram de ideia cinco a sete vezes mais do que um humano faria. Era como se fossem excessivamente ávidos por serem persuadidos, oscilando suas opiniões drasticamente com o menor estímulo. Um quarto modelo, o DeepSeek, recusou-se a mudar qualquer coisa, mostrando quase nenhum deslocamento de opinião, independentemente da informação fornecida. Essa rigidez significava que ele agia como se os novos argumentos não tivessem efeito algum.

Os pesquisadores investigaram mais profundamente para entender por que esses fracassos aconteceram. Eles descobriram que os problemas não eram aleatórios; eram desencadeados especificamente por perguntas sobre identidade política. Quando os modelos eram questionados sobre detalhes de políticas, eles performavam razoavelmente bem. Mas quando as perguntas tocavam em como um partido via o outro, os modelos falhavam. As personas de computador pareciam estar interpretando um estereótipo em vez de raciocinar através dos novos fatos. Os pesquisadores chamaram esse comportamento de auto-sifocância (self-sycophancy). É uma forma de lisonja onde o modelo concorda com a própria ideia interna do que um certo tipo de pessoa deveria acreditar, em vez de ouvir a informação apresentada. Por exemplo, se o modelo fosse instruído a agir como um Republicano, ele assumiria que um Republicano deveria odiar o partido oposto e manteria essa suposição mesmo quando as evidências sugerissem o contrário.

Este comportamento é distinto do tipo de viés onde um computador tenta agradar a um usuário humano. Aqui, o computador está agradando ao seu próprio roteiro interno. O estudo mostrou que essa falha é seletiva e simétrica; o mesmo modelo agiria de forma hostil contra o partido oposto, mas excessivamente amigável em relação ao seu próprio, dependendo da pergunta. Isso sugere que os modelos não estão simulando um processo de pensamento, mas sim recuperando atitudes pré-empacotadas e armazenadas em cache associadas a rótulos políticos. Os pesquisadores testaram isso trocando os rótulos políticos em seus comandos (prompts) e descobriram que as reações dos modelos mudavam instantaneamente, confirmando que estavam reagindo ao rótulo e não à lógica do argumento.

As implicações dessas descobertas são significativas para qualquer pessoa que dependa de simulações de computador para entender a sociedade. Se um modelo reverte a direção, ele pode convencer um formulador de políticas de que uma discussão pública tornará as pessoas mais irritadas, quando, na realidade, ela as tornaria mais calmas. Se um modelo ultrapassa o limite, ele pode exagerar o poder de uma campanha educativa, levando ao desperdício de recursos. Se um modelo é rígido, ele pode sugerir que nenhuma quantidade de informação pode mudar a mente de uma pessoa, minando o próprio conceito de debate público. Os pesquisadores concluem que, antes de confiar em qualquer modelo de computador para simular como as pessoas mudam de ideia, devemos primeiro realizar um teste de diagnóstico para ver se o modelo consegue realmente raciocinar através de novas informações ou se está apenas recitando estereótipos. Sem essa verificação, a velocidade e a escala da amostragem de silício podem nos levar a acreditar que entendemos a natureza humana, quando, na verdade, estamos apenas vendo um reflexo distorcido de nossos próprios preconceitos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →