← Últimos artigos
💻 computer science

LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis

Este estudo demonstra que o GPT-5.4 pode aproximar-se do desempenho humano na análise de conteúdo indutiva de dados de questionários, alcançando níveis de concordância de codificação e geração de temas comparáveis à consistência interna humana, validando, assim, o seu potencial como uma ferramenta de suporte escalável para a pesquisa qualitativa.

Autores originais: Leonardo Bergmann, Renata Gheorghiu, Ana Gvritishvili, Alex Mican, Chris Stewart, Topias Tolonen-Weckström

Publicado 2026-09-16
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Leonardo Bergmann, Renata Gheorghiu, Ana Gvritishvili, Alex Mican, Chris Stewart, Topias Tolonen-Weckström

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A pesquisa qualitativa é a arte de dar sentido às palavras. Quando cientistas, sociólogos ou formuladores de políticas precisam compreender os pensamentos, sentimentos e experiências das pessoas, eles frequentemente fazem perguntas abertas. Em vez de marcar uma caixa, uma pessoa escreve um parágrafo sobre sua vida, seus problemas ou suas esperanças. Para transformar milhares desses parágrafos em conhecimento útil, os pesquisadores devem ler cada um deles, encontrar as ideias recorrentes e agrupá-las em categorias. Esse processo, conhecido como análise de conteúdo, é a espinha dorsal da compreensão do comportamento humano, mas é incrivelmente lento e exigente. Durante décadas, a única maneira de fazer isso era com mentes humanas, lendo linha por linha. Agora, um novo tipo de ferramenta entrou na sala: modelos de linguagem de grande escala. Estes são sistemas de inteligência artificial treinados em vastas quantidades de texto que podem ler, compreender e resumir a linguagem. A grande questão para a comunidade científica não é apenas se essas máquinas conseguem ler, mas se elas conseguem pensar como um pesquisador humano quando a tarefa exige encontrar padrões ocultos sem um manual de regras pré-definido.

Uma equipe de pesquisadores de universidades de toda a Europa partiu para responder a essa questão com uma comparação direta. Eles utilizaram um conjunto de dados do mundo real proveniente de um questionário aplicado a 2.800 estudantes de doutorado em toda a Europa, onde 10% das respostas foram selecionadas aleatoriamente para servir de base para o estudo. Deste grupo amostral, um total de 903 respostas, distribuídas por seis perguntas abertas específicas, foram analisadas detalhadamente. De um lado do experimento, cinco pesquisadores humanos leram essas respostas e realizaram o que é chamado de análise de conteúdo indutiva. Isso significa que eles não começaram com uma lista de categorias para forçar as respostas dentro delas. Em vez disso, leram o texto, identificaram as ideias centrais, criaram seus próprios rótulos para essas ideias e, em seguida, agruparam esses rótulos em temas mais amplos. É um processo criativo e interpretativo, que depende do julgamento humano para decidir o que é importante. Do outro lado, os pesquisadores utilizaram um modelo de linguagem sofisticado para realizar exatamente a mesma tarefa no mesmo texto. A máquina recebeu as mesmas instruções para ler as respostas, encontrar as ideias principais e agrupá-las em temas, tudo isso sem ser informada sobre o que procurar antecipadamente.

Os pesquisadores então compararam os dois conjuntos de resultados para ver o quão próximo a máquina se aproximava dos humanos. Eles não buscaram uma correspondência perfeita, pois até diferentes especialistas humanos discordam sobre como rotular uma frase específica. Em vez disso, mediram o alinhamento geral dos grupos. Os resultados mostraram um nível moderado de concordância. Ao observar os rótulos específicos que os pesquisadores e a máquina criaram para o texto, houve concordância em 61 por cento das vezes. Ao observar os temas mais amplos construídos a partir desses rótulos, a concordância foi ligeiramente inferior, em 54 por cento. Para colocar isso em perspectiva, os pesquisadores também verificaram o quanto os cinco especialistas humanos concordavam entre si. Os humanos concordaram entre si cerca de 68 por cento das vezes nos rótulos e temas. Isso significa que a lacuna entre o humano e a máquina não era grande; a máquina desempenhou de forma quase tão consistente quanto um especialista humano desempenha com outro especialista humano.

No entanto, a história não é uniforme em todos os tópicos. A concordância entre os humanos e a máquina variou significamente dependendo do que os estudantes estavam escrevendo. Para questões relativas a situações financeiras, a máquina teve mais dificuldades, apresentando um menor alinhamento com os pesquisadores humanos. Para questões sobre experiências pessoais ou feedback geral, o alinhamento foi muito mais forte. O estudo sugere que a confiabilidade da máquina depende fortemente da natureza dos dados e da clareza do texto. Quando o texto era ambíguo ou a lógica interna do próprio agrupamento da máquina era instável, a concordância com os humanos caía. Os pesquisadores descobriram que sempre que a máquina era inconsistente consigo mesma, ela também era inconsistente com os humanos, e o mesmo ocorria com a equipe humana. Isso indica que a dificuldade do tópico específico desempenha um papel crucial em quão bem a ferramenta funciona.

Os codificadores humanos que participaram do estudo também foram questionados sobre suas impressões do trabalho da máquina. Eles relataram que as categorizações da máquina refletiam seu próprio pensamento e que confiariam na ferramenta para ajudar a analisar dados futuros. Os pesquisadores concluíram que esses sistemas de inteligência artificial não estão prontos para substituir totalmente o julgamento humano, especialmente para o trabalho complexo e de alto nível de construção de teorias. No entanto, as descobertas sugerem que essas ferramentas são altamente eficazes ao lidar com as etapas iniciais e intensivas de mão de obra da triagem de textos. Elas podem realizar o trabalho pesado de ler milhares de respostas e encontrar os padrões iniciais, permitindo que os pesquisadores humanos se concentrem na interpretação mais profunda e na validação desses padrões. O estudo não afirma que a máquina é perfeita ou que resolveu o problema da análise de texto, mas sugere que ela é uma parceira poderosa e escalável para pesquisadores que precisam dar sentido a grandes volumes de histórias humanas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →