Challenges in annotations by humans and LLMs: A case study of evaluative language
Este artigo compara anotações humanas e de modelos de linguagem de grande escala (LLM) de linguagem avaliativa em transcrições de palestras TED usando a Teoria da Avaliação, constatando que os LLMs superam tanto linguistas treinados quanto estagiários em tarefas de anotação complexas, demonstrando, assim, seu potencial para apoiar a pesquisa em humanidades digitais.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Resumo Técnico: Desafios nas Anotações por Humanos e LLMs: Um Estudo de Caso sobre Linguagem Avaliativa
Definição do Problema
O artigo aborda a crescente complexidade das tarefas de anotação nas humanidades digitais e ciências sociais computacionais, focando especificamente na identificação e classificação da linguagem avaliativa. Embora os Grandes Modelos de Linguagem (LLMs) tenham mostrado promessa em tarefas de PLN não supervisionadas, sua capacidade de igualar ou exceder o desempenho humano em estruturas teóricas altamente subjetivas e complexas permanece não verificada. O estudo foca na Teoria da Avaliação (Appraisal theory) (Martin & White, 2005), um modelo funcional para linguagem avaliativa, especificamente seu subsistema de Atitude (Afeto, Julgamento, Apreciação). Os autores destacam que a anotação manual dessas categorias é demorada, propensa a um baixo acordo entre anotadores (IAA) e complicada pela dependência de contexto, significados implícitos e pela dificuldade de distinguir entre categorias sutis. O problema central de pesquisa é determinar se os LLMs encontram os mesmos desafios que os anotadores humanos nessas tarefas complexas e se podem servir como ferramentas eficazes para resolver tais dificuldades de anotação.
Metodologia
O estudo emprega um estudo de caso de métodos mistos utilizando um corpus de 190 transcrições de palestras TED em inglês (o corpus EmotionalizTED) abrangendo onze domínios (ex: Ciência, Política, Medicina). A metodologia é dividida em três fases:
Anotação Humana:
- Anotadores: 24 estudantes de linguística em treinamento (não nativos de inglês, a maioria alemães) e um pesquisador sênior (atuando como o padrão ouro/gold standard).
- Tarefa: Classificação de nível de sentença de conteúdo avaliativo. Os anotadores primeiro determinaram se uma sentença era avaliativa (binário) e depois a classificaram nas categorias de Atitude: Afeto, Julgamento, Apreciação, Ambíguo ou Incerto. A rotulagem múltipla foi permitida.
- Avaliação: O Acordo Entre Anotadores (IAA) foi medido usando o Kappa de Cohen (para avaliatividade binária) e o alfa de Krippendorff (para subclassificação multiclasse). Uma análise de erro qualitativa foi realizada para identificar fontes de discordância.
Anotação Automática (LLM):
- Engenharia de Prompt: Três variações distintas de prompt foram projetadas e comparadas usando o modelo qwen3-30b-a3b-instruct-25075. Estas incluíram abordagens de poucos disparos (few-shot) e zero disparos (zero-shot), com variações em contexto, persona, restrições e a inclusão de raciocínio de Cadeia de Pensamento (CoT - Chain-of-Thought).
- Seleção e Ajuste do Modelo: O prompt de melhor desempenho foi aplicado a três LLMs diferentes. O modelo mais eficaz foi subsequentemente ajustado via QLoRA para otimizar o desempenho.
- Processo: Os LLMs seguiram um processo de duas etapas: (1) classificação binária de avaliatividade e (2) classificação multiclasse de categorias de Atitude para sentenças avaliativas.
Análise Comparativa:
- O desempenho do LLM ajustado foi comparado contra o padrão ouro (pesquisador sênior) e os estudantes anotadores.
- O estudo investigou especificamente se os LLMs tiveram dificuldades com os mesmos fenômenos linguísticos específicos (ex: significado implícito, identificação de alvo) que causaram baixo acordo entre humanos.
Principais Resultados
- Desempenho Humano: O acordo entre anotadores entre os linguistas estudantes foi variável e frequentemente baixo. O acordo sobre a decisão binária "avaliativo vs. não-avaliativo" variou de leve a moderado (Kappa 0,51 em alguns domínios como Entretenimento e Política, mas caindo significativamente em História e Psicologia). O acordo sobre as subclasses específicas de Atitude (Afeto, Julgamento, Apreciação) foi ainda menor, com o alfa de Krippendorff frequentemente abaixo de 0,50 e, às vezes, em valores negativos.
- Fontes de Erro Humano: A análise qualitativa revelou que as discordâncias humanas derivaram de:
- Dificuldade em distinguir entre significados explícitos e implícitos.
- Confusão em relação ao "alvo da avaliação" (ex: se uma emoção pertence ao falante ou a um terceiro mencionado).
- Desafios com sentenças longas e complexas contendo significados avaliativos aninhados.
- Variações na proficiência em inglês e no conhecimento específico do domínio.
- Desempenho do LLM: O LLM ajustado alcançou um F1-score de 0,77 contra o padrão ouro.
- Comparação: O LLM superou os anotadores estudantes e, notavelmente, alcançou maior concordância com o pesquisador sênior (padrão ouro) do que os estudantes.
- Alinhamento de Desafios: O estudo descobriu que os LLMs não necessariamente lutaram com os mesmos problemas específicos que os humanos da mesma forma; em vez disso, demonstraram uma capacidade de resolver tarefas de classificação complexas de forma mais consistente do que o grupo de humanos treinados, porém inexperientes.
Principais Contribuições
- Esquema de Anotação: O artigo apresenta um esquema de anotação específico para as categorias de Atitude da Teoria da Avaliação adaptado para análise de nível de sentença em discurso de divulgação científica falado.
- Comparação Empírica: Fornece uma comparação direta entre anotadores humanos (tanto estagiários quanto especialistas) e LLMs em uma tarefa linguística subjetiva e complexa.
- Otimização de Prompt: O estudo demonstra o impacto do design de prompts (incluindo estratégias de CoT e few-shot) no desempenho dos LLMs em anotação pragmática.
Significância e Alegações
Os autores alegam que os LLMs podem auxiliar efetivamente na resolução de tarefas de anotação complexas, potencialmente superando o desempenho de linguistas em treinamento em termos de consistência e concordância com padrões de especialistas. O artigo sugere que, se os LLMs podem anotar com sucesso teorias linguísticas complexas como a Avaliação através de prompting e ajuste fino, isso abre novos caminhos para a pesquisa em humanidades digitais. Especificamente, implica que corpora extensamente anotados manualmente podem não ser estritamente necessários para classificar grandes porções de dados de fala, desde que os LLMs sejam devidamente guiados. O estudo conclui que os LLMs oferecem uma estratégia viável para escalar processos de anotação em campos interdisciplinares, embora reconheça a necessidade de validação de desempenho do modelo tarefa por tarefa.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.