← Últimos artigos
💬 NLP

Reasoning or a Semblance of it? A Diagnostic Study of Transitive Reasoning in LLMs

Este artigo investiga se o LLaMA 2 e o Flan-T5 exibem um raciocínio transitivo genuíno ou se dependem de pistas superficiais ao controlar sobreposições de palavras, conhecimento pré-treinado e entidades nomeadas, revelando que, embora ambos os modelos utilizem sobreposições lexicais, o Flan-T5 demonstra maior resiliência a manipulações baseadas em conhecimento, sugerindo um papel potencial do ajuste fino no desenvolvimento da compreensão lógica.

Autores originais: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

Publicado 2026-09-10
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Houman Mehrafarin, Arash Eshghi, Ioannis Konstas

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No campo rapidamente evolutivo da inteligência artificial, um tipo específico de programa de computador conhecido como Modelo de Linguagem de Grande Escala capturou a atenção do mundo. Esses sistemas, treinados em vastas quantidades de texto da internet, podem escrever histórias, traduzir idiomas e responder a perguntas complexas. Uma questão central para os cientistas que estudam essas máquinas é se elas realmente compreendem a lógica ou se estão apenas mimetizando os padrões que viram antes. Para testar isso, os pesquisadores observam uma habilidade fundamental chamada raciocínio transitivo. Em termos cotidianos, isso é a capacidade de conectar duas informações separadas para chegar a uma nova conclusão. Por exemplo, se uma pessoa sabe que um gato é um tipo de animal, e que todos os animais precisam de comida, ela pode deduzir logicamente que um gato precisa de comida sem que lhe seja dito explicitamente esse fato específico. Esse processo requer mais do que apenas memória; exige a capacidade de tecer fatos uns nos outros. A questão que impulsiona a pesquisa recente é se esses poderosos programas de computador estão realmente realizando essa tecelagem mental ou se estão pegando um atalho ao identificar palavras familiares e adivinhar a resposta.

Uma equipe de pesquisadores da Heriot-Watt University e da University of Edinburgh partiu para investigar exatamente este problema. Eles se concentraram em dois tipos distintos de modelos de linguagem, um chamado LLaMA 2 e outro chamado Flan-T5, para ver como eles lidavam com perguntas que exigiam a conexão de dois fatos. Os cientistas utilizaram duas coleções existentes de perguntas projetadas para testar esse tipo de pensamento. Uma coleção, conhecida como QASC, apresenta perguntas de múltipla escolha sobre ciência que exigem a combinação de duas afirmações para encontrar a resposta correta. A outra coleção, chamada Bamboogle, contém perguntas que são difíceis o suficiente para que um mecanismo de busca padrão da internet possa errá-las, forçando o modelo a depender de seu próprio processamento. Os pesquisadores queriam saber se os modelos estavam realmente raciocinando através dos passos ou se estavam apenas se agarrando a palavras específicas, como datas ou nomes, que apareciam tanto na pergunta quanto na resposta.

Para encontrar a verdade, a equipe desenhou uma série de experimentos inteligentes onde alteraram sistematicamente a informação dada aos modelos. Eles começaram verificando se os modelos conseguiam resolver os problemas quando recebiam os fatos e um exemplo claro de como conectá-los. Ambos os modelos tiveram um bom desempenho sob estas condições, mas os pesquisadores suspeitavam que isso poderia ser fácil demais. Eles então removeram o exemplo de como conectar os fatos, deixando os modelos para descobrirem por conta própria. O resultado foi revelador. O modelo Flan-T5, que havia sido especificamente treinado em tarefas de raciocínio semelhantes, continuou a ter um desempenho muito bom mesmo sem o exemplo. O modelo LLaMA 2, no entanto, teve dificuldades significativas sem esse direcionamento, sugerindo que dependia fortemente de ver o padrão de raciocínio antes de conseguir segui-lo.

Os pesquisadores então adotaram uma abordagem mais drástica para ver se os modelos compreendiam verdadeiramente o significado das palavras. Eles embaralharam a ordem das palavras dentro dos fatos, transformando frases claras em sequências de texto confusas e sem sentido. Se os modelos estivessem realmente raciocinando sobre o significado, esse caos deveria ter tornado as respostas impossíveis de encontrar. Surpreendentemente, o desempenho dos modelos mal caiu. Eles ainda eram capazes de escolher a resposta correta mesmo quando as frases não faziam sentido gramatical. Isso sugeriu que os modelos não estavam lendo as frases como pensamentos coerentes. Em vez disso, eles provavelmente estavam escaneando em busca de palavras-chave específicas que correspondiam às opções de resposta. Quando os pesquisadores removeram essas palavras-chave correspondentes inteiramente, a precisão dos modelos despencou, confirmando que eles estavam frequentemente apenas combinando palavras em vez de deduzir a lógica.

Para descartar a possibilidade de os modelos estarem simplesmente memorizando as respostas de seus dados de treinamento, a equipe recorreu ao conjunto de dados Bamboogle, que continha perguntas que os modelos nunca haviam visto antes. Aqui, introduziram um teste final e rigoroso. Eles pegaram os nomes de pessoas, lugares e datas — as entidades específicas que frequentemente aparecem nas respostas — e os substituíram por palavras sem sentido. Eles também embaralharam a ordem das palavras nos fatos. Quando confrontados com essas versões de palavões e termos desconexos, o modelo LLaMA 2 falhou quase completamente. Ele não conseguia encontrar a resposta sem os nomes e datas familiares para guiá-lo. O modelo Flan-T5, contudo, mostrou um tipo diferente de resiliência. Embora seu desempenho tenha caído, ele permaneceu significativamente melhor que o outro modelo. Isso sugere que, como o Flan-T5 foi explicitamente treinado em tarefas de raciocínio, ele desenvolveu uma capacidade mais robusta de seguir a cadeia lógica, mesmo quando as pistas familiares foram removidas.

O estudo conclui que, embora os grandes modelos de linguagem possam parecer raciocinar, seu sucesso depende frequentemente da maneira específica como foram treinados e das pistas disponíveis no texto. Para modelos que não foram especificamente ajustados para tarefas de raciocínio, a capacidade de responder a perguntas complexas parece depender fortemente do reconhecimento de palavras e padrões familiares, em vez de uma dedução lógica genuína. Mesmo quando parecem estar pensando passo a passo, eles podem estar simplesmente detectando as palavras-chave certas. No entanto, a pesquisa sugere que, quando um modelo é cuidadosamente treinado em conjuntos de dados projetados para ensiná-lo como conectar fatos, ele pode desenvolver uma capacidade mais genuína de raciocínio transitivo. Essa capacidade permite que ele lide com perguntas mesmo quando os atalhos usuais, como nomes ou datas reconhecíveis, são removidos. As descobertas servem como um lembrete de que pontuações altas em testes de raciocínio nem sempre provam que uma máquina entende a lógica; às vezes, ela é apenas muito boa em encontrar as palavras certas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →