← Últimos artigos
🤖 AI

Human-Level Reasoning: A Comparative Study of Large Language Models on Logical and Abstract Reasoning

Este estudo avalia e compara as capacidades de raciocínio lógico e abstrato de nove proeminentes Grandes Modelos de Linguagem em relação ao desempenho humano utilizando oito questões desenhadas sob medida, revelando lacunas significativas nas habilidades dedutivas dos modelos.

Autores originais: Benjamin Grando Moreira

Publicado 2026-06-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Benjamin Grando Moreira

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma sala cheia de bibliotecários incrivelmente talentosos. Esses bibliotecários (os Grandes Modelos de Linguagem, ou LLMs) leram quase todos os livros do mundo. Eles podem recitar fatos, escrever poemas e traduzir idiomas mais rápido do que qualquer pessoa. Mas a pergunta que este artigo faz é: eles realmente entendem o que estão lendo, ou são apenas muito bons em adivinhar a próxima palavra de uma frase?

Para descobrir, o autor, Benjamin Grando Moreira, montou uma "academia de lógica" e convidou 15 desses bibliotecários digitais para competir contra um grupo de estudantes e professores humanos.

Aqui está uma divisão simples do que aconteceu, usando algumas metáforas do cotidiano.

O Teste: Uma Caixa de Quebra-Cabeças, Não um Quiz de Trivia

Em vez de perguntar aos modelos "Quem foi o primeiro presidente?" (o que eles podem responder por memória), o pesquisador deu a eles 8 enigmas complicados. Esses enigmas eram como charadas que exigiam que os modelos descobrissem regras ocultas, não apenas recordassem fatos.

Pense da seguinte forma:

  • O Cérebro Humano é como um detetive que observa pistas, conecta pontos e diz: "Aha! Eu vejo o padrão!"
  • O Cérebro de IA é como uma máquina de correspondência de padrões super-rápida que diz: "Eu já vi esta palavra antes, então vou adivinhar a próxima palavra com base no que geralmente a segue."

Os 8 Desafios (A "Pista de Obstáculos")

O artigo testou os modelos em coisas como:

  1. O Enigma do Dia da Semana: Se "DOM + 1 = SEG", o que é "TER + 2?" (A maioria dos modelos acertou, mas alguns se confundiram com as abreviações).
  2. A Canção do Elefante: Um padrão bobo onde o número de vezes que você diz "bother" muda dependendo se o número de elefantes é ímpar ou par. Humanos viram o padrão facilmente; muitas IAs ficaram presas na repetição.
  3. O Código Secreto: Um deslocamento simples de letras (como A se torna B). A maioria dos modelos decifrou isso, mas alguns erraram a capitalização.
  4. A Pergunta de Matemática com Truque: "Quanto é 3 + 3 x 5?" A resposta correta é 18. Mas o teste deu opções como 16, 20, 30 e 45. 18 nem sequer era uma opção!
    • O Twist: Muitos modelos (e alguns humanos) se confundiram. Eles viram que a matemática estava certa, mas as opções estavam erradas, e alguns simplesmente escolheram a resposta errada mais "próxima" em vez de dizer: "Ei, nenhuma destas está correta."
  5. O Mistério do Mês: Este foi o mais difícil. Pedia para encontrar um código oculto para o mês "Maio". O código envolvia elevar ao quadrado o número do mês (5 ao quadrado = 25) e contar as letras da palavra "Maio" (4 letras), depois juntar os números para obter 254.
    • O Resultado: Humanos foram razoáveis nisso, mas as IAs falharam na maioria das vezes. Elas tentaram usar fórmulas matemáticas complexas que não se encaixavam, em vez de ver o truque simples de "juntar os números".
  6. A Troca de Idioma: Combinar abreviações de meses em Português com nomes em Espanhol. Humanos tiveram dificuldade aqui se não soubessem Espanhol, mas as IAs (que conhecem muitos idiomas) gabaritaram.
  7. O Dia Bilíngue: Uma mistura de dias da semana em Inglês e Português com uma regra oculta sobre quando trocar de idioma. Tanto humanos quanto IAs acharam isso difícil.
  8. O Código Binário: Somar números que parecem estar na base-10 (como 1000), mas que são, na verdade, em base-2 (binário). Apenas as IAs mais inteligentes perceberam: "Espera, estes não são números normais!" e resolveram o problema.

O Placar: Quem Venceu?

O pesquisador deu pontos por:

  • 10 pontos: Acertar a resposta.
  • 5 pontos: Acertar a lógica, mesmo que o número final estivesse errado.
  • 0 pontos: Errar ou desistir.

Os Resultados:

  • Os Humanos: Os professores (os especialistas) foram os que melhor se saíram no geral, especialmente nos enigmas complicados. Os estudantes foram bem, mas tiveram mais dificuldade com os enigmas abstratos.
  • As IAs: Em média, as IAs pontuaram cerca de 73 pontos de 100, enquanto os humanos pontuaram cerca de 70.
    • Espere, as IAs venceram? Sim, ligeiramente! Mas aqui está o detalhe: as IAs foram ótimas nas coisas fáceis (como saber os meses em diferentes idiomas) e terríveis nas coisas estranhas e abstratas (como a canção do elefante ou o código numérico oculto).
    • Os melhores modelos de IA (como GPT-4o e Claude) pontuaram quase a perfeição, mas os modelos mais fracos (como Sabiá 3) pontuaram muito baixo.

A Grande Conclusão

O artigo conclui que esses modelos de IA são como papagaios brilhantes. Eles podem imitar a conversa humana e resolver problemas padrão perfeitamente. No entanto, quando você pede para eles pensarem fora da caixa, detectarem um padrão estranho ou perceberem que uma pergunta é um truque, eles frequentemente tropeçam.

  • Humanos são melhores em "inteligência fluida" — descobrir novas regras sobre a hora.
  • IAs são melhores em "inteligência cristalizada" — usar a enorme quantidade de dados que já memorizaram.

O estudo mostra que, embora a IA esteja ficando assustadoramente boa em falar, ela ainda não dominou completamente a arte de pensar da mesma forma que um humano, especialmente quando as regras do jogo são ocultas ou incomuns. A IA ainda está, principalmente, adivinhando com base no que já viu antes, em vez de compreender verdadeiramente a lógica por trás do enigma.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →