← Últimos artigos
💬 NLP

Assessment of Evolving Large Language Models in Upper Secondary Mathematics

Este estudo demonstra que os modelos de linguagem de grande escala em evolução avançaram rapidamente na proficiência matemática, progredindo de um desempenho moderado para alcançar pontuações quase perfeitas no exame de matrícula do ensino secundário finlandês, destacando assim o seu potencial como ferramentas poderosas para apoiar o ensino da matemática.

Autores originais: Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

Publicado 2026-06-18
📖 4 min de leitura☕ Leitura rápida

Autores originais: Mika Setälä, Pieta Sikström, Ville Heilala, Tommi Kärkkäinen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a uma corrida onde os corredores não são humanos, mas diferentes versões de "supercérebros" (Modelos de Linguagem de Grande Escala ou LLMs). A pista em que eles correm é o Exame de Matemática do Ensino Médio da Finlândia, um teste notoriamente difícil que determina se os alunos podem ingressar na universidade.

Aqui está a história de como esses corredores digitais evoluíram de iniciantes tropeçantes para campeões perfeitos, baseada no artigo de pesquisa.

A Linha de Partida: A Fase "Bebê" (Agosto de 2023)

No início da corrida, os corredores de IA eram como alunos que tinham acabado de começar a aprender álgebra.

  • O Corredor: Uma versão inicial do GPT-4 da OpenAI.
  • O Resultado: Ele marcou 64 de 120. No sistema de notas finlandês, esta é uma nota de aprovação, mas baixa (Nota "E"). Era como um aluno que passou na disciplina, mas por muito pouco.
  • O Competidor: O "Bard" do Google estava ainda mais atrás, marcando 34 (Nota "C"), o que é como um aluno que reprovou no exame.

Nesta fase, o artigo observa que esses modelos de IA eram bons em coisas simples, mas tinham dificuldade com a lógica complexa necessária para a matemática do ensino médio. Eles eram como calculadoras que às vezes esqueciam como multiplicar.

A Montagem de Treinamento: Ficando Mais Inteligentes (Final de 2023 – Início de 2024)

Os pesquisadores verificaram novamente alguns meses depois. Os corredores de IA tinham estado "treinando" arduamente.

  • A Atualização: A IA aprendeu a usar ferramentas, especificamente uma linguagem de programação chamada Python. Pense nisso como o corredor subitamente sendo permitido a usar uma bicicleta de alta tecnologia em vez de apenas correr a pé.
  • O Resultado: Até o final de 2023, o corredor GPT-4 disparou para 93 de 120, conquistando a nota máxima ("L"). Agora ele conseguia resolver problemas complexos de geometria que envolvem o espaço 3D, algo que anteriormente achava impossível.
  • A Lacuna: No entanto, nem todos os corredores melhoraram na mesma velocidade. No início de 2024, uma versão gratuita da IA do Google ainda estava presa no meio do pelotão, enquanto as versões pagas da IA da OpenAI e da Microsoft estavam liderando a corrida.

A Linha de Chegada: A Era "Super-humana" (Janeiro de 2025)

Quando os pesquisadores realizaram o teste final no início de 2025, a corrida havia mudado completamente. Os corredores de IA não estavam apenas competindo; eles estavam quebrando o placar.

  • Os Novos Campeões: Dois novos corredores, DeepSeek R1 e o3 da OpenAI, cruzaram a linha de chegada com uma pontuação perfeita de 120 de 120.
  • O Significado: Esses modelos não apenas passaram no exame; eles pontuaram mais alto do que quase qualquer estudante humano jamais pontuou. Na verdade, se esses modelos de IA fossem estudantes reais se candidatando às universidades finlandesas hoje, eles seriam aceitos nos programas mais competitivos (como medicina ou engenharia) e provavelmente estariam no topo do grupo de candidatos.

Como Eles Ficaram Tão Rápidos? (O Ingrediente Secreto)

O artigo explica que esses modelos não apenas "memorizaram" mais matemática. Eles mudaram a forma como pensam.

  • Cadeia de Pensamento (Chain of Thought): Imagine um humano resolvendo um quebra-cabeça difícil. Eles não apenas adivinham a resposta; eles fazem uma pausa, pensam passo a passo, verificam seu trabalho e corrigem erros se ficarem travados. Os novos modelos de IA (como o "o1" e o "o3" da OpenAI) fazem o mesmo. Eles simulam um "processo de pensamento" antes de responder, permitindo que detectem seus próprios erros.
  • Autocorreção: Modelos antigos eram como um aluno que escreve uma resposta e a entrega imediatamente. Os novos modelos são como um aluno que escreve um rascunho, percebe um erro, reescreve a solução e então a entrega. Esse pensamento "deliberativo" é o que permitiu que obtivessem pontuações perfeitas.

O Ponto Principal

O artigo conclui que o "cérebro matemático" dessas ferramentas de IA evoluiu incrivelmente rápido em apenas alguns anos.

  • O que eles podem fazer: Eles agora conseguem resolver exames de matemática difíceis e de alto nível melhor do que o estudante humano médio, frequentemente alcançando pontuações perfeitas.
  • O que o artigo pergunta a seguir: O artigo não afirma que essas IAs estão prontas para serem professores ainda. Ele pergunta: Só porque eles conseguem resolver o problema perfeitamente, será que eles conseguem realmente explicá-lo para um aluno confuso de uma forma útil? O artigo sugere que, embora a parte de "resolver" tenha sido dominada, a parte de "ensinar" é o próximo grande desafio.

Em resumo: A IA passou de um aluno com dificuldades para um gênio da matemática em tempo recorde, mas a questão agora é se ela pode ser um bom tutor.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →