← Últimos artigos
💻 computer science

Testing the capability and performance of Claude Sonnet 4 on the GRE physics test

Este artigo demonstra que o Claude Sonnet 4 alcançou uma pontuação escalonada perfeita de 990 em um exame prático de GRE Physics de 70 questões, excedendo significativamente a hipótese dos autores de 90% de precisão e destacando as fortes capacidades do modelo na resolução de problemas científicos complexos.

Autores originais: Theodore Hamilton

Publicado 2026-07-20
📖 1 min de leitura☕ Leitura rápida

Autores originais: Theodore Hamilton

Artigo original sob licença CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Resumo Técnico: Avaliação de Desempenho do Claude Sonnet 4 no Exame de Física do GRE

Definição do Problema
À medida que a inteligência artificial (IA) se torna cada vez mais integrada na educação básica e no ensino superior, surge a necessidade de avaliar as capacidades dos Modelos de Linguagem de Grande Escala (LLMs) na resolução de problemas científicos complexos e na demonstração de pensamento crítico. Embora pesquisas anteriores indiquem que IAs de uso geral frequentemente enfrentam dificuldades com problemas de física de nível universitário superior (alcançando apenas 35–39% de precisão em campos como óptica e termodinâmica), novos modelos especializados, aprimorados com capacidades de processamento avançadas, sugerem um potencial de melhoria. Este estudo buscou avaliar o desempenho do Claude Sonnet 4, um LLM desenvolvido pela Anthropic, contra uma avaliação de física de nível de pós-graduação padronizada, para determinar se ele poderia exceder uma taxa de precisão de 90% em tarefas de resolução de problemas complexos.

Metodologia
Os pesquisadores utilizaram um exame prático de física do GRE de 70 questões, disponível publicamente (Form GR1775), fornecido pelo Educational Testing Service (ETS). O estudo empregou o seguinte protocolo:

  • Modelo: Claude Sonnet 4, identificado na época como o modelo gratuito mais avançado da Anthropic.
  • Entrada: Cada uma das 70 questões foi enviada individualmente ao modelo como uma captura de tela (screenshot), sem texto ou contexto adicional fornecido.
  • Protocolo de Pontuação: As respostas foram comparadas com o gabarito oficial do ETS. Devido aos limites de mensagens, múltiplas sessões de chat foram iniciadas para processar todas as questões. Crédito parcial foi concedido se o modelo respondesse incorretamente na primeira tentativa, mas corretamente em uma segunda tentativa; caso contrário, as questões foram marcadas como totalmente incorretas.
  • Análise: O número total de respostas corretas foi contabilizado e convertido em uma pontuação escalonada usando a folha de conversão oficial do GRE. O estudo também analisou o desempenho em áreas de conteúdo específicas (Mecânica Clássica, Eletromagnetismo, Mecânica Quântica, Física Atômica, etc.) e comparou o desempenho do modelo contra a média de precisão de candidatos humanos para questões específicas.

Principais Resultados
O estudo gerou os seguintes achados quantitativos e qualitativos:

  • Desempenho Geral: O Claude Sonnet 4 respondeu corretamente a 65 de 70 questões, alcançando uma taxa de precisão de aproximadamente 93%. Isso corresponde a uma pontuação escalonada de 990, que é a pontuação máxima possível no exame de física do GRE.
  • Detalhamento por Área de Conteúdo:
    • Mecânica Quântica e Física Atômica: O modelo alcançou 100% de precisão (16/16 questões).
    • Eletromagnetismo: O modelo obteve 12,5/13 corretas.
    • Mecânica Clássica: Esta foi a área mais fraca do modelo, com uma pontuação de 12,5/14 corretas (89% de precisão).
  • Correlação com o Desempenho Humano: Não foi encontrada correlação entre o desempenho do modelo e a precisão média dos candidatos humanos. Para as 17 questões onde a precisão humana estava entre 20–30%, o modelo perdeu apenas 0,5 ponto em um único problema.
  • Análise de Erros: Quando ocorreram erros, eles foram atribuídos à síntese incorreta, como o erro no cálculo de razões ou a má análise de detalhes específicos dentro do enunciado do problema, em vez de uma falta de compreensão conceitual. O modelo forneceu consistentemente explicações detalhadas para suas respostas escolhidas, o que facilitou a identificação de erros específicos de raciocínio.

Significância e Alegações
O artigo afirma que os resultados apoiam a hipótese de que LLMs de nível de consumo podem resolver e explicar questões em domínios científicos avançados com alta proficiência. Os autores concluem que:

  1. Capacidade de Alto Nível: Os LLMs são capazes de alcançar pontuações máximas em exames de física de pós-graduação, sugerindo um potencial transformador para o estudo e a educação científica.
  2. Utilidade Educacional: Esses modelos servem como ferramentas poderosas para trabalhar questões convolutas sem erro humano, desde que suas limitações no raciocínio sobre conceitos filosóficos ou questões cosmológicas não resolvidas sejam reconhecidas.
  3. Trajetória Futura: Por meio de aprendizado de máquina contínuo e treinamento de usuários, os autores sugerem que os modelos podem eventualmente atingir 100% de precisão. Eles também observam que o desempenho pode variar com base nas versões do modelo (ex: Opus vs. Sonnet) e que assinaturas pagas podem oferecer vantagens adicionais em termos de cotas de uso e qualidade do modelo.

O estudo enfatiza que, embora a IA demonstre uma promessa significativa, ela ainda está sujeita a limitações em síntese detalhada e ainda não possui as capacidades generativas completas (como geração de imagem ou vídeo) encontradas em outros modelos concorrentes, como o ChatGPT.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →