← Últimos artigos
💬 NLP

HLE-Verified: A Systematic Verification and Structured Revision of Humanity's Last Exam

Este artigo apresenta o HLE-Verified, uma versão revisada e verificada do benchmark "Humanity's Last Exam" que, através de um protocolo rigoroso de validação e reparo de itens, elimina ruídos nas questões e respostas, resultando em uma avaliação mais precisa e confiável das capacidades dos modelos de linguagem de ponta.

Autores originais: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixi
Publicado 2026-03-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Weiqi Zhai, Zhihai Wang, Jinghang Wang, Boyu Yang, Xiaogang Li, Xander Xu, Bohan Wang, Peng Wang, Xingzhe Wu, Anfeng Li, Qiyuan Feng, Yuhao Zhou, Shoulin Han, Wenjie Luo, Yiyuan Li, Yaxuan Wang, Ruixian Luo, Guojie Lin, Peiyao Xiao, Chengliang Xu, Ben Wang, Zeyu Wang, Zichao Chen, Jianan Ye, Yijie Hu, Jialong Chen, Zongwen Shen, Yuliang Xu, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Hu Wei, Que Shen, Bing Zhao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que o HLE (Humanity's Last Exam) é como o "Exame Final da Humanidade". É uma prova super difícil criada para testar a inteligência das melhores inteligências artificiais (IAs) do mundo, cobrindo tudo, desde matemática e física até história e biologia. A ideia era ver quais IAs eram realmente "gênios".

O problema? Descobriram que a prova estava cheia de erros de digitação, perguntas confusas e respostas erradas. Era como se um professor tivesse criado um teste, mas tivesse escrito a pergunta de um jeito que ninguém entendia, ou tivesse colocado a resposta "A" no gabarito quando a correta era "C".

Isso era injusto! As IAs estavam sendo penalizadas não por serem "burras", mas porque a prova estava bagunçada.

É aí que entra o HLE-Verified (o "Exame Verificado"), o tema deste artigo. Os autores (uma equipe da Alibaba) decidiram consertar essa prova. Eles não criaram uma prova nova; eles pegaram a antiga e fizeram uma "cirurgia de precisão".

Aqui está como eles fizeram isso, explicado de forma simples:

1. A Metáfora do "Detetive de Provas"

Pense no HLE-Verified como uma equipe de detetives e editores rigorosos que pegaram cada uma das 2.500 perguntas da prova original e as analisaram peça por peça. Eles dividiram o trabalho em três grupos:

  • O Grupo "Ouro" (668 perguntas): Essas perguntas já estavam perfeitas. O enunciado fazia sentido, a resposta estava certa e a explicação era lógica. Elas foram mantidas exatamente como estavam.
  • O Grupo "Reparos" (1.143 perguntas): Aqui estava a mágica. Muitas perguntas tinham defeitos, mas eram consertáveis.
    • Exemplo: Uma pergunta de física tinha um sinal de menos no lugar errado, ou uma questão de química usava um número errado.
    • A Solução: Especialistas humanos e IAs trabalharam juntos para corrigir esses erros, mas sem mudar a intenção da pergunta. Eles não trocaram a pergunta por outra; eles apenas consertaram a "gramática" e a lógica para que a IA pudesse realmente mostrar o que sabia.
  • O Grupo "Dúvida" (689 perguntas): Algumas perguntas eram tão confusas ou dependiam de conhecimentos tão obscuros que nem os especialistas conseguiam ter certeza se estavam certas ou erradas. Em vez de jogar fora, eles as separaram em uma "caixa de dúvidas" para que a comunidade possa tentar resolver no futuro.

2. O Que Aconteceu Quando Eles Consertaram a Prova?

Os autores testaram 8 das IAs mais inteligentes do mundo (como o GPT-5, Claude, Gemini, etc.) em duas versões: a prova antiga (cheia de erros) e a prova corrigida (HLE-Verified).

Os resultados foram surpreendentes:

  • A "Mágica" do Aumento de Nota: Na prova corrigida, as IAs ficaram muito melhores. Em média, a nota delas subiu entre 7% e 10%.
  • O Grande Salto: Mas o mais impressionante foi nas perguntas que estavam erradas na prova original. Nessas perguntas específicas, a nota das IAs subiu 30% a 40%.
    • Analogia: Imagine que você é um jogador de futebol muito bom, mas o juiz apita faltas que não existiam e anula gols legítimos. Sua média de gols cai. Quando você joga em um campo com um juiz justo (o HLE-Verified), seus gols reais aparecem, e sua média explode. As IAs não ficaram "mais inteligentes" da noite para o dia; elas apenas tiveram a chance de mostrar o que realmente sabiam, sem a bagunça da prova antiga.

3. A Confiança das IAs

Outra descoberta interessante foi sobre a "confiança" das IAs.
Quando uma IA vê uma pergunta confusa ou com erro, ela tende a ficar "insegura" (dizendo que não tem certeza da resposta). Quando a pergunta foi corrigida, a IA ficou muito mais confiante e acertou mais. Isso prova que a confusão vinha da prova, não da IA.

Resumo Final

O HLE-Verified é como uma revisão de qualidade para o "Exame Final da Humanidade".

  • O Problema: A prova original tinha muitos erros que escondiam a verdadeira inteligência das IAs.
  • A Solução: Eles criaram um processo transparente para encontrar e consertar esses erros, separando o que estava certo, o que foi consertado e o que ainda é uma dúvida.
  • O Resultado: Agora, quando medimos a inteligência das IAs, estamos medindo a verdadeira capacidade delas, e não a nossa capacidade de escrever provas ruins.

É um lembrete importante: para saber se alguém (ou alguma máquina) é inteligente, a prova precisa estar impecável. Se a prova estiver quebrada, a nota não vale nada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →