← Últimos artigos
🤖 AI

Every Eval Ever: A Unifying Schema and Community Repository for AI Evaluation Results

Este artigo apresenta o "Every Eval Ever", uma iniciativa governada pela comunidade que aborda a fragmentação dos resultados de avaliação de IA ao estabelecer um esquema JSON unificado, fornecendo conversores automáticos a partir de diversas fontes e hospedando um repositório colaborativo no Hugging Face que atualmente agrega dados de mais de 22.000 modelos e 2.000 benchmarks.

Autores originais: Jan Batzner, Sree Harsha Nelaturu, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra
Publicado 2026-06-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Jan Batzner, Sree Harsha Nelaturu, Anastassia Kornilova, Jon Crall, Tommaso Cerruti, Yanan Long, Yifan Mai, Sanchit Ahuja, Asaf Yehudai, Marek Šuppa, John P. Lalor, Oluwagbemike Olowe, Jatin Ganhotra, Brian H. Hu, Eliya Habba, Andrew M. Bean, Chang Liu, Sander Land, Steven Dillmann, Aniketh Garikaparthi, Elron Bandel, Saki Imai, James Edgell, Wm. Matthew Kennedy, Jenny Chim, Patrick Meusling, Asteria Kaeberlein, Venkata Ramachandra Karthik Chundi, Manasi Patwardhan, Martin Ku, Austin Meek, Leon Knauer, Brian Wingenroth, Srishti Yadav, Usman Gohar, Felix Friedrich, Michelle Lin, Jennifer Mickel, Arman Cohan, Stella Biderman, Irene Solaiman, Zeerak Talat, Anka Reuel, Mubashara Akhtar, Gjergji Kasneci, Avijit Ghosh, Leshem Choshen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine o mundo da Inteligência Artificial (IA) como uma liga esportiva massiva e caótica. Todos os dias, diferentes equipes (pesquisadores e empresas) colocam seus jogadores (modelos de IA) através de várias pistas de obstáculos (benchmarks) para ver quem é o mais rápido ou o mais forte.

O problema? Todo mundo está anotando a pontuação de formas diferentes.

Algumas equipes escrevem seus resultados em um caderno, outras em um quadro branco, algumas em uma planilha e outras apenas postam um único número no Twitter. Uma equipe pode dizer que um jogador marcou "85", mas não diz se usou um cronômetro ou uma ampulheta, ou se o jogador estava correndo em uma esteira ou em uma pista. Por causa dessa bagunça, é impossível comparar verdadeiramente o Jogador A da Equipe X com o Jogador B da Equipe Y.

"Every Eval Ever" (EEE) é o projeto que está tentando consertar esse caos. Pense nele como o tradutor universal e o marcador oficial para todo o mundo da IA.

Veja como funciona, explicado de forma simples:

1. A Planilha Universal (O Schema)

Antes do EEE, se você quisesse comparar dois modelos de IA, teria que agir como um detetive, caçando artigos, posts de blogs e logs de código para descobrir como a pontuação foi calculada.

  • A Solução EEE: Eles criaram uma "planilha de pontuação" única e padronizada (um formato específico chamado JSON schema).
  • A Analogia: Imagine se todas as ligas esportivas concordassem em usar exatamente a mesma ficha de estatísticas. Em vez de apenas escrever "85 pontos", a ficha deve incluir: "Quem realizou o teste? Quais regras eles seguiram? Qual era a temperatura da sala? Eles usaram um cronômetro ou uma ampulheta?"
  • Por que isso importa: Agora, quando você vê uma pontuação, você sabe exatamente o que ela significa e pode compará-la de forma justa com outra pontuação, mesmo que venham de fontes diferentes.

2. O Tradutor Mágico (Os Conversores)

Você pode pensar: "Mas todo mundo já tem suas próprias planilhas bagunçadas. Como resolvemos isso?"

  • A Solução EEE: Eles construíram "conversores". Estes são como ferramentas de tradução mágica.
  • A Analogia: Imagine um tradutor que pode pegar uma nota escrita à mão em francês, uma planilha em alemão e um áudio em espanhol, e instantaneamente transformá-los em um documento perfeito e padronizado em inglês.
  • Como funciona: O projeto construiu ferramentas que pegam automaticamente os resultados de softwares populares de teste de IA (como HELM ou lm-eval) e os reformatam instantaneamente para o seu novo padrão de planilha de pontuação.

3. A Biblioteca Comunitária (O Repositório)

Uma vez que as pontuações são traduzidas, para onde elas vão?

  • A Solução EEE: Eles construíram uma biblioteca pública gigante hospedada em uma plataforma chamada Hugging Face.
  • A Analogia: Pense nisso como um vasto arquivo público onde qualquer pessoa pode depositar suas planilhas de pontuação padronizadas. Não é apenas uma lista de vencedores; é um mergulho profundo nos detalhes.
  • A Escala: Atualmente, esta biblioteca contém resultados de mais de 22.000 modelos de IA diferentes testados em 2.200 desafios diferentes. É a primeira vez que tantos dados foram reunidos em um só lugar de uma forma que computadores possam realmente ler e comparar.

4. Por que Isso Muda o Jogo (Os Estudos de Caso)

O artigo mostra quatro maneiras específicas pelas quais este novo sistema ajuda os pesquisadores a ver coisas que não conseguiam ver antes:

  • Custo vs. Precisão: No mundo dos "Agentes de IA" (robôs que realizam tarefas), o EEE mostrou que algumas configurações são caras, mas não apresentam um desempenho superior. É como perceber que uma Ferrari está custando US$ 500 por dia para dirigir, mas um Toyota está te levando ao mesmo destino por USole 50.
  • A Armadilha da "Perplexidade": Pesquisadores frequentemente olham para uma métrica chamada "perplexidade" para ver o quão bom um modelo é em prever texto. O EEE revelou que dois programas de computador diferentes podem calcular a "perplexidade" de maneiras ligeiramente distintas, fazendo com que os números pareçam comparáveis quando, na verdade, não são. O EEE sinaliza essas diferenças para que ninguém seja enganado.
  • O "Fantasma" na Máquina: Quando pesquisadores tentaram rodar testes antigos localmente, descobriram que, às vezes, os resultados oficiais estavam com dados ausentes (como respostas vazias) que suas cópias locais possuíam. O EEE ajudou a detectar esses erros "fantasmagóricos" que estavam escondidos à vista de todos.
  • Classificação de Dificuldade: Ao olhar para questões individuais (não apenas a pontuação final), o EEE permitiu que os pesquisadores usassem um método estatístico (Teoria de Resposta ao Item) para descobrir exatamente quais questões eram muito difíceis ou muito fáceis, ajudando a projetar melhores testes.

O Resumo Final

"Every Eval Ever" não é um novo modelo de IA, e não realiza os testes por conta própria. Em vez disso, é a infraestrutura que dá sentido aos testes que já estão sendo realizados.

Ele transforma uma pilha de notas confusas e incompatíveis em um banco de dados claro, organizado e justo. Ele permite que os pesquisadores parem de perguntar: "Eles mediram da mesma forma?" e comecem a perguntar: "O que isso realmente nos diz sobre o progresso da IA?"

O projeto é gerido por uma coalizão de pesquisadores, empresas e universidades que acreditam que, para a IA melhorar, todos precisamos falar a mesma língua quando discutimos o quão bem ela funciona.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →