← Últimos artigos
🤖 AI

Towards Evaluation Engineering: An Empirical Study of ML Evaluation Harnesses in the Wild

Este artigo apresenta um estudo empírico de 57 harnesses de avaliação de aprendizado de máquina que identifica a etapa de Especificação como a principal fonte de desafios operacionais, classifica 16.560 problemas por causa raiz para revelar que recursos não implementados, lacunas na documentação e validação de entrada ausente representam mais de 60% dos problemas, e estabelece uma base para tratar a engenharia de avaliação como uma disciplina distinta de engenharia de software.

Autores originais: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

Publicado 2026-05-26
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhimin Zhao, Zehao Wang, Abdul Ali Bangash, Bram Adams, Ahmed E. Hassan

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef tentando julgar uma nova receita. Você tem os ingredientes (os dados), o cartão de receita (o modelo) e uma lista de regras sobre o que faz um prato "bom" (as métricas). Mas antes de poder provar a comida, você precisa de uma cozinha para cozinhar, um cronômetro para acompanhar o cozimento e uma planilha de pontuação para anotar os resultados.

No mundo da Inteligência Artificial (IA), essa "cozinha" é chamada de Ferramenta de Avaliação (Evaluation Harness). É a ferramenta de software que realmente executa os testes, carrega os dados, calcula as pontuações e diz se o modelo de IA está fazendo um bom trabalho.

Este artigo é como uma inspeção massiva de 57 "cozinhas de IA" diferentes para ver como elas funcionam, onde quebram e por que as pessoas ficam frustradas com elas. Os pesquisadores chamam esse novo campo de "Engenharia de Avaliação".

Aqui está a divisão de suas descobertas usando analogias simples:

1. O Fluxo de Trabalho da Cozinha em Cinco Etapas

Os pesquisadores descobriram que toda cozinha de avaliação de IA passa por cinco etapas específicas, como uma linha de produção:

  • Provisionamento (Preparando a cozinha): Colocar o fogão, as panelas e os ingredientes prontos. Isso inclui instalar o software e fazer login em contas.
  • Especificação (Escrevendo a receita): Decidir exatamente o que você está cozinhando e quais ingredientes está usando. É aqui que você carrega o modelo de IA e os dados de teste.
  • Execução (Cozinhando a comida): Realmente executar o modelo de IA para gerar respostas.
  • Avaliação (Provar e pontuar): Verificar as respostas contra as corretas e calcular uma pontuação.
  • Relatório (Servindo o cardápio): Mostrar os resultados finais em um gráfico ou relatório.

A Grande Surpresa: A maioria dessas cozinhas é ótima em "cozinhar" (Execução), mas terrível em "servir" (Relatório). Muito poucas têm alarmes automáticos para avisar se a comida está pior hoje do que estava ontem.

2. Onde as Coisas Dão Errado (As Causas Raiz)

A equipe analisou mais de 16.000 reclamações (chamadas de "problemas") de usuários. Eles descobriram que os problemas geralmente não são porque a matemática está errada ou o código cai de forma dramática. Em vez disso, os problemas são principalmente burocráticos e peças faltantes.

Pense nisso como tentar montar um conjunto de Lego onde as instruções estão faltando ou a caixa diz "inclui um tijolo vermelho" mas você só recebe um azul.

Os três principais motivos pelos quais as cozinhas falham são:

  1. Recursos Faltantes (24%): A ferramenta prometeu fazer algo (como lidar com um tipo específico de dados), mas os desenvolvedores nunca realmente construíram essa parte. É como um carro que tem um volante, mas não tem motor.
  2. Instruções Ruins (20%): A ferramenta funciona, mas o manual está faltando, desatualizado ou confuso. Os usuários não conseguem descobrir como usá-la.
  3. Sem Verificações de Segurança (17%): A ferramenta não verifica se os ingredientes estão frescos. Se você alimentar com dados ruins, ela não para; apenas cozinha lixo e dá uma pontuação de lixo.

3. Os Diferentes Tipos de Cozinhas

Os pesquisadores agruparam as 57 cozinhas em quatro "arquétipos" (tipos), e cada tipo tem suas próprias dores de cabeça específicas:

  • A Cozinha de Teste Padronizada (40%): Estas são as grandes cozinhas famosas que testam muitos modelos contra exames padrão (como o SAT para IA).
    • Sua maior dor de cabeça: Quebra de Dependências. Elas dependem de ingredientes externos (conjuntos de dados) que mudam ou desaparecem sem aviso. Se o fornecedor mudar a embalagem, toda a cozinha para de funcionar.
  • A Ferramenta Especializada (21%): Estas são ferramentas minúsculas que fazem apenas uma coisa perfeitamente (como verificar se um robô pode andar).
    • Sua maior dor de cabeça: Instruções Ruins. Como são tão simples, os desenvolvedores esquecem de escrever instruções claras sobre como configurá-las.
  • A Sonda Personalizada (21%): Estas testam habilidades específicas (como programação ou matemática).
    • Sua maior dor de cabeça: Erros Matemáticos. Como inventam suas próprias fórmulas de pontuação, frequentemente erram a matemática, levando a erros silenciosos onde a pontuação parece correta, mas está errada.
  • O Restaurante de Serviço Completo (17%): Estas são as plataformas chiques e tudo-em-um que fazem tudo.
    • Sua maior dor de cabeça: Incompatibilidade de Contratos. Como conectam tantas partes diferentes (como um juiz remoto e um modelo local), as partes frequentemente não falam a mesma língua, causando falhas de comunicação.

4. O "Assassino Silencioso"

O problema mais perigoso que o artigo encontrou são Erros Silenciosos de Pontuação.

Imagine um juiz provando uma sopa e dando uma classificação de 5 estrelas. O juiz está confiante, a pontuação é impressa e todos estão felizes. Mas o juiz esqueceu de adicionar sal, e a sopa tem um gosto terrível. A ferramenta não caiu; apenas deu uma pontuação errada.

O artigo descobriu que muitas ferramentas calculam pontuações incorretamente (Erros Algorítmicos) ou falham em verificar se os dados fazem sentido (Lacunas de Validação), e como não há uma "segunda opinião" integrada ao sistema, ninguém percebe até muito depois.

5. O Que Isso Significa para o Futuro

O artigo conclui que precisamos tratar essas ferramentas não apenas como "scripts", mas como produtos de engenharia sérios.

  • Desenvolvedores precisam parar de assumir que a matemática é perfeita e começar a construir "redes de segurança" (como verificar se a pontuação faz sentido antes de imprimi-la).
  • Usuários precisam parar de confiar cegamente na pontuação. Apenas porque a ferramenta diz "95% de precisão" não significa que é verdade; você precisa verificar o trabalho.
  • Pesquisadores precisam inventar novas maneiras de testar essas ferramentas, porque as antigas maneiras de testar software não funcionam quando o "teste" em si é uma IA que pode estar alucinando.

Em resumo: Construímos máquinas incríveis para testar outras máquinas, mas as máquinas que fazem o teste frequentemente estão com instruções faltando, têm falhas em sua lógica e carecem da capacidade de nos dizer quando estão confusas. Consertar essas "cozinhas" é tão importante quanto construir melhores "chefs" (modelos de IA).

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →