← Últimos artigos
💬 NLP

CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks

CoEval é um framework de código aberto que gera benchmarks livres de contaminação e controlados por atributos, e emprega um conjunto diversificado de modelos juízes para classificar modelos de linguagem de forma confiável para tarefas customizadas sem exigir dados rotulados ou confiar em benchmarks públicos.

Autores originais: Alexander Apartsin, Yehudit Aperstein

Publicado 2026-06-03
📖 4 min de leitura☕ Leitura rápida

Autores originais: Alexander Apartsin, Yehudit Aperstein

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um gerente de contratação tentando escolher o melhor funcionário para um trabalho muito específico, como "organizar um armazém caótico" ou "escrever piadas engraçadas sobre jardinagem". Você tem um problema: não possui avaliações de desempenho anteriores (dados rotulados) e os testes padrão que todos os outros usam (benchmarks públicos) são inúteis porque os candidatos já memorizaram as respostas de tanto estudá-las anteriormente.

Este é exatamente o problema que o CoEval resolve. É uma nova ferramenta de código aberto que ajuda você a classificar modelos de IA para suas necessidades específicas sem precisar de especialistas humanos para dar notas ou se preocupar com trapaças.

Veja como funciona, dividido em analogias simples:

1. O Gerador de "Testes Frescos" (Proibido Colar)

Normalmente, os modelos de IA fazem os mesmos testes antigos (como o SAT ou o GRE) que existem há anos. Como esses testes são tão populares, é provável que os modelos de IA tenham visto as perguntas durante seu treinamento e apenas memorizado as respostas. É como um aluno que memoriza o gabarito em vez de aprender a matemática.

O CoEval muda o jogo. Em vez de usar perguntas antigas, ele usa um "IA Professor" para inventar perguntas inéditas na hora, baseando-se apenas em uma descrição da sua tarefa.

  • A Analogia: Imagine um professor que cria um teste de matemática enquanto o aluno está na sala. O aluno não poderia ter memorizado as respostas porque as perguntas não existiam até aquele segundo.
  • O Resultado: O artigo prova que essas novas perguntas são 100% inéditas. Elas não compartilham nenhuma sequência de 13 palavras com nenhum grande banco de dados de testes públicos, o que significa que a IA não pode trapacear ao recuperar dados antigos.

2. O "Júri" de Juízes (Diversidade sobre Números)

Uma vez que os modelos de IA respondem a essas perguntas inéditas, alguém precisa dar a nota. Você poderia pedir a uma IA superinteligente para avaliar as respostas, mas isso é arriscado. Esse juiz único pode ter vieses estranhos, como preferir respostas longas em vez de curtas e boas, ou gostar de respostas que se pareçam com sua própria família de modelos.

O CoEval utiliza uma abordagem de "Júri". Ele reúne um pequeno grupo de juízes de diferentes empresas (por exemplo, um da OpenAI, um da Anthropic, um do Google).

  • A Analogia: Pense em um tribunal. Se você tiver um juiz que é conhecido por ser rabugento, o veredito pode ser injusto. Mas se você tiver um júri de três pessoas de diferentes origens, as peculiaridades individuais delas se anulam. Se um juiz gosta de respostas longas e outro as odeia, a média das pontuações torna-se justa.
  • A Grande Descoberta: O artigo descobriu que quem está no júri importa mais do que quantas pessoas estão lá. Adicionar mais juízes da mesma empresa apenas amplifica o viés compartilhado deles. Na verdade, um único juiz pode às vezes ser "anti-correlacionado" (dar a resposta errada), mas o júri diversificado quase nunca o é.

3. A Fábrica "Sem Humanos"

Normalmente, para construir um bom teste, você precisa de humanos para escrever as perguntas e avaliar as respostas. Isso é lento e caro.

  • A Analogia: O CoEval é como uma fábrica totalmente automatizada. Você fornece um projeto (uma descrição da sua tarefa) e ele automaticamente:
    1. Projeta as perguntas do teste.
    2. Faz os candidatos de IA realizarem o teste.
    3. Monta o júri diversificado para avaliar as respostas.
    4. Entrega uma classificação final.
  • O Custo: Os autores realizaram um estudo massivo com quase 8.000 avaliações pelo preço de uma xícara de café (US$ 5,89). É tão barato que você poderia realizar um novo teste toda vez que um novo modelo de IA fosse lançado.

4. Por que isso é importante

O artigo testou o CoEval em três cenários do mundo real onde não existiam "respostas corretas":

  • Interações Medicamentosas: Descobrir se dois remédios entram em conflito.
  • Raciocínio Clínico: Diagnosticar sintomas de pacientes.
  • Análise Jurídica: Interpretar leis.

Nestas áreas, não existem testes de "padrão ouro" estabelecidos. O CoEval classificou com sucesso os modelos, mostrando quais eram melhores para esses trabalhos específicos. Ele até detectou que um modelo menor e mais barato era, na verdade, pior do que um maior, algo que um único juiz enviesado poderia ter perdido.

O Resumo Final

CoEval é uma ferramenta que diz: "Não confie nos testes antigos e memorizados. Não dependa de um único juiz que possa ser enviesado. Em vez disso, gere um teste inédito para o seu trabalho específico e tenha uma pequena equipe diversificada de juízes de IA para avaliá-lo."

Ele transforma o processo desordenado e caro de testar IAs em um processo barato, repetível e justo que qualquer equipe pode usar para encontrar a IA certa para suas necessidades específicas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →