← Últimos artigos
🤖 AI

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Este artigo apresenta o Counsel, o primeiro conjunto de dados público de meta-avaliações verificadas por humanos para críticas de LLM-como-juiz em tarefas agênticas, o qual permite a calibração e a melhoria de avaliadores automatizados ao analisar seu alinhamento com julgamentos humanos sobre localização de erro e qualidade de raciocínio.

Autores originais: Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

Publicado 2026-06-23
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está construindo uma equipe de assistentes de IA (agentes) para lidar com tarefas complexas, como gerenciar o pedido de perfume de um cliente ou escrever código de computador. À medida que essas tarefas se tornam mais difíceis, verificar se a IA está fazendo um bom trabalho torna-se um pesadelo enorme.

O Problema: O "Gargalo Humano"
Pense em um agente de IA como um aluno fazendo um exame longo e de várias etapas. Para dar uma nota perfeita ao exame, um professor humano costumava ter que ler cada etapa que o aluno percorria.

  • A Realidade: Para tarefas complexas, isso leva horas. Se você tiver 1.000 exames, precisará de um pequeno exército de professores trabalhando por semanas.
  • O Atalho: Para economizar tempo, as empresas começaram a usar "Professores de IA" (chamados de LLM-as-a-Judge) para corrigir os exames automaticamente. Esses Professores de IA escrevem comentários como: "Você esqueceu de verificar o ID do usuário primeiro!" ou "Bom trabalho ao encontrar o arquivo!".

O Novo Problema: Os Professores de IA são Confiáveis?
Aqui está a armadilha: começamos a confiar nesses Professores de IA sem verificar se eles eram realmente bons em sua função específica de escrever críticas.

  • Às vezes, um Professor de IA detecta um erro real e o explica perfeitamente.
  • Às vezes, ele detecta um erro que não é realmente um erro (um falso positivo).
  • Às vezes, ele detecta um erro real, mas fornece uma explicação confusa ou errada sobre o porquê de ser um erro.

Até agora, não tínhamos uma maneira de medir o quão bons esses Professores de IA eram em sua tarefa específica de escrever críticas; apenas sabíamos se eles acertavam o "Aprovado/Reprovado" final, mas não se o seu raciocínio era sólido.

A Solução: "Counsel"
Os autores criaram um novo conjunto de dados chamado Counsel. Pense nisso como um "Professor do Professor".

  1. A Configuração: Eles pegaram dois cenários do mundo real:
    • Atendimento ao Cliente: Uma IA tentando ajudar um cliente a trocar um perfume.
    • Programação: Uma IA tentando analisar arquivos de dados financeiros.
  2. Os Atores:
    • O Aluno: Um agente de IA tentando realizar a tarefa.
    • O Professor de IA (Juiz): Uma IA que observa o aluno e escreve uma crítica (ex: "Erro! Você pulou uma etapa").
    • O Especialista Humano (Meta-avaliador): Um humano real que lê a crítica do Professor de IA e decide:
      • "No ponto": Você encontrou o erro certo e o explicou perfeitamente. ✅
      • "Local correto, raciocínio ruim": Você encontrou o erro certo, mas sua explicação foi fraca ou errada. ⚠️
      • "Não deveria ter sinalizado": Você achou que havia um erro, mas o aluno estava, na verdade, correto. ❌

O Que Eles Descobriram
Ao fazer com que humanos avaliassem os Professores de IA, eles descobriram:

  • Mais inteligente é melhor: Modelos de IA mais poderosos criam melhores Professores.
  • Pensar mais ajuda: Quando o Professor de IA é forçado a "pensar" de forma mais longa e profunda antes de avaliar, ele comete menos erros.
  • O Melhor Professor: O Professor de IA mais forte que testaram concordou com especialistas humanos 88% das vezes sobre onde estava o erro, e 65% das vezes sobre o raciocínio.

Por Que Isso Importa
Este conjunto de dados é como um "manual de treinamento" para construir melhores Professores de IA. Em vez de apenas esperar que uma IA seja boa em avaliar, agora podemos usar esses dados para:

  1. Testar o quão bom é um novo Professor de IA.
  2. Treinar Professores de IA para escreverem críticas melhores e mais precisas.
  3. Filtrar críticas ruins para que os desenvolvedores vejam apenas as de alta qualidade.

Em Resumo
O artigo introduz uma maneira de avaliar os avaliadores. Assim como você não contrataria um professor que não consegue explicar por que um aluno errou uma questão, a comunidade de IA precisa de uma maneira de garantir que seus avaliadores automatizados estão realmente fornecendo feedback útil. O Counsel fornece a primeira biblioteca pública desses "gráficos sobre gráficos" para ajudar a construir sistemas de IA mais confiáveis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →