← Últimos artigos
🤖 AI

How to evaluate clustering with ground truth?

Este artigo revisa índices de validade externa comuns para avaliar o agrupamento com a verdade fundamental, recomendando o índice de centroide (CI) por seus resultados intuitivos e explicáveis ao nível do cluster, ao mesmo tempo em que destaca o índice de conjunto de pares (PSI) e a acurácia de agrupamento (ACC) como alternativas adequadas para avaliações ao nível do ponto ou não enviesadas pelo tamanho.

Autores originais: Pasi Fränti

Publicado 2026-06-26
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Pasi Fränti

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um professor tentando dar nota a uma turma de alunos que foram encarregados de separar uma pilha de blocos coloridos misturados em caixas separadas.

Em um teste padrão (classificação), o professor tem um gabarito. Ele apenas verifica: "Este bloco vermelho está na caixa vermelha? Sim? Bom. Não? Ruim." É um simples passar ou falhar.

Mas no agrupamento (clustering), o professor não deu um gabarito aos alunos. Os alunos apenas decidiram: "Vamos colocar todos os blocos grandes em uma caixa e os pequenos em outra", ou "Vamos agrupar por textura". O professor não sabe qual desses agrupamentos é o "correto" porque os próprios alunos inventaram os grupos.

Este artigo, escrito por Pasi Fränti, trata de como um professor pode dar nota a esses alunos quando eles possuem um "Ground Truth" secreto (a forma perfeita e ideal como os blocos deveriam ter sido separados). O artigo revisa diferentes maneiras de calcular uma pontuação para ver o quão bem os alunos se saíram.

Aqui está a divisão das principais ideias do artigo usando analogias simples:

1. As Três Maneiras de Dar Nota

O autor diz que existem três formas de julgar um algoritmo de agrupamento:

  • O Teste da "Visão Geral": Este agrupamento ajuda o produto final a funcionar melhor? (ex: O agrupamento de gravações de voz ajuda a identificar locutores?) O autor diz que isso é frequentemente muito vago. Às vezes, quase qualquer método de agrupamento funciona "bem", então ele não diz qual algoritmo é verdadeiramente o melhor.
  • O Teste "Interno": Isso é como perguntar aos alunos: "Quão organizadas estão suas caixas?" sem olhar para o gabarito. Você apenas verifica se os blocos dentro de uma caixa são semelhantes entre si. É fácil de fazer, mas não diz se os alunos realmente os separaram corretamente de acordo com o mundo real.
  • O Teste "Externo" (O Foco do Artigo): Isto é comparar as caixas dos alunos contra o Ground Truth (a resposta perfeita/gabarito). É sobre isso que o artigo trata.

2. O Problema dos Avaliadores de "Pares"

O primeiro tipo de avaliador externo observa cada par possível de blocos.

  • A Lógica: "Se o Bloco A e o Bloco B estão na mesma caixa no gabarito, eles devem estar na mesma caixa no resultado do aluno."
  • A Falha: Existem milhões de pares de blocos. A maioria dos pares é de cores diferentes de qualquer maneira. Assim, se um aluno apenas colocar tudo em uma caixa gigante, ele terá uma pontuação alta porque identificou corretamente que a maioria dos pares é diferente.
  • A Correção: O artigo menciona o ARI (Índice de Rand Ajustado) e o NMI (Informação Mútua Normalizada). Eles tentam corrigir a matemática para não serem enganados pelo enorme número de pares. No entanto, o autor alerta que essas pontuações ainda podem ser enganosas. Uma pontuação de 0,95 pode parecer ótima, mas não diz por que é ótima ou quantos erros foram cometidos de fato. É como tirar um "95%" em uma prova sem ver quais questões você errou.

3. Os Avaliadores de "Correspondência de Conjuntos" (A Nova Abordagem)

Em vez de olhar para pares, esses avaliadores olham para os grupos (clusters) como unidades inteiras. Eles tentam corresponder a "Caixa Vermelha" do aluno à "Caixa Vermelha" do professor, a "Caixa Azul" à "Caixa Azul", e assim por diante.

O artigo discute várias maneiras de fazer essa correspondência:

  • Mapeamento (Mapping): "Encontrar a melhor correspondência para cada caixa do aluno." (Via de mão única).
  • Pareamento (Pairing): "Combinar as caixas de modo que duas caixas do aluno não reivindiquem a mesma caixa do professor." (Via de mão dupla).

O método mais popular aqui é a Acurácia de Agrupamento (ACC). É como dizer: "Nós combinamos as caixas perfeitamente. Agora, quantos blocos estão na caixa certa?"

  • Prós: É muito preciso.
  • Contras: Pode ser tendencioso. Se uma caixa tem 1.000 blocos e outra tem 1, a caixa grande domina a pontuação. Se o aluno errar a caixa pequena mas acertar a grande, a pontuação ainda parecerá ótima.

4. O Favorito do Autor: O Índice de Centroide (CI)

O autor recomenda fortemente uma medida específica chamada Índice de Centroide (CI).

A Analogia:
Imagine o "Centro de Gravidade" (centroide) de cada caixa.

  • Se a "Caixa Vermelha" do professor está centrada na mesa da cozinha, e a "Caixa Vermelha" do aluno está centrada na mesa da cozinha, isso é uma correspondência perfeita.
  • Se a "Caixa Vermelha" do aluno está centrada no quintal, isso é um desajuste.

Por que o autor ama o CI:

  • É Explicável: Se a pontuação for 0, significa que o centro de cada caixa está no lugar certo. Se a pontuação for 7, significa que 7 caixas estão no lugar errado.
  • Sem Números Misteriosos: Ao contrário das outras pontuações onde você se pergunta: "0,85 é bom? 0,90 é bom?", o CI fornece uma contagem clara de erros. "Você errou 7 clusters". Só isso.
  • A Pegadinha: Ele apenas conta quantos grupos estão fora do lugar. Não se importa se alguns blocos dentro da caixa estão ligeiramente fora do lugar. É uma visão "macro", não uma visão "micro".

5. O Veredito Final (Recomendações)

O artigo conclui com um guia simples para qualquer pessoa que tente avaliar um agrupamento:

  1. Se você quer saber "Quantos grupos eu errei?": Use o Índice de Centroide (CI). É a pontuação mais honesta e fácil de entender. Ele diz exatamente quantos clusters estão no lugar errado.
  2. Se você precisa saber "Quantos itens individuais estão no lugar errado?": Use a Acurácia de Agrupamento (ACC). É um pouco mais complexa, mas oferece uma pontuação detalhada, ponto a ponto.
  3. Se você quer uma pontuação que trate cada grupo igualmente (grande ou pequeno): Use o PSI (Índice de Conjunto de Pares).
  4. Evite: O antigo Índice de Rand. O autor diz que ele é tendencioso e dá pontuações altas mesmo quando o agrupamento é terrível.

Em Resumo:
O artigo argumenta que devemos parar de usar pontuações matemáticas confusas que parecem boas, mas significam pouco. Em vez disso, devemos usar o Índice de Centroide (CI) para contar quantos grupos foram mal posicionados (como contar quantas caixas estão na sala errada), porque ele fornece uma resposta clara e legível para humanos: "Você errou 7 grupos". Se precisar de mais detalhes, use a Acurácia de Agrupamento, mas mantenha o básico para uma explicação clara.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →