← Últimos artigos
🤖 machine learning

An Experimental Study on the Rashomon Effect of Balancing Methods in Imbalanced Classification

Autores originais: Mustafa Cavus, Przemysław Biecek

Publicado 2026-05-18
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Mustafa Cavus, Przemysław Biecek

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: O Problema das "Muitas Respostas Corretas"

Imagine que você está tentando prever quem vencerá uma partida de xadrez. Você tem um conjunto de dados de partidas anteriores, mas há um problema: 90% das partidas foram vencidas pelas Brancas, e apenas 10% pelas Pretas. Isso é chamado de conjunto de dados desbalanceado.

Se você treinar um modelo de computador com esses dados sem corrigi-los, o computador fica preguiçoso. Ele aprende que "as Brancas sempre vencem", então prevê "Brancas" para cada nova partida. Ele obtém 90% de precisão, mas falha completamente ao prever as vitórias das Pretas.

Para corrigir isso, cientistas de dados usam métodos de balanceamento. Eles agem como um chef adicionando ingredientes a uma sopa:

  • Sobreamostragem (Oversampling): Eles copiam as partidas raras de "vitória das Pretas" para criar mais delas (como adicionar mais sal).
  • Subamostragem (Undersampling): Eles descartam algumas das partidas comuns de "vitória das Brancas" para tornar a panela menor (como remover o excesso de água).

O objetivo é fazer o computador prestar atenção à classe minoritária. Mas este artigo faz uma pergunta assustadora: Corrigir os dados cria um novo tipo de confusão?

O Efeito Rashomon: O Fenômeno das "Muitas Verdades"

O artigo utiliza um conceito chamado Efeito Rashomon. Imagine uma cena de crime onde cinco testemunhas diferentes contam cinco histórias diferentes. Todas as cinco histórias são plausíveis e se encaixam nos fatos igualmente bem, mas se contradizem entre si.

No aprendizado de máquina, o Conjunto Rashomon é um grupo de diferentes modelos de computador que todos performam quase exatamente da mesma forma (todos são "plausíveis"), mas fazem previsões diferentes para a mesma pessoa ou situação.

  • Modelo A diz: "Este solicitante de empréstimo é seguro."
  • Modelo B diz: "Este solicitante de empréstimo é arriscado."
  • Ambos os modelos têm a mesma pontuação geral de precisão.

Se você escolher um modelo aleatoriamente (seleção cega), pode acabar escolhendo aquele que nega um empréstimo a uma boa pessoa, mesmo que outro modelo igualmente preciso o teria aprovado. Isso é chamado de Multiplicidade Preditiva.

O Experimento: O Que Acontece Quando Balanceamos os Dados?

Os autores queriam saber: Usar métodos de balanceamento (sobreamostragem/subamostragem) torna esse problema das "Muitas Verdades" pior?

Eles pegaram 21 conjuntos de dados reais diferentes (como detecção de spam, fraude com cartão de crédito e qualidade de vinho) e os passaram por uma "fábrica de modelos" (uma ferramenta chamada Forester) que cria centenas de modelos ligeiramente diferentes para cada conjunto de dados. Eles fizeram isso duas vezes:

  1. Usando os dados originais, desbalanceados.
  2. Usando dados balanceados (após aplicar os métodos de balanceamento).

Em seguida, eles mediram três coisas para ver o quanto os modelos discordavam uns dos outros:

  1. Ambiguidade: Quantas pessoas recebem respostas conflitantes? (ex: "5 em cada 100 pessoas recebem previsões diferentes.")
  2. Discrepância: Qual é o cenário de pior caso? (ex: "Um modelo específico discorda dos outros em 20 pessoas.")
  3. Obscuridade (Nova Métrica): Esta é a nova ideia do artigo. Ela mede a quantidade média de confusão. Em vez de apenas perguntar "Há um conflito?", ela pergunta "Quão bagunçado é o conflito em média?". Pense nisso como medir a "neblina" sobre os dados.

As Descobertas: O "Conserto" Tornou a Neblina Mais Espessa

Aqui está o que eles descobriram:

  • Métodos de Balanceamento Aumentam a Confusão: Quando usaram métodos de balanceamento (como SMOTE ou sobreamostragem aleatória), a Obscuridade e a Discrepância aumentaram.
    • A Analogia: Imagine que você está tentando encontrar um cachorro perdido em um parque. No parque original (dados desbalanceados), todos os cães de busca concordam onde o cachorro está. Mas quando você adiciona "balanceamento" (como adicionar mais cães de busca ou mudar o terreno), os cães de busca começam a latir em direções diferentes. Eles ainda são todos cães "bons", mas não conseguem concordar sobre a localização.
  • O Conserto "Parcial" Não Funcionou: Alguns especialistas sugeriram usar "reamostragem parcial" (balancear os dados apenas um pouco, não 100%) para evitar essa bagunça. Os autores testaram isso, mas descobriram que não ajudou. A confusão permaneceu alta, independentemente de quanto eles balancearam os dados.
  • A Importância das Variáveis Mudou: Eles também verificaram se os modelos estavam olhando para pistas diferentes. Por exemplo, um modelo pode pensar que "renda" é o fator mais importante, enquanto outro pensa que "idade" é. Eles descobriram que, embora a ordem de importância não tenha mudado drasticamente em um sentido estatístico, os métodos de balanceamento fizeram os modelos se comportarem de maneira diferente no geral.

A Solução: Um Novo Painel de Controle

Como não conseguiram impedir que a confusão acontecesse, os autores propuseram uma maneira de monitorá-la.

Eles sugeriram usar um Gráfico de Ganho de Desempenho Estendido.

  • Imagine um painel de controle com dois mostradores.
  • Mostrador 1 (Horizontal): Mostra o quanto o modelo melhora ao prever corretamente (Ganho de Desempenho).
  • Mostrador 2 (Vertical): Mostra o quanto os modelos discordam uns dos outros (Multiplicidade/Obscuridade).

A Lição: Você não deve olhar apenas para o Mostrador 1. Você pode encontrar um método que melhora ligeiramente a precisão (Mostrador 1 sobe), mas que causa uma explosão massiva de discordância (Mostrador 2 sobe muito). Os autores dizem que você precisa olhar para ambos os mostradores para tomar uma decisão responsável.

Resumo das Afirmações do Artigo

  1. Balancear dados é necessário para problemas desbalanceados, mas tem um custo oculto.
  2. Métodos de balanceamento aumentam a "Multiplicidade Preditiva". Eles criam uma situação onde muitos modelos são igualmente precisos, mas dão respostas conflitantes às mesmas pessoas.
  3. Nova Métrica: Eles introduziram a "Obscuridade" para medir o quão "nebuloso" ou conflitante são essas previsões de modelo em média.
  4. Reamostragem Parcial não é uma bala de prata. Ela não resolve o problema do aumento da confusão.
  5. IA Responsável: Ao escolher um modelo, você deve verificar não apenas se ele é preciso, mas se é estável. Se você escolher um modelo cegamente de um "Conjunto Rashomon" criado por métodos de balanceamento, corre o risco de tomar decisões arbitrárias que prejudicam indivíduos.

O artigo conclui que, embora os métodos de balanceamento sejam um "refúgio" para resolver dados desbalanceados, os pesquisadores devem ter cuidado para não entrar cegamente em uma neblina de previsões conflitantes. Eles precisam usar o novo "painel de controle" (o gráfico estendido) para ver o trade-off entre precisão e estabilidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →