← Últimos artigos
🤖 machine learning

XMix: Combating Extremely Noisy Labels via Local Smoothness in Self-Supervised Feature Space

O MixX é um novo framework que aproveita a suavidade local em espaços de características autossupervisionados para estimar taxas de ruído, selecionar amostras limpas equilibradas e gerar pseudo-rótulos confiáveis, superando significativamente os métodos existentes no tratamento de rótulos extremamente ruidosos sem exigir conhecimento prévio do ruído.

Autores originais: Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

Publicado 2026-07-28
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Chengqi Li, Yangdi Lu, Zhihao Shi, Wenbo He, Chamseddine Talhi, Nadjia Kara

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a reconhecer animais. Você mostra a ele milhares de imagens, mas aqui está o detalhe: os rótulos nas imagens foram escritos por um humano cansado, distraído ou até mesmo travesso. Às vezes, uma foto de um gato é rotulada como "cachorro", e uma foto de um carro é rotulada como "avião". Esta é a realidade bagunçada do "Aprendizado com Rótulos Ruidosos". No mundo da inteligência artificial, os modelos geralmente precisam de dados perfeitos para aprender, mas no mundo real, dados perfeitos são raros e caros. Cientistas têm tentado construir robôs que consigam ignorar os rótulos ruins e aprender com os bons, mas quando o ruído fica muito alto — como quando 90% dos rótulos estão errados — a maioria dos robôs simplesmente desiste ou fica confusa.

O artigo que você está prestes a ler aborda exatamente este problema. Ele introduz um novo método chamado XMix. Pense nele como um detetive que não apenas confia nos rótulos escritos nos arquivos. Em vez disso, ele olha para as próprias imagens para ver quais delas "parecem" pertencer ao mesmo grupo. Se uma foto de um gato parece muito semelhante a outras fotos de gatos na memória do robô, o detetive assume que todas elas são gatos, mesmo que os rótulos digam o contrário. Esta abordagem utiliza um conceito chamado "suavidade local" (local smoothness), que é uma forma elegante de dizer: "Coisas que se parecem geralmente pertencem ao mesmo grupo". Ao usar essa lógica, o XMix tenta limpar a bagunça e ensinar o robô muito melhor do que os métodos anteriores, especialmente quando os dados são um desastre total.

O Problema: Uma Sala de Aula Cheia de Pregadores de Peças

Imagine uma sala de aula onde um professor está tentando ensinar alunos a identificar diferentes tipos de frutas. O professor tem uma pilha de cartões ilustrados, mas um grupo de pregadores de peças trocou os rótulos. Algumas maçãs são rotuladas como "bananas", e algumas laranjas são rotuladas como "uvas".

No passado, programas de computador inteligentes (chamados modelos de deep learning) tinham um truque na manga chamado "efeito de memorização". Eles estudavam os cartões e percebiam: "Ei, eu sou muito bom em adivinhar o rótulo para este cartão específico, mas sou terrível em adivinhar para aquele outro". Eles assumiam que aqueles que conseguiam adivinhar bem eram os reais (dados limpos) e aqueles com os quais tinham dificuldade eram as mentiras dos pregadores de peças (dados ruidosos).

Mas aqui está o problema: quando os pregadores de peças ficam loucos e trocam 90% dos rótulos, o computador fica confuso. Ele não consegue mais distinguir entre uma maçã real e uma banana rotulada como maçã. Além disso, o computador frequentemente acaba escolhendo apenas um tipo de fruta para estudar, ignorando os outros, o que o torna ruim em reconhecer toda a variedade. Ele precisa de uma nova estratégia que não dependa de saber exatamente quantos pregadores de peças estão na sala.

A Solução: XMix e a Regra do "Parecido"

Entra em cena o XMix, o novo detetive. Em vez de apenas olhar para os rótulos escritos, o XMix usa um par de óculos especiais (um codificador de características auto-supervisionado) para observar os detalhes visuais da fruta. Ele sabe que uma fruta vermelha, redonda e com um cabinho se parece muito com outras frutas vermelhas, redondas e com cabinhos.

Veja como o XMix resolve os três grandes problemas:

1. Adivinhando o Nível de Ruído Sem uma Folha de Cola
Normalmente, esses programas de computador precisam saber exatamente quantos rótulos estão errados (ex: "5% estão errados") para definir suas regras. Se eles errarem o palpite, eles falham. O XMix não precisa dessa folha de cola. Ele observa uma fruta e seus vizinhos mais próximos "parecidos" no mundo das imagens. Se os vizinhos tiverem todos rótulos diferentes, o XMix calcula: "Uau, o ruído deve ser muito alto aqui". Ele usa um truque matemático chamado "máxima verossimilhança" para estimar o nível de ruído automaticamente. É como um detetive olhando para uma cena de crime e dizendo: "Baseado em quantas janelas quebradas existem, eu diria que isso foi um motim", sem precisar de um relatório policial.

2. Encontrando Mais Bons Alunos (Seleção Equilibrada e Expandida)
Quando o ruído é extremo, os métodos antigos encontram apenas alguns exemplos "limpos" (bons alunos) para estudar. O XMix diz: "Espere, se encontramos uma boa maçã, e ela é exatamente igual a estas outras cinco maçãs próximas, vamos confiar nessas cinco também!". Ele expande o grupo de amostras confiáveis incluindo seus vizinhos.
Crucialmente, ele também corrige o problema do "desequilíbrio de classes". Se os pregadores de peças esconderam todos os rótulos de "banana", o computador pode parar de estudar bananas inteiramente. O XMix percebe isso e diz: "Precisamos de mais bananas!". Ele procura ainda mais "parecidos" de banana para garantir que cada fruta tenha uma chance justa de ser estudada. Isso garante que o robô aprenda uma dieta equilibrada de conhecimento, não apenas sua fruta favorita.

3. Melhor Adivinhação para o Desconhecido
Finalmente, para os cartões sobre os quais ele ainda não tem certeza (os ruidosos), o XMix não apenas adivinha aleatoriamente. Ele pergunta aos vizinhos: "O que você acha que isso é?". Ele pega as opiniões dos vizinhos mais confiáveis (os limpos) e faz a média delas para criar um "pseudo-rótulo" (um rótulo de melhor palpite). Isso é como pedir a um grupo de especialistas para votar em um objeto misterioso. Como os especialistas são escolhidos com base no quanto se parecem com o objeto, o voto deles é muito mais confiável do que um palpite aleatório.

O Que Eles Descobriram: Vencendo as Probabilidades

Os pesquisadores testaram o XMix em conjuntos de dados de imagens famosos como o CIFAR-10 e o CIFAR-100, que contêm fotos de carros, aviões, animais e muito mais. Eles deliberadamente estragaram os rótulos para criar cenários extremos:

  • 90% de Ruído Simétrico: Imagine que 90 de cada 100 rótulos são completamente aleatórios.
  • 98% de Ruído: Quase tudo é uma mentira.

Nestas condições brutais, os métodos anteriores (como DivideMix e ProMix) começaram a desmoronar. Por exemplo, no CIFAR-10 com 90% de ruído, o antigo melhor método (DivideMix) obteve apenas cerca de 76% de precisão. O XMix, no entanto, elevou isso para 91,2%. No CIFAR-100 com 95% de ruído, o método antigo obteve 19,1%, enquanto o XMix alcançou 31,4%.

O artigo mostra que o XMix não apenas funciona um pouco melhor; ele brilha quando a situação é mais desesperadora. Ele conseguiu identificar muito mais amostras "verdadeiramente limpas" do que os métodos antigos, às vezes dobrando ou triplicando o número de bons exemplos dos quais o robô poderia aprender.

O Veredito

O XMix prova que você não precisa saber o nível exato de caos em seus dados para limpá-los. Ao confiar nas semelhanças visuais entre as imagens — usando a "suavidade local" do espaço de características — ele consegue ajustar automaticamente sua estratégia, encontrar mais dados bons e ensinar o robô a ignorar o ruído.

Os autores sugerem que este método é um passo significativo à frente, especialmente para cenários do mundo real onde os dados são bagunçados e não temos um manual nos dizendo o quão ruins eles são. Embora não seja uma varinha mágica que conserta tudo perfeitamente (ele ainda comete alguns erros, especialmente quando o ruído é baixo e a expansão não é necessária), ele supera consistentemente os métodos de estado da arte mais desafiadores nos ambientes de ruído mais altos. Ele transforma uma sala de aula caótica de pregadores de peças em um lugar onde o aprendizado ainda pode acontecer.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →