← Últimos artigos
🤖 machine learning

Data filtering methods for training language models

Este artigo apresenta uma análise comparativa entre Confident Learning e Dataset Cartography para a detecção de erros de rótulo em conjuntos de dados de classificação de texto em russo, demonstrando que, embora ambos os métodos superem a remoção aleatória, sua eficácia na melhoria do desempenho do modelo depende fortemente do tamanho do conjunto de dados e dos níveis de ruído, com o Confident Learning produzindo ganhos significativos em conjuntos de dados pequenos e ruidosos.

Autores originais: Egor Shevchenko, Elena Bruches

Publicado 2026-05-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Egor Shevchenko, Elena Bruches

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a entender a linguagem humana. Você lhe entrega um livro didático massivo, repleto de exemplos e respostas. Mas eis o problema: algumas das respostas no livro estão erradas. Talvez uma frase que deveria ser rotulada como "feliz" tenha sido marcada acidentalmente como "brava", ou uma frase gramaticalmente correta tenha sido marcada como "errada".

Se você ensinar o robô usando um livro didático cheio de erros, ele aprenderá esses erros também. Este é o problema do ruído de rótulo.

Este artigo é como uma inspeção de controle de qualidade para três livros didáticos diferentes em língua russa (conjuntos de dados) usados para treinar IA. Os autores, E. Shevchenko e E. Bruches, testaram duas "ferramentas de detetive" diferentes para encontrar e remover os exemplos ruins antes que o robô comece a estudar.

Aqui está uma explicação simples de seu experimento e do que descobriram:

Os Dois Detetives

Os pesquisadores compararam dois métodos automáticos para encontrar erros:

  1. O Detetive da "Segunda Opinião" (Aprendizado Confiante):

    • Como funciona: Imagine que você tem um aluno fazendo uma prova. Em seguida, você pega esse mesmo aluno, divide-o em quatro grupos e faz com que cada grupo corrija as respostas dos outros. Se um aluno consistentemente erra uma questão específica de acordo com os outros grupos, mas o gabarito diz que ele está certo, o detetive da "Segunda Opinião" o marca como um provável erro no gabarito.
    • A vibe: É minucioso, mas agressivo. Ele confia no consenso das previsões do modelo.
  2. O Detetive dos "Hábitos de Estudo" (Cartografia de Conjuntos de Dados):

    • Como funciona: Este detetive observa o aluno estudar ao longo do tempo. Se o aluno continua acertando uma questão específica, depois errando, depois acertando novamente, ou simplesmente parece confuso sobre ela após muitas sessões de estudo, o detetive a marca como "problemática". Ele observa como a confiança do modelo muda ao longo do tempo.
    • A vibe: É mais cauteloso. Ele remove apenas exemplos com os quais o modelo consistentemente luta para aprender.

Os Três Livros Didáticos (Conjuntos de Dados)

Eles testaram esses detetives em três conjuntos de dados russos muito diferentes:

  • O Livro Grande (ru_emotion_e-culture): Uma enorme coleção de 49.000 postagens em fóruns sobre emoções. É grande e geralmente de alta qualidade.
  • O Livro Médio (RuCoLA): Uma coleção de 8.500 frases para verificar se estão gramaticalmente corretas. É de tamanho médio, mas complicada porque a "correção" pode ser subjetiva.
  • O Livro Pequeno (TERRa): Uma pequena coleção de 2.300 pares de frases para verificar se uma implica a outra. É pequeno e suspeito de ser bagunçado.

O Que Aconteceu? (Os Resultados)

1. O Livro Grande: "Não Conserte o Que Não Está Quebrado"
No conjunto de dados enorme, os livros didáticos já eram bastante bons.

  • O Resultado: Quando os detetives removeram os exemplos "ruins" que encontraram, o robô ficou, na verdade, ligeiramente pior na tarefa.
  • A Lição: Quando você tem uma quantidade massiva de dados, o robô é inteligente o suficiente para ignorar algumas maçãs podres por conta própria. Removê-las apenas tornou o livro menor sem torná-lo melhor.

2. O Livro Médio: "Melhor que o Aleatório, Mas Não Perfeito"
No conjunto de dados médio, ambos os detetives encontraram muitos erros (cerca de 15–18% do livro).

  • O Resultado: Remover esses erros não tornou o robô perfeito, mas fez com que ele se saísse melhor do que se você tivesse apenas jogado aleatoriamente fora o mesmo número de páginas.
  • A Lição: Os detetives estavam realmente encontrando erros reais, não apenas chutando. No entanto, o conjunto de dados ainda era muito ruidoso ou a tarefa muito difícil para ver um salto enorme no desempenho apenas limpando-o.

3. O Livro Pequeno: "A Magia da Limpeza"
Este foi o resultado mais dramático. O conjunto de dados pequeno era suspeito de ser muito bagunçado.

  • O Resultado: O detetive da "Segunda Opinião" descobriu que 35% do livro estava errado! Quando removeram esses exemplos ruins, o desempenho do robô saltou significativamente.
  • A Comparação: Se tivessem apenas jogado aleatoriamente fora 35% do livro, o robô teria fracassado miseravelmente. Mas, como jogaram fora os exemplos ruins específicos, o robô ficou muito mais inteligente.
  • A Lição: Para conjuntos de dados pequenos e bagunçados, encontrar e remover os erros é um divisor de águas.

A Grande Conclusão

O artigo conclui que não existe uma solução "tamanho único".

  • Se você tem um conjunto de dados enorme e limpo, não precisa perder tempo filtrando; a IA consegue lidar com o ruído.
  • Se você tem um conjunto de dados pequeno e bagunçado, usar uma ferramenta como "Aprendizado Confiante" para limpar os dados é essencial. É como limpar um quarto pequeno e lamacento: se você não remover a lama, não consegue ver o chão.

Os autores também observaram que o detetive dos "Hábitos de Estudo" (Cartografia de Conjuntos de Dados) é mais seguro e menos propenso a jogar acidentalmente fora bons exemplos, enquanto o detetive da "Segunda Opinião" (Aprendizado Confiante) é mais agressivo e melhor em encontrar os piores erros em conjuntos de dados pequenos.

Em resumo: Limpar seus dados é como polir uma lente. Se a lente já está clara e grande, polir um pouco mais não ajuda. Mas se a lente é pequena e coberta de lama, limpá-la é a única maneira de ver claramente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →