← Últimos artículos
🤖 machine learning

Data filtering methods for training language models

Este artículo presenta un análisis comparativo de Confident Learning y Dataset Cartography para detectar errores de etiquetado en conjuntos de datos de clasificación de texto en ruso, demostrando que, aunque ambos métodos superan la eliminación aleatoria, su eficacia para mejorar el rendimiento del modelo depende en gran medida del tamaño del conjunto de datos y de los niveles de ruido, siendo Confident Learning el que obtiene ganancias significativas en conjuntos de datos pequeños y ruidosos.

Autores originales: Egor Shevchenko, Elena Bruches

Publicado 2026-05-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Egor Shevchenko, Elena Bruches

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñar a un robot a entender el lenguaje humano. Le das un libro de texto masivo lleno de ejemplos y respuestas. Pero aquí está el problema: algunas de las respuestas en el libro de texto están equivocadas. Quizás una oración que debería etiquetarse como "feliz" fue marcada accidentalmente como "enojada", o una oración gramaticalmente correcta fue marcada como "incorrecta".

Si le enseñas al robot usando un libro de texto lleno de errores, también aprenderá esos errores. Este es el problema del ruido en las etiquetas.

Este artículo es como una inspección de control de calidad para tres libros de texto diferentes en ruso (conjuntos de datos) utilizados para entrenar inteligencia artificial. Los autores, E. Shevchenko y E. Bruches, probaron dos "herramientas de detective" diferentes para encontrar y eliminar los ejemplos defectuosos antes de que el robot comience a estudiar.

Aquí tienes un desglose sencillo de su experimento y lo que descubrieron:

Los Dos Detectives

Los investigadores compararon dos métodos automáticos para encontrar errores:

  1. El Detective de la "Segunda Opinión" (Confident Learning):

    • Cómo funciona: Imagina que tienes a un estudiante que realiza un examen. Luego, tomas a ese mismo estudiante, lo divides en cuatro grupos y haces que cada grupo califique las respuestas de los otros. Si un estudiante obtiene consistentemente una pregunta específica incorrecta según los otros grupos, pero la hoja de respuestas dice que están en lo correcto, el detective de la "Segunda Opinión" lo marca como un error probable en la hoja de respuestas.
    • El ambiente: Es exhaustivo pero agresivo. Confía en el consenso de las predicciones del modelo.
  2. El Detective de los "Hábitos de Estudio" (Dataset Cartography):

    • Cómo funciona: Este detective observa al estudiante estudiar con el tiempo. Si el estudiante sigue obteniendo una pregunta específica correcta, luego incorrecta, luego correcta nuevamente, o simplemente parece confundido al respecto después de muchas sesiones de estudio, el detective lo marca como "problemático". Observa cómo cambia la confianza del modelo con el tiempo.
    • El ambiente: Es más cauteloso. Solo elimina ejemplos que el modelo lucha consistentemente por aprender.

Los Tres Libros de Texto (Conjuntos de Datos)

Probaron a estos detectives en tres conjuntos de datos rusos muy diferentes:

  • El Libro Grande (ru_emotion_e-culture): Una enorme colección de 49,000 publicaciones de foros sobre emociones. Es grande y generalmente de alta calidad.
  • El Libro Mediano (RuCoLA): Una colección de 8,500 oraciones para verificar si son gramaticalmente correctas. Es de tamaño mediano pero complicada porque la "corrección" puede ser subjetiva.
  • El Libro Pequeño (TERRa): Una pequeña colección de 2,300 pares de oraciones para verificar si una implica a la otra. Es pequeño y se sospecha que está desordenado.

¿Qué Pasó? (Los Resultados)

1. El Libro Grande: "No arregles lo que no está roto"
En el conjunto de datos enorme, los libros de texto ya eran bastante buenos.

  • El Resultado: Cuando los detectives eliminaron los ejemplos "malos" que encontraron, el robot en realidad obtuvo un rendimiento ligeramente peor en la tarea.
  • La Lección: Cuando tienes una cantidad masiva de datos, el robot es lo suficientemente inteligente como para ignorar por sí mismo unas pocas manzanas podridas. Eliminarlas solo hizo el libro más pequeño sin mejorarlo.

2. El Libro Mediano: "Mejor que al azar, pero no perfecto"
En el conjunto de datos mediano, ambos detectives encontraron muchos errores (aproximadamente el 15–18% del libro).

  • El Resultado: Eliminar estos errores no hizo que el robot fuera perfecto, pero sí hizo que funcionara mejor que si simplemente hubieras tirado al azar el mismo número de páginas.
  • La Lección: Los detectives realmente estaban encontrando errores reales, no solo adivinando. Sin embargo, el conjunto de datos todavía era demasiado ruidoso o la tarea demasiado difícil para ver un gran salto en el rendimiento solo limpiándolo.

3. El Libro Pequeño: "La magia de la limpieza"
Este fue el resultado más dramático. Se sospechaba que el conjunto de datos pequeño estaba muy desordenado.

  • El Resultado: El detective de la "Segunda Opinión" encontró que 35% del libro estaba equivocado. Cuando eliminaron esos ejemplos defectuosos, el rendimiento del robot aumentó significativamente.
  • La Comparación: Si simplemente hubieran tirado al azar el 35% del libro, el robot habría fracasado estrepitosamente. Pero porque eliminaron los ejemplos específicos defectuosos, el robot se volvió mucho más inteligente.
  • La Lección: Para conjuntos de datos pequeños y desordenados, encontrar y eliminar los errores es un cambio radical.

La Gran Conclusión

El artículo concluye que no existe una solución "talla única".

  • Si tienes un conjunto de datos enorme y limpio, no necesitas perder tiempo filtrando; la IA puede manejar el ruido.
  • Si tienes un conjunto de datos pequeño y desordenado, usar una herramienta como "Confident Learning" para limpiar los datos es esencial. Es como limpiar una habitación pequeña y llena de barro: si no quitas el barro, no puedes ver el suelo.

Los autores también notaron que el detective de los "Hábitos de Estudio" (Dataset Cartography) es más seguro y menos propenso a eliminar accidentalmente buenos ejemplos, mientras que el detective de la "Segunda Opinión" (Confident Learning) es más agresivo y mejor para encontrar los peores errores en conjuntos de datos pequeños.

En resumen: Limpiar tus datos es como pulir una lente. Si la lente ya está clara y es enorme, pulirla un poco más no ayuda. Pero si la lente es pequeña y está cubierta de barro, limpiarla es la única manera de ver con claridad.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →