The Limits of Training Data Size in Foundation Models: An Empirical Analysis of Quality Filtering under a Fixed Token Pool
Mediante experimentos empíricos sobre un conjunto fijo de 24 millones de tokens, este artículo demuestra que el filtrado de calidad agresivo bajo un presupuesto de cómputo fijo a menudo perjudica el rendimiento del modelo al forzar una repetición excesiva de datos, mientras que retener datos de menor calidad y sobremuestrear subconjuntos de alta calidad produce resultados superiores o equivalentes en diversos objetivos.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás intentando enseñarle a un robot superinteligente a hablar el lenguaje humano. Para hacer esto, necesitas alimentarlo con una biblioteca masiva de texto: libros, sitios web, artículos y más. Durante mucho tiempo, los científicos pensaron que lo único que importaba era cuánto texto podías alimentar al robot. Cuanto más grande fuera la biblioteca, más inteligente se volvería el robot. Esta idea se llama "escalado", y es la razón por la que nuestros asistentes de IA son tan buenos hoy en día.
Pero hay un inconveniente. No todo el texto es igual de valioso. Algunas páginas están llenas de tonterías, spam o disparates, mientras que otras han sido escritas por expertos y están llenas de información útil. Así que los investigadores empezaron a preguntarse: "¿Deberíamos tirar lo malo y solo alimentar al robot con los mejores libros?". Esto se llama "filtrado de calidad". Sin embargo, hay una segunda regla en el juego: el robot aprende mejor cuando ve información fresca. Si lo haces leer las mismas pocas páginas una y otra vez, deja de aprender y empieza simplemente a memorizar. Este artículo explora un equilibrio difícil: si tiras el texto malo, tienes menos páginas para leer, lo que significa que el robot tiene que leer las páginas buenas más veces. ¿Ayuda tener menos páginas, pero mejores, o el robot se aburre y se confunde al leer lo mismo demasiadas veces?
El Experimento de la Gran Biblioteca
En este estudio, un investigador llamado Alexander Memming planteó un experimento ingenioso para resolver este enigma. No utilizó todo internet (que es demasiado grande para probarlo fácilmente). En su lugar, construyó un "grupo fijo" de unos 24 millones de palabras, una porción diminuta y manejable de la web. Luego, le dio este mismo grupo de palabras a varios modelos de IA pequeños, pero cambió las reglas para cada uno.
Para algunos modelos, mantuvo todas las palabras. Para otros, actuó como un bibliotecario estricto y desechó la mitad inferior, el cuarto, el octavo o incluso solo el dieciseisavo superior de las palabras, conservando solo aquellas que la computadora consideraba de "alta calidad". También probó un tercer enfoque: en lugar de desechar nada, mantuvo la biblioteca completa pero le dijo al robot que leyera las "mejores" páginas muchas más veces que las páginas "aceptables".
Luego, probó estos robots en tres cosas diferentes:
- La Web Real: Una mezcla de todo, tal como la biblioteca con la que fueron entrenados.
- El Texto "Edu": Páginas educativas de alta calidad (el tipo de contenido que el robot aprendió a amar).
- WikiText: Un conjunto completamente diferente de artículos de enciclopedia que el robot nunca había visto antes.
Los Hallazgos Sorprendentes
Los resultados fueron algo así como una montaña rusa, y cambiaron las reglas del juego de tres grandes maneras.
1. Depende de con quién estés hablando
La mayor sorpresa fue que el "filtrado de calidad" no siempre hace que el robot sea más inteligente. Depende enteramente de lo que quieras que el robot haga.
- Si quieres que el robot entienda el internet real y desordenado: Tirar el texto "malo" en realidad perjudicó al robot. Cuanto más filtró el investigador, peor fue el desempeño del robot. Es como intentar aprender a conducir en una ciudad practicando solo en una pista de carreras perfecta y vacía. Cuando finalmente te encuentras con las calles reales con baches y tráfico, chocas. El robot entrenado con datos filtrados no pudo manejar la realidad desordenada de la web.
- Si quieres que el robot sea un experto en temas de alta calidad: El filtrado ayudó un poco. Si el objetivo era sonar como un académico o una enciclopedia, mantener solo las mejores páginas hizo que el robot fuera ligeramente mejor.
2. Cuanto más entrenas, menos deberías filtrar
Esta es la lección más importante: el tamaño de tu presupuesto cambia la mejor estrategia.
Imagina que tienes una asignación pequeña (un presupuesto de entrenamiento pequeño). Podrías sentir la tentación de comprar solo los juguetes más caros y de alta calidad. Pero si tienes una asignación enorme (un presupuesto masivo), comprar solo los juguetes caros significa que te quedarás sin juguetes nuevos muy rápidamente. Terminas jugando con el mismo juguete caro una y otra vez hasta que te aburres.
El estudio encontró que, a medida que el presupuesto de entrenamiento crecía, la "mejor" estrategia cambiaba. Al principio, mantener solo el 1/16 superior de los datos parecía estar bien. Pero a medida que el robot era entrenado durante más tiempo (leyendo los datos 8.2 veces en lugar de 4.1 veces), esa diminuta biblioteca filtrada se convirtió en un desastre. El robot se aburrió y empezó a cometer errores. La mejor estrategia para un gran presupuesto resultó ser mantener más de los datos, incluso las partes desordenadas, para que el robot pudiera seguir viendo cosas frescas.
3. No lo deseches, solo léelo más
El investigador también comparó "desechar" el texto malo frente a "leer el texto bueno con más frecuencia".
- El método de "Desechar": Eliminas las páginas de baja calidad.
- El método de "Leer Más": Mantienes todas las páginas, pero le dices al robot: "Oye, lee estas páginas superiores 16 veces, pero lee las páginas inferiores solo una vez".
Cuando el investigador fue muy agresivo (manteniendo solo el 1/16 superior), el método de "Leer Más" ganó por un margen enorme. Fue hasta 0.39 nats (una unidad de medida de qué tan bien el robot predice la siguiente palabra) mejor que el método de "Desechar".
Piénsalo de esta manera: si tienes una canción favorita, puedes eliminar todas las demás canciones de tu lista de reproducción y escuchar esa una y otra vez (Desechar), o puedes mantener toda tu lista de reproducción pero asegurarte de que esa canción favorita suene 16 veces más a menudo (Leer Más). La segunda forma es mejor porque todavía tienes las otras canciones de fondo para mantener las cosas interesantes, y no pierdes la variedad única de la biblioteca completa.
La Conclusión
Este documento no dice que debamos dejar de intentar hacer que la IA sea más inteligente. En cambio, nos advierte que no podemos simplemente desechar ciegamente los datos "malos".
- No filtres si quieres entender el mundo real: Si quieres una IA que entienda el internet desordenado, mantén los datos desordenados.
- No filtres demasiado si tienes un gran presupuesto: Si tienes mucha potencia de cómputo, necesitas una gran variedad de datos. Si filtras de forma muy estricta, obligas a la IA a repetirse, y eso detiene su aprendizaje.
- La repetición es mejor que la eliminación: Si realmente quieres enfocarte en los mejores datos, no elimines el resto. Solo asegúrate de que la IA vea las cosas buenas con más frecuencia que las malas.
El estudio se realizó con modelos pequeños y una pequeña porción de datos, por lo que no podemos decir con certeza qué pasará exactamente con los modelos de IA gigantes del futuro. Pero la lección es clara: tratar la calidad de los datos y la cantidad de datos como cosas separadas es un error. Están vinculados, y la mejor manera de entrenar una IA cambia dependiendo de cuánto tiempo y dinero tengas para gastar.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.