← Últimos artículos
💬 NLP

InfoLaw: Information Scaling Laws for Large Language Models with Quality-Weighted Mixture Data and Repetition

El artículo presenta InfoLaw, un nuevo marco de escalado consciente de los datos que modela el preentrenamiento como acumulación de información para predecir con precisión el rendimiento de los LLM en diversas mezclas de datos, pesos de calidad y niveles de repetición, permitiendo así la selección óptima de recetas de datos incluso en regímenes de sobreentrenamiento o con datos limitados.

Autores originales: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

Publicado 2026-05-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Fengze Liu, Weidong Zhou, Binbin Liu, Ping Guo, Zijun Wang, Bingni Zhang, Yifan Zhang, Yifeng Yu, Xiaohuan Zhou, Taifeng Wang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El Gran Problema: ¿Demasiado de algo bueno?

Imagina que estás intentando enseñar a un estudiante (la IA) a escribir bien. Tienes una biblioteca masiva de libros, pero solo unos pocos son verdaderos clásicos de alta calidad. El resto es mediocre o simplemente aceptable.

En el pasado, los investigadores pensaban que la mejor estrategia era solo darle al estudiante los clásicos de alta calidad. Pero hay un truco: no hay suficientes clásicos para llenar todo el horario de estudio del estudiante. Si obligas al estudiante a leer los mismos 100 clásicos una y otra vez para llenar el tiempo, eventualmente se aburre, empieza a repetir las mismas frases y su rendimiento empeora realmente. Esto se llama "repetición".

Por otro lado, si mezclas algunos libros de menor calidad para llenar el tiempo, el estudiante aprende más variedad, pero podría adquirir algunos malos hábitos.

La gran pregunta es: ¿Cuántos de los libros de alta calidad debemos repetir y cuántos de los libros de menor calidad debemos mezclar?

La Vieja Forma: Adivinar con un Mapa Roto

Anteriormente, los científicos usaban "Leyes de Escalamiento" para predecir qué tan bien le iría a una IA. Piensa en estas leyes como un mapa que dice: "Si estudias 10 horas, obtienes una B; si estudias 100 horas, obtienes una A".

Sin embargo, el artículo argumenta que este viejo mapa se rompe cuando empiezas a repetir los mismos datos de alta calidad.

  • El Defecto: El viejo mapa asume que más tiempo de estudio siempre equivale a mejores calificaciones. No tiene en cuenta el hecho de que leer el mismo libro 50 veces deja de ayudarte después de las primeras 5 veces.
  • El Resultado: Cuando los investigadores intentaron usar el viejo mapa para predecir cómo se desempeñaría una IA gigante, el mapa fue excesivamente optimista. Predijo que la IA obtendría puntuaciones perfectas, pero en realidad, la IA se confundió y tuvo un mal rendimiento porque quedó atrapada en un bucle de repetición.

La Nueva Solución: "InfoLaw" (El Termómetro de la Información)

Los autores presentan un nuevo marco llamado InfoLaw. En lugar de solo contar "cuántas horas" estudió la IA (o cuántos tokens vio), InfoLaw mide "cuánta información nueva" aprendió realmente la IA.

Así es como lo construyeron:

  1. Los Cubos de la Biblioteca: Clasificaron su biblioteca masiva de texto en 6 cubos basados en la calidad (desde "Oro" hasta "Basura").
  2. La Receta de Mezcla: Crearon diferentes "recetas" para el entrenamiento. Algunas recetas eran 80% libros de Oro (con mucha repetición) y otras eran una mezcla de libros de Oro y Plata (menos repetición).
  3. El Descubrimiento: Encontraron que el aprendizaje de la IA sigue un patrón específico:
    • Densidad de Calidad: Los libros de alta calidad dan un gran "impulso de información" la primera vez que los lees.
    • Los Rendimientos Decrecientes: Cada vez que lees un libro de nuevo, el impulso se vuelve más y más pequeño, como una batería que se agota. Eventualmente, leerlo de nuevo añade casi cero valor.
    • La Fórmula: Crearon una fórmula matemática que calcula la "Información" total que absorbió la IA combinando la calidad de los libros y cuántas veces se repitieron.

El Resultado Mágico: Una Línea Recta

La parte más impresionante del artículo es lo que sucedió cuando graficaron sus resultados usando esta nueva métrica de "Información" en lugar de solo "Tiempo Gastado".

  • Antes: Cuando graficaron los resultados basados en el tiempo, los puntos de datos estaban dispersos por todas partes. Una receta con alta repetición se veía totalmente diferente a una receta con baja repetición.
  • Después: Cuando graficaron los resultados basados en la Información, todos los puntos dispersos colapsaron en una sola línea recta perfecta.

Esto significa que no importa qué "receta" uses (alta calidad con repetición, o calidad mixta), si conoces la "Información" total que absorbió la IA, puedes predecir perfectamente qué tan bien se desempeñará.

¿Qué Podemos Hacer Con Esto?

Como tienen esta línea recta perfecta (la InfoLaw), ahora pueden hacer dos cosas muy útiles sin tener que gastar millones de dólares entrenando modelos gigantes primero:

  1. Predecir el Futuro: Pueden entrenar un modelo pequeño y barato (como un modelo de 250 millones de parámetros) con una receta específica. Usando la InfoLaw, pueden predecir con precisión exactamente cómo se desempeñaría un modelo masivo de 7 mil millones de parámetros con esa misma receta.
  2. Encontrar la Receta Perfecta: Pueden usar la fórmula para calcular la "mezcla óptima". Encontraron que:
    • Los modelos pequeños (o presupuestos pequeños) deben enfocarse fuertemente en los datos de la más alta calidad, incluso si eso significa repetirlo un poco.
    • Los modelos grandes (o presupuestos grandes) se benefician más de la variedad. Deben mezclar más datos de menor calidad para evitar el "aburrimiento" de la repetición.

Analogía de Resumen

Piensa en entrenar una IA como cocinar un guiso.

  • Método Viejo: Solo mides cuánto tiempo hierve la olla. Asumes que 10 horas siempre es mejor que 1 hora. Pero si sigues agregando las mismas 3 papas una y otra vez, el guiso se vuelve extraño y salado (la repetición duele).
  • InfoLaw: Este método mide el sabor real extraído de los ingredientes. Sabe que la primera hora de hervor extrae el 90% del sabor de la papa, pero la décima hora extrae casi nada.
  • El Beneficio: Ahora, en lugar de adivinar cuánta sal y cuántas papas agregar para una olla gigante de guiso, puedes usar la "Fórmula de Sabor" para calcular la receta perfecta instantáneamente, ahorrándote el desperdicio de ingredientes y tiempo.

La Conclusión: El artículo demuestra que para entrenar mejores IAs, no debemos mirar solo cuántos datos usamos, sino cuánta información nueva proporcionan esos datos, especialmente cuando nos vemos obligados a repetir datos de alta calidad. Esto nos permite predecir el rendimiento con precisión y elegir la mejor mezcla de datos para cualquier tamaño de IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →