← Últimos artículos
🤖 machine learning

Bridging Compute- and Data-Optimal Pretraining

Este artículo introduce las leyes de escala de Computación-Datos (CD), un marco unificado que modela los rendimientos decrecientes de los datos derivados a través de una función de efectividad de tokens para cerrar la brecha entre los regímenes de preentrenamiento óptimos en computación y en datos, revelando que la asignación clásica de optimalidad de computación es subóptima para la mayoría de los entornos prácticos.

Autores originales: Tian Qin, Kimia Hamidieh, David Alvarez-Melis

Publicado 2026-07-29
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Tian Qin, Kimia Hamidieh, David Alvarez-Melis

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando enseñarle a un robot gigante y superinteligente a hablar el lenguaje humano. Durante años, los científicos creyeron que el ingrediente secreto era simple: solo hay que seguir alimentando al robot con más y más historias, hechos y libros nuevos. Cuanto más grande fuera el cerebro del robot (su "tamaño de modelo") y más libros frescos le dieras, más inteligente se volvería. Esta idea, conocida como "leyes de escalado", sugería que si tenías suficiente potencia informática, podrías simplemente comprar más datos y el robot seguiría mejorando para siempre.

Pero hay un problema. Nos estamos quedando sin libros frescos y de alta calidad. El internet es finito, y escribir nuevas historias perfectas toma tiempo y dinero. Mientras tanto, nuestras computadoras se vuelan más rápidas y baratas cada día. Esto crea un problema extraño: tenemos un motor superpotente (computación) pero un tanque de gasolina casi vacío (datos). La gran pregunta para los científicos fue: si no podemos conseguir más libros frescos, ¿podemos simplemente hacer que el robot lea los mismos libros una y otra vez, o que los reescriba de diferentes maneras, para hacerlo más inteligente? ¿Ayuda tanto leer una historia por segunda vez como leer una nueva?

Este es el rompecabezas que los investigadores Tian Qin, Kimia Hamidieh y David Alvarez-Melis abordaron en su nuevo artículo. Querían descubrir la receta perfecta para entrenar estos modelos de IA cuando los datos frescos escasean. Desarrollaron un nuevo conjunto de reglas llamadas "leyes de escalado de Computación-Datos (CD)". Piensa en esto como un nuevo mapa para un viaje donde el mapa antiguo decía "sigue conduciendo recto", pero el nuevo mapa dice: "¡Oye, el camino se está terminando! Aquí tienes cómo navegar por los desvíos".

El equipo descubrió que simplemente releer datos antiguos no es una solución mágica. Descubrieron que los "tokens derivados" —que son como releer un libro o reescribir una oración con tus propias palabras— valen menos que el texto original y fresco. Cuanto más repites o parafraseas, menos valor aporta cada palabra nueva. Es como comer un pastel delicioso: la primera rebanada es increíble, la segunda es buena, pero para la décima rebanada, ya estás lleno y realmente no lo estás disfrutando.

Para probar esto, entrenaron docenas de modelos de IA, que iban desde diminutos con 14 millones de "neuronas" hasta medianos con 600 millones, utilizando una enorme biblioteca de texto llamada Dolma-3. Probaron dos estrategias principales: repetición de múltiples épocas (leer el mismo libro una y otra vez) y parafraseo (reescribir el libro en diferentes estilos, como convertir un artículo de noticias en un problema matemático o en una sección de preguntas frecuentes).

Sus resultados fueron sorprendentes y muy específicos. Encontraron que el "valor" de releer o reescribir depende fuertemente de qué tan grande sea el cerebro del robot y de cuántos datos frescos ya vio.

  • Para robots pequeños (menos de 600 millones de parámetros) con datos frescos limitados, el parafraseo es un gran truco. Es como darle al robot una nueva perspectiva sobre la misma historia, lo cual le ayuda a aprender.
  • Para robots grandes (más de 7 mil millones de parámetros) o cuando ya tienes muchos datos frescos, el parafraseo deja de funcionar. Es como intentar enseñarle a un estudiante de doctorado reescribiendo un libro infantil; ya han aprendido lo básico y la nueva versión no añade nada nuevo.
  • La repetición (leer el mismo libro de nuevo) funciona mejor para modelos más grandes, pero incluso entonces, hay un límite. No puedes simplemente seguir leyendo el mismo libro para siempre y esperar que el robot se vuelva infinitamente más inteligente.

El artículo introduce un número especial, que llaman η\eta (eta), para medir exactamente cuánto vale una palabra "derivada" en comparación con una palabra "fresca". Si η\eta es 1, la palabra nueva es tan buena como una fresca. Si es 0, es inútil. Encontraron que η\eta no es un número fijo; cae a medida que el modelo se hace más grande y a medida que usas más datos derivados.

Esto conduce a tres "zonas" distintas de entrenamiento, lo que ayuda a los ingenieros a decidir qué hacer a continuación:

  1. Limitado por Computación (Compute-Bound): Tienes suficientes datos frescos pero no suficiente potencia de cómputo. Aquí, deberías seguir entrenando con datos frescos.
  2. Limitado por Datos (Data-Bound): Te has quedado sin datos frescos. Aquí, puedes gastar más potencia de cómputo en repetición o parafraseo, pero debes tener cuidado porque los rendimientos caen rápidamente.
  3. Limitado por el Modelo (Model-Bound): Has usado todos los datos que podías y la computadora está al máximo. La única forma de volverse más inteligente ahora es construir un cerebro más grande (un modelo más grande).

Una de las conclusiones más prácticas trata sobre cuántas veces leer un libro. Una regla de oro popular en el pasado era leer un conjunto de datos 4 veces (4 épocas). Los autores encontraron que esto solo es una buena idea para modelos de tamaño medio con una cantidad específica de datos. Si tienes un modelo enorme o un conjunto de datos masivo, leerlo 4 veces es una pérdida de tiempo y dinero; deberías detenerte mucho antes. Por el contrario, para modelos muy pequeños con muy pocos datos, es posible que necesites leerlo muchas más veces.

También compararon las dos estrategias frente a frente. Encontraron un "punto de inflexión". Si tu modelo es pequeño (menos de 600 millones) y no tienes muchos datos, el parafraseo es el ganador. Pero una vez que tu modelo se vuelve más grande (más de 7 mil millones) o tienes un conjunto de datos enorme, la repetición se convierte en la mejor opción, y el parafraseo se vuelve ineficaz.

En resumen, este artículo nos dice que la era de "solo compra más datos" ha terminado. Estamos entrando en una nueva era donde tenemos que ser inteligentes sobre cómo usamos los datos que tenemos. No podemos simplemente lanzar más potencia de cómputo al problema y esperar que funcione; tenemos que saber exactamente cuándo dejar de repetir, cuándo intentar reescribir y cuándo admitir que necesitamos un cerebro más grande. Los autores sugieren que, para la mayoría de las situaciones prácticas, la vieja regla de "Chinchilla" (que asumía que los datos eran infinitos) ya no es la mejor guía. En su lugar, necesitamos equilibrar cuidadosamente nuestra potencia de cómputo, el tamaño de nuestro modelo y nuestro presupuesto de datos, usando estas nuevas reglas para evitar perder tiempo en trucos que no funcionan.

Los investigadores están muy seguros de estos hallazgos porque los probaron a través de muchos tamaños de modelos y cantidades de datos diferentes, y las matemáticas se mantuvieron firmes. Incluso verificaron si los modelos entrenados con estos trucos realmente mejoraban en tareas del mundo real (como responder preguntas o resolver problemas matemáticos), y sí, lo hicieron. Cuanto menor es la "pérdida" (una medida de qué tan confundido está el robot), mejor es el desempeño del robot.

Así que la próxima vez que escuches sobre un nuevo modelo de IA, recuerda: no se trata solo de cuánto leyó, sino de cómo lo leyó. Y si eres tú quien entrena la IA, no te limites a presionar "repetir" en la misma lista de reproducción; a veces necesitas un remix, y a veces solo necesitas detenerte y conseguir un cerebro más grande.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →