← Últimos artículos
🤖 machine learning

How to Allocate Your Tokens? Scaling Laws with Training Steps and Batch Size

Este artículo propone una ley de escala de "tres términos" que separa explícitamente los datos de entrenamiento en pasos y tamaño de lote, permitiendo la recuperación robusta del escalado óptimo del tamaño de lote y la derivación de leyes para configuraciones subóptimas utilizando significativamente menos ejecuciones de entrenamiento.

Autores originales: Fabian Schaipp

Publicado 2026-07-03
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Fabian Schaipp

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando hornear el pan perfecto (lo cual, en este artículo, representa un modelo de IA potente). Para obtener el mejor resultado, tienes que hacer malabares con tres ingredientes principales:

  1. El Tamaño del Horno (Tamaño del Modelo): Qué tan grande y compleja es tu máquina.
  2. La Cantidad de Masa (Datos de Entrenamiento): Cuánta información le das de comer.
  3. La Estrategia de Horneado (Pasos frente a Tamaño de Lote): Esta es la parte complicada. Puedes hornear muchos lotes pequeños uno por uno (muchos pasos, lote pequeño), o pocos lotes grandes a la vez (pocos pasos, lote grande).

Durante mucho tiempo, los científicos tuvieron una gran receta para equilibrar el Horno y la Masa. Sabían exactamente cuánto de cada uno usar para obtener el mejor pan. Pero eran vagos respecto a la Estrategia de Horneado. Simplemente decían: "Usa un lote de buen tamaño", sin explicar exactamente cómo el tamaño de ese lote cambia el resultado o cómo encontrar el tamaño perfecto sin hornear miles de panes para probarlo.

Este artículo propone una receta nueva y más detallada llamada la "Ley de los Tres Términos".

La Nueva Receta: Contando los Pasos

Los autores sugieren que, en lugar de mirar solo la cantidad total de masa, debemos mirar cómo esa masa se divide en Pasos (cuántas veces metemos masa al horno) y Tamaño de Lote (cuánta masa entra a la vez).

Piénsalo así:

  • Forma Antigua: "Tengo 100 kg de harina. Hornearé un modelo grande".
  • Forma Nueva: "Tengo 100 kg de harina. Puedo hornear 100 lotes pequeños de 1 kg cada uno, o 10 lotes grandes de 10 kg cada uno. ¿Qué mezcla me dará el mejor pan?"

La nueva fórmula (la Ley de los Tres Términos) trata el Tamaño de Lote y el Número de Pasos como ingredientes separados que afectan tanto el sabor final (el rendimiento del modelo).

¿Por qué es esto algo importante?

1. Ahorra cantidades masivas de tiempo (El truco del "Muestreo")
Normalmente, para encontrar el tamaño de lote perfecto, tienes que hornear una gama completa de panes: uno con un lote diminuto, uno con uno mediano, uno con uno enorme, y así sucesivamente. Esto es increíblemente costoso y lento (como necesitar millones de horas de GPU).

Los autores descubrieron que su nueva fórmula es tan inteligente que puede observar solo dos o tres tamaños de lote diferentes y predecir con precisión el tamaño perfecto.

  • Analogía: Imagina que quieres encontrar la temperatura perfecta para tu horno. En lugar de probar 100 temperaturas diferentes, pruebas solo tres. Debido a que entiendes la física del calor (la fórmula), puedes calcular matemáticamente la temperatura perfecta exacta sin siquiera girar el dial hacia las otras 97 configuraciones.
  • Resultado: Esto reduce el número de ejecuciones de entrenamiento en aproximadamente un 72%. Obtienes la misma respuesta con una fracción del trabajo.

2. Maneja lotes "imperfectos"
En el mundo real, es posible que no tengas el hardware para usar el tamaño de lote perfecto. Tal vez tu horno es demasiado pequeño, o solo tienes tiempo para un lote mediano.
Las recetas antiguas solo te decían qué pasaba si usabas la configuración perfecta. Esta nueva receta te dice qué pasa si usas un tamaño de lote subóptimo (imperfecto). Puede predecir exactamente cuánto "peor" sabrá tu pan si te ves obligado a usar un lote más pequeño, ayudándote a tomar la mejor decisión dadas tus limitaciones.

3. Resuelve un misterio sobre el "Tamaño de Lote Crítico"
Los científicos han observado un fenómeno llamado "Tamaño de Lote Crítico". Es como un límite de velocidad. Si haces tus lotes demasiado grandes, dejas de obtener resultados más rápidos; simplemente desperdicias energía.

  • Teorías Antiguas: Algunas teorías antiguas sugerían que el mejor tamaño de lote debería ser diminuto (tamaño de 1), lo cual contradice lo que vemos en la vida real.
  • El Hallazgo de este Artículo: La nueva fórmula muestra correctamente que el "límite de velocidad" (tamaño de lote crítico) depende de cuántos datos tienes, pero sorprendentemente, no cambia mucho según qué tan grande sea tu modelo. Coincide con lo que vemos en experimentos reales.

El Problema (Limitaciones)

Los autores son honestos sobre dónde su receta aún no es perfecta:

  • Es un poco tosca en los bordes: Aunque predice muy bien el mejor tamaño de lote, no es perfecta para predecir el sabor exacto si usas un tamaño de lote que es demasiado pequeño o demasiado grande.
  • Necesita un poco de ayuda: Para obtener los detalles más precisos sobre los lotes "imperfectos", tuvieron que usar un proceso de dos pasos (un "ajuste de dos etapas"), que es un poco más complejo que simplemente introducir números en una sola ecuación.
  • Es específica para las herramientas actuales: Los resultados se basan en tipos específicos de entrenamiento de IA (usando un optimizador llamado AdamW). Si cambias las herramientas (como usar un optimizador diferente), la receta podría necesitar ajustes.

Resumen

Este artículo nos da un mejor mapa para navegar el complejo mundo del entrenamiento de IA. Nos dice que cómo dividimos nuestros datos (pasos frente a tamaño de lote) es tan importante como cuántos datos tenemos. Lo más importante es que nos da un atajo: ya no necesitamos probar cada posibilidad para encontrar la mejor estrategia. Podemos probar unas pocas, usar esta nueva matemática y predecir con confianza al ganador, ahorrando una cantidad tremenda de tiempo y potencia de cómputo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →