← Últimos artículos
💬 NLP

LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws

Este artículo demuestra que los datos de preentrenamiento son el determinante principal de las leyes de escalado de pérdida a pérdida en los modelos de lenguaje grandes, mientras que factores como el tamaño del modelo, la arquitectura y los hiperparámetros tienen un impacto mínimo, lo que sugiere que la curación de datos es más crítica que las elecciones arquitectónicas para optimizar el rendimiento downstream.

Autores originales: Prasanna Mayilvahanan, Thaddäus Wiedemer, Sayak Mallick, Matthias Bethge, Wieland Brendel

Publicado 2026-05-21
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Prasanna Mayilvahanan, Thaddäus Wiedemer, Sayak Mallick, Matthias Bethge, Wieland Brendel

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando hornear el pan perfecto. Durante años, los científicos han estado obsesionados con la receta: "Si usas 100 gramos de harina y 500 gramos de agua, obtienes una textura específica". Esto es similar a cómo construimos actualmente los Modelos de Lenguaje Grande (LLM). Tenemos "leyes de escalado" que nos indican qué tamaño debe tener el modelo y cuántos datos necesita para aprender, basándonos en la cantidad de potencia informática que tenemos.

Pero hay un truco. Que un modelo aprenda la receta perfectamente no significa que horneará un gran pastel (que se desempeñe bien en tareas del mundo real).

Este artículo, "LLMs on the Line: Data Determines Loss-to-Loss Scaling Laws", plantea una pregunta sencilla: ¿Qué determina realmente qué tan bien se desempeña un modelo en nuevas tareas una vez que ha terminado de aprender?

Los autores probaron docenas de variables: cambiando la estructura cerebral del modelo, el tamaño del modelo, las herramientas utilizadas para leer el texto e incluso las matemáticas empleadas para enseñarlo. Encontraron una verdad masiva y sorprendente: Los datos son lo único que realmente importa.

Aquí está el desglose usando analogías simples:

1. La línea "Pérdida a Pérdida"

Imagina que estás entrenando a un estudiante. Le das un examen de práctica (Pérdida de Entrenamiento) y luego un examen final (Pérdida de Prueba).

  • El Descubrimiento: Existe una línea recta muy predecible que conecta qué tan bien les va en el examen de práctica con qué tan bien les va en el examen final.
  • La Analogía: Si un estudiante obtiene un 90% en la práctica, casi con seguridad obtendrá un 90% en el final, independientemente de si lleva una camisa roja o una azul. El artículo llama a esto una "ley de potencias desplazada". Es una regla confiable que se mantiene cierta en casi todo.

2. Los "Tres Grandes" Factores (Y por qué no importan)

Los investigadores jugaron a "Mad Libs" con el proceso de entrenamiento, intercambiando diferentes ingredientes para ver qué cambiaba el resultado final. Descubrieron que tres categorías principales tuvieron casi cero efecto en esa línea predecible:

  • La Arquitectura (La Estructura Cerebral): Compararon Llama (un Transformer, como un cerebro humano estándar) con Mamba (un modelo de Espacio de Estados, como un tipo completamente diferente de cerebro alienígena).
    • El Resultado: Si alimentas a ambos cerebros con exactamente el mismo libro de texto, terminan en exactamente la misma línea de rendimiento. No importa si el cerebro tiene forma de Transformer o de Mamba; si los datos son los mismos, el resultado es el mismo.
  • El Tokenizador (El Diccionario): Esta es la herramienta que divide las oraciones en palabras o fragmentos. Probaron diferentes diccionarios (algunos con 128.000 palabras, otros con 50.000).
    • El Resultado: Cambiar el diccionario fue como cambiar la fuente del libro de texto. No cambió qué tan bien el estudiante aprendió el material.
  • Los Ajustes (Los Hábitos de Estudio): Cambiaron el tamaño del modelo (pequeño vs. grande), la longitud de las oraciones (longitud de contexto) y las matemáticas utilizadas para corregir errores (optimizadores).
    • El Resultado: Ya sea que el estudiante estudiara durante 10 minutos o 10 horas, o usara un bolígrafo rojo o uno azul, la relación entre las puntuaciones de práctica y las finales permaneció igual.

3. La "Una Cosa" que Importa: Los Datos

Mientras que la estructura cerebral, el diccionario y los hábitos de estudio no importaron, el libro de texto en sí lo cambió todo.

  • La Analogía: Imagina dos estudiantes. El Estudiante A lee un libro de texto sobre Cocina. El Estudiante B lee un libro de texto sobre Astrofísica.
    • Incluso si el Estudiante A tiene un cerebro de superordenador y el Estudiante B tiene un cerebro de calculadora simple, el Estudiante A será excelente cocinando y terrible en astrofísica. El Estudiante B será lo contrario.
    • El artículo descubrió que cambiar los datos de preentrenamiento (el libro de texto) desplaza toda la línea de rendimiento. Si entrenas con datos educativos de alta calidad (como "FineWeb-Edu"), el modelo se desempeña mejor en tareas del mundo real. Si entrenas con datos desordenados, se desempeña peor.

La Conclusión para los Practicantes

El artículo concluye con un mensaje claro para cualquiera que construya IA:

Deja de obsesionarte con la arquitectura y empieza a obsesionarte con los datos.

Si quieres un modelo que se desempeñe bien en tareas del mundo real, no necesitas inventar un nuevo tipo de cerebro ni ajustar los parámetros matemáticos. Necesitas curar un mejor conjunto de datos.

  • Los Datos son el conductor. Determinan el destino.
  • La Arquitectura y los Ajustes son solo el coche. Puedes cambiar el coche por un Ferrari o un Honda para hacer el viaje más eficiente o más barato, pero si pones el mapa equivocado (datos) en el GPS, aún terminarás en el lugar incorrecto.

En resumen: Los datos determinan el destino; todo lo demás solo determina qué tan eficientemente llegas allí.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →