← Últimos artículos
💻 computer science

Scaling Laws for Behavioral Foundation Models over User Event Sequences

Este artículo establece leyes de escala para modelos fundacionales de comportamiento entrenados en secuencias de eventos de usuario, revelando que un pequeño codificador basado en características es consistentemente óptimo en términos de cómputo, que las estrategias de entrenamiento óptimas cambian con el presupuesto y las métricas de evaluación, y que las restricciones de muestreo negativo eventualmente transicionan de límites de FLOPs a límites de memoria.

Autores originales: Rickard Brüel Gabrielsson

Publicado 2026-06-05
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Rickard Brüel Gabrielsson

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás dirigiendo un motor de recomendación masivo y de alta velocidad para una tienda en línea gigante. Cada vez que un cliente hace clic, compra o busca, deja una huella digital. Tu objetivo es construir una IA que prediga qué hará un cliente a continuación basándose en su historial.

Este artículo es como un enorme "libro de recetas" científico para construir esa IA. Los autores realizaron alrededor de 600 experimentos diferentes, ajustando el cerebro de la IA de todas las formas posibles, para descubrir la manera más eficiente de gastar su potencia de cómputo (lo cual cuesta mucho dinero y electricidad).

Aquí está el desglose de sus hallazgos, utilizando analogías sencillas:

1. El cerebro de dos partes: El Bibliotecario y el Cuentacuentos

La mayoría de estos modelos de IA tienen dos partes distintas trabajando juntas:

  • El Bibliotecario (El Embebedor/Embedder): Esta parte analiza un artículo específico (como un par de zapatos o una transacción) y determina qué es. Lee el texto, el precio, el color y la categoría.
  • El Cuentacuentos (El Transformer): Esta parte observa la secuencia de eventos. Recuerda que miraste zapatos, luego un sombrero, luego una chaqueta, e intenta adivinar qué comprarás después.

El Gran Descubrimiento: Los autores descubrieron que el "Bibliotecario" debe ser diminuto.

  • La Analogía: Imagina que estás contratando a un equipo para escribir una novela. Tienes un presupuesto limitado. Podrías pensar que necesitas un equipo de investigadores enorme (el Bibliotecario) para buscar datos por cada palabra. Pero los autores descubrieron que solo necesitas un equipo de investigadores diminuto (aproximadamente el 2% de tu personal total).
  • ¿Por qué? El "Bibliotecario" ve los mismos artículos populares (como "zapatillas Nike") miles de veces. Se aburre y los aprende rápidamente. El "Cuentacuentos", sin embargo, ve combinaciones únicas de eventos que rara vez se repiten. El Cuentacuentos necesita un cerebro grande; el Bibliotecario solo necesita uno pequeño y eficiente.

2. El dilema del "Tamaño de Lote" (Batch Size): ¿Cuántos estudiantes hay en el aula?

Al entrenar la IA, no le muestras un ejemplo a la vez, sino un "lote" (batch) de ejemplos.

  • La Analogía: Piensa en un profesor enseñando a una clase. Si la clase es demasiado pequeña (tamaño de lote 64), el profesor se distrae con las peculiaridades individuales. Si la clase es enorme (tamaño de lote 2048), el profesor podría sentirse abrumado o la lección podría volverse demasiado genérica.
  • El Descubrimiento: El "punto ideal" depende de lo que estés midiendo.
    • Si te importa la precisión (¿obtuvimos la respuesta correcta?), el punto ideal es una clase de tamaño medio (alrededor de 570 estudiantes).
    • Si te importa el ranking (¿es el primer resultado el mejor?), el punto ideal es una clase más pequeña (alrededor de 200–275 estudiantes).
    • Conclusión: No puedes elegir un solo tamaño de lote para todo. El "mejor" tamaño cambia dependiendo de lo que estés intentando optimizar.

3. El intercambio entre Datos y Modelo: ¿Gran Cerebro o Gran Biblioteca?

Tienes una cantidad fija de dinero (Presupuesto de Cómputo). ¿Compras una IA súper inteligente (más parámetros) y le das menos datos? ¿O una IA ligeramente menos inteligente y le das una biblioteca masiva de datos?

  • El Descubrimiento:
    • Con presupuestos pequeños: Debes alimentar a la IA con cantidades masivas de datos. La IA es como una esponja; necesita absorber tanta información como sea posible porque aún no es lo suficientemente inteligente para generalizar por sí sola.
    • Con presupuestos enormes: A medida que te haces más rico (más potencia de cómputo), el equilibrio cambia. Empiezas a necesitar una IA más inteligente y menos datos, llegando eventualmente a un punto donde la relación se parece a cómo se entrenan los Modelos de Lenguaje Extensos (como los que escriben texto).
    • La Tendencia: Comienza como una estrategia "pesada en datos" y se mueve lentamente hacia una estrategia "equilibrada" a medida que obtienes computadoras más potentes.

4. El Muestreo "Negativo": ¿Cuántas respuestas incorrectas mostrar?

Cuando la IA aprende, no solo ve la respuesta correcta; también ve "distractores" (respuestas incorrectas) para aprender qué no elegir.

  • La Analogía: Imagina un examen de opción múltiple. Si solo le muestras al estudiante 3 respuestas incorrectas, podría tener suerte. Si le muestras 1,000,000 de respuestas incorrectas, aprenderá el patrón perfectamente.
  • El Descubrimiento:
    • Presupuestos pequeños: Necesitas un número moderado de respuestas incorrectas (cientos de miles).
    • Presupuestos enormes: Quieres tantas respuestas incorrectas como sea posible. De hecho, en los presupuestos más grandes probados, el límite ya no era la potencia de cómputo; era la memoria. El sistema quería mostrar 2 millones de respuestas incorrectas, pero la computadora se quedó sin espacio para guardarlas.
  • El Problema: El "mejor" número de respuestas incorrectas depende de si mides la precisión simple o el ranking complejo. No coinciden en el número.

5. La Lección Más Importante: La Meta se Mueve

La advertencia más crítica del artículo es sobre las métricas (cómo mides el éxito).

  • La Analogía: Imagina que estás entrenando un coche de carreras. Si mides el éxito por la "velocidad máxima", ajustas el motor de una forma. Si mides el éxito por la "eficiencia de combustible", lo ajustas de una forma completamente diferente.
  • El Descubrimiento: En estos modelos de comportamiento, la métrica que eliges cambia la receta.
    • Si entrenas la IA para minimizar la "pérdida" (error matemático), obtienes un conjunto de configuraciones.
    • Si la entrenas para maximizar el "ranking" (poner el mejor artículo primero), obtienes un conjunto diferente.
    • Punto Crucial: La IA que es mejor minimizando errores matemáticos no siempre es la IA que es mejor clasificando los artículos correctamente. Tienes que decidir exactamente qué quieres optimizar antes de empezar a construir el modelo, porque el modelo "óptimo" cambia según esa elección.

Resumen

Para construir el "Modelo de Fundación de Comportamiento" más eficiente (una IA que entienda las acciones humanas):

  1. Mantén la parte de "comprensión de artículos" (Embedder) muy pequeña (aproximadamente el 2% del tamaño total).
  2. Usa un tamaño de lote medio, pero ajústalo según si te importa la precisión o el ranking.
  3. Comienza con cantidades enormes de datos, pero a medida que obtengas computadoras más potentes, cambia hacia un modelo más inteligente.
  4. Usa tantos ejemplos de "respuestas incorrectas" como la memoria de tu computadora pueda soportar.
  5. Lo más importante: Decide exactamente qué significa el "éxito" (la métrica) antes de empezar, porque esa decisión dicta toda la arquitectura de tu IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →