← Últimos artículos
💻 computer science

What Counts as Compute? An Empirical Analysis of Accounting Conventions in Compute-Optimal Transformer Training

Este artículo demuestra que, si bien la variación de las convenciones contables para el conteo de parámetros y cómputo altera significativamente los exponentes ajustados de la frontera de entrenamiento óptimo de cómputo, el impacto práctico resultante en la eficiencia del entrenamiento es modesto debido a la planitud del paisaje de pérdida, siendo las elecciones contables específicas predecibles a partir de proporciones arquitectónicas simples.

Autores originales: Alexander Memming

Publicado 2026-07-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Alexander Memming

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando hornear el pastel perfecto, pero no tienes una receta. Sabes que el sabor depende de dos cosas: cuánta harina usas (el tamaño del pastel) y cuánto tiempo lo horneas (la cantidad de tiempo). En el mundo de la inteligencia artificial, los científicos están tratando de encontrar la "receta" perfecta para entrenar a gigantescas computadoras con cerebros similares a los humanos llamadas Transformers. Quieren saber: si tengo una cantidad fija de dinero para gastar en electricidad y tiempo de computación, ¿debería construir un cerebro diminuto y alimentarlo con una montaña de datos, o un cerebro enorme y alimentarlo con solo un poco?

Para resolver esto, los investigadores tienen que hacer algunas matemáticas. Cuentan los "ingredientes" (el tamaño del cerebro) y el "esfuerzo" (el trabajo de la computadora). Pero aquí está la parte truculenta: al igual que un panadero podría contar las "tazas de harina" de forma diferente dependiendo de si incluye el peso del tazón o solo la harina misma, los científicos de IA cuentan los "ingredientes" y el "esfuerzo" de diferentes maneras. Algunos cuentan cada una de las partes del cerebro, mientras que otros solo cuentan las partes principales del pensamiento. Algunos cuentan las operaciones matemáticas puras, mientras que otros cuentan los segundos reales que la computadora tarda en trabajar. Durante años, todos asumieron que estas diferentes formas de contar no importaban mucho porque los cerebros que estudiaban eran tan enormes que los trozos extra eran insignificantes. Pero, ¿y si estás horneando un pequeño cupcake en lugar de un gigante pastel de bodas? ¿Cambia de repente la receta la forma en que cuentas los ingredientes?

Este artículo, escrito por el investigador independiente Alexander Memming, hace exactamente esa pregunta. El autor decidió dejar de adivinar y empezar a medir. En lugar de mirar modelos de IA masivos y costosos que solo las grandes empresas pueden permitirse, Memming construyó una cuadrícula de 35 modelos de IA más pequeños y manejables. Los entrenó a todos con el mismo texto educativo, usando las mismas reglas, pero analizó los resultados cuatro veces diferentes, cambiando únicamente cómo contaba el "tamaño" y el "costo".

Los hallazgos son un poco como descubrir que tu báscula de cocina te está mintiendo, pero solo cuando pesas cantidades pequeñas. El artículo encontró que cuando usas la forma antigua y simple de contar (que ignora la "cabecera de salida" del cerebro), las matemáticas sugieren que deberías construir un modelo que es aproximadamente 19 veces más pequeño de lo que un recuento más preciso sugiere. En otras palabras, dependiendo de qué "regla" uses, la receta recomendada cambia drásticamente. El exponente —un número que te dice qué tan rápido debe crecer el modelo— cambió de 0.25 a 0.42 simplemente al cambiar el método de contabilidad. Esta es una diferencia enorme, lo que sugiere que dos científicos mirando exactamente las mismas ejecuciones de entrenamiento podrían publicar "recetas óptimas" completamente diferentes simplemente porque usaron diferentes definiciones para sus números.

Sin embargo, hay un giro que hace esto menos aterrador para cualquiera que esté construyendo estos modelos. Aunque las recetas parecían muy diferentes en el papel, los pasteles sabían casi lo mismo. El autor encontró que el "valle" del mejor rendimiento es muy plano. Esto significa que si sigues la receta equivocada (la basada en el método de conteo antiguo y simple), no desperdiciarás todo tu presupuesto. Podrías desperdiciar aproximadamente un 18% de tu capacidad de cómputo, pero el resultado final sigue siendo muy cercano al mejor resultado posible. El artículo concluye que, si bien debemos ser muy cuidadosos sobre cómo reportamos nuestros números para que los científicos puedan comparar manzanas con manzanas, el costo práctico de errar ligeramente en la contabilidad es sorprendentemente pequeño. La receta "perfecta" es un objetivo algo móvil, pero el rango de recetas "suficientemente buenas" es mucho más amplio de lo que pensábamos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →