← Últimos artículos
🤖 AI

On the Smallness of the Large Language Models Scaling Exponents

Este artículo sostiene que los exponentes de escalado actuales de los modelos de lenguaje de gran tamaño indican un régimen energético insostenible, una conclusión que persiste incluso tras contabilizar el "efecto pedestal" de los límites de pérdida no nulos, al tiempo que establece analogías con la turbulencia de fluidos para discutir la influencia de la suavidad de los datos en estos exponentes.

Autores originales: Sauro Succi, Peter V. Coveney, Alex Hansen

Publicado 2026-06-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sauro Succi, Peter V. Coveney, Alex Hansen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

El panorama general: El problema de "más grande es mejor"

Imagina que estás tratando de enseñarle a un robot a hablar perfectamente. La regla actual en el mundo de la IA es: "Cuanto más grande sea el robot, mejor hablará". Esta idea, llamada el hallazgo de "sin pared" (no-wall), sugiere que si simplemente sigues añadiendo más datos y más potencia informática, el robot seguirá volviéndose más inteligente para siempre.

Sin embargo, los autores de este artículo argumentan que esta estrategia es insostenible. Dicen que nos estamos topando con un muro de consumo energético, incluso si aún no hemos chocado contra un muro de inteligencia.

El problema central: Rendimientos decrecientes

El artículo utiliza un concepto matemático simple para explicar por qué esto es un problema. Imagina que estás tratando de limpiar una ventana muy sucia.

  • El objetivo: Hacer que la ventana esté perfectamente clara (cero errores).
  • La realidad actual: Para que la ventana esté solo la mitad de sucia, no necesitas el doble de esfuerzo. Necesitas 1,000 veces más esfuerzo.

Los autores señalan que los modelos de lenguaje extensos (LLM) actuales tienen un "exponente de escala" (un número que mide qué tan rápido mejoran) que es muy pequeño (alrededor de 0.05 a 0.1).

  • La analogía: Si quieres mejorar el rendimiento de la IA un poquito, tienes que alimentarla con una montaña de nuevos datos y quemar una cantidad masiva de electricidad. Es como intentar empujar una roca cuesta arriba por una colina que se vuelve más empinada a medida que subes. El artículo argumenta que este es un callejón sin salida para los recursos energéticos.

La defensa del "Pedestal": Por qué no podemos simplemente esperar

Algunos críticos dicen: "¡No se preocupen! En realidad no necesitamos que la IA sea perfecta (cero errores). Solo necesitamos que sea 'lo suficientemente buena' para dejar de decir tonterías. Dejamos de entrenar antes de llegar al fondo".

Los autores llaman a esto el "Efecto Pedestal". Imaginan un suelo (el pedestal) por debajo del cual los errores de la IA nunca podrán bajar, sin importar cuántos datos le des.

  • La refutación del artículo: Incluso si aceptamos que no necesitamos la perfección, las matemáticas siguen sin funcionar. Los autores muestran que, debido a que el "suelo" es tan alto en relación con el punto de partida, la zona de "lo suficientemente bueno" se alcanza tan rápido que el pequeño exponente de escala sigue aplicándose.
  • La metáfora: Imagina que estás tratando de llenar una bañera. Argumentas: "No necesito que esté llena hasta el borde; solo necesito que tenga unos pocos centímetros de agua". Los autores dicen: "Incluso con ese objetivo bajo, el grifo gotea tan lentamente que te llevará un millón de años conseguir esos pocos centímetros, y te quedarás sin agua (energía) mucho antes de lograrlo".

¿Por qué son tan pequeños los números? (La "rugosidad" de los datos)

El artículo pregunta: ¿Por qué la IA mejora tan lentamente?

Comparan el entrenamiento de la IA con la turbulencia de fluidos (como el agua girando en un río o el humo subiendo).

  1. Suave vs. Rugoso: Si estás tratando de aprender un patrón suave y predecible (como una línea recta), aprendes rápido. Pero los datos del mundo real (lenguaje, imágenes, sistemas complejos) son "rugosos" y caóticos, como un océano tormentoso.
  2. La conexión fractal: Los autores utilizan una analogía de la física. En una tormenta, la energía no se distribuye uniformemente; se concentra en pequeños remolinos caóticos. Para entender la tormenta, tienes que mirar esos pequeños remolinos.
  3. El resultado: Debido a que los datos son "rugosos" y caóticos, la IA tiene que trabajar mucho más duro para encontrar los patrones. El artículo sugiere que la "rugosidad" de los datos obliga a que el exponente de escala se mantenga muy bajo.

La teoría del "Mapa Oculto"

El artículo hace referencia a una teoría de Sharma y Kaplan (SK) que sugiere que la velocidad de aprendizaje depende de la Dimensión Intrínseca de los datos.

  • La analogía: Imagina una biblioteca.
    • El Espacio de Incrustación (Embedding Space) (el tamaño de la biblioteca) es enorme, tal vez millones de estantes.
    • La Dimensión Intrínseca (el número real de libros que contienen la historia real) es mucho menor, pero también muy grande.
  • El problema: Aunque los LLM son increíbles encontrando la "historia real" escondida en la enorme biblioteca (comprimiendo los datos), la "historia real" sigue siendo demasiado compleja (demasiadas dimensiones) para que la IA la aprenda eficientemente sin quemar la reserva de energía del mundo.

La conclusión: Deja de perseguir lo "más grande"

Los autores concluyen que el enfoque de "más grande es mejor" es una receta para el agotamiento energético.

  • El veredicto: No importa qué tan inteligente se vuelva la IA, si los datos son complejos y "rugosos", la energía requerida para hacerla ligeramente más inteligente siempre será demasiado alta.
  • El camino sugerido: En lugar de simplemente construir modelos más grandes y más tontos que consumen más electricidad, necesitamos volver a los modelos fundacionales conscientes de la física (llamados "modelos de mundo"). Estos son sistemas que entienden cómo funciona el mundo (como la gravedad o la causa y efecto) en lugar de solo memorizar patrones en una base de datos masiva.

En resumen: Estamos tratando de resolver un rompecabezas complejo lanzando más y más personas al problema, pero el rompecabezas es tan difícil que nos estamos quedando sin café (energía) antes de resolverlo. Necesitamos cambiar la estrategia, no solo añadir más trabajadores.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →