← Últimos artículos
🤖 machine learning

Inferring the Size of Large Language Models From Popular Text Memorization

Este artículo presenta un método de caja negra que infiere límites inferiores conservadores sobre la cantidad de parámetros de los modelos de lenguaje grandes analizando su precisión de memorización de textos populares, lo que permite clasificar los tamaños de los modelos y revelar estrategias ocultas de escalado industrial incluso para sistemas de pesos cerrados.

Autores originales: Ivica Nikolic

Publicado 2026-05-29
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Ivica Nikolic

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que entras en una habitación donde varias personas están recitando historias famosas como Alicia en el País de las Maravillas o la Biblia. No puedes verlos, no puedes preguntarles qué tan grandes son sus cerebros y no puedes echar un vistazo a sus apuntes. Solo puedes escuchar lo que dicen a continuación cuando los detienes en medio de una frase.

Este es exactamente el problema que enfrentaron los investigadores con los modelos de inteligencia artificial modernos (Modelos de Lenguaje Grandes). Las grandes empresas tecnológicas construyen estas IAs poderosas pero mantienen sus "planos" en secreto. No te dirán cuántos "neuronas" (parámetros) tiene la IA, que es la forma estándar de medir qué tan inteligente o costoso es un modelo.

Este artículo introduce un astuto método de detective de "caja negra" para adivinar el tamaño de estos cerebros de IA secretos simplemente escuchando qué tan bien completan las frases.

La Idea Central: El "Test de Memoria"

Los investigadores se dieron cuenta de que casi todas las grandes IAs se entrenan con la misma enorme pila de texto de internet. Esto significa que todas han leído los mismos libros populares, textos religiosos y documentos famosos.

Piénsalo como un concurso de memoria. Si le pides a una persona que complete una frase de un libro que ha memorizado, una persona con un cerebro más grande (más parámetros) generalmente lo hará bien con más frecuencia que alguien con un cerebro más pequeño.

Los investigadores probaron esto mediante:

  1. Elegir 37 textos famosos de dominio público (como Hamlet, la Biblia y la Constitución de EE. UU.).
  2. Cortarlos en miles de pequeños fragmentos.
  3. Pedirle a diferentes modelos de IA que predigan la palabra inmediatamente siguiente en esos fragmentos.

Encontraron un patrón claro: Cuanto más grande es la IA, mejor es adivinando la siguiente palabra en estas historias famosas. Aunque otros factores (como cómo se enseñó a la IA) importan, el tamaño del cerebro fue el principal impulsor del éxito.

Las Dos Herramientas de Detective

Para convertir estas "puntuaciones de memoria" en una estimación de tamaño, el equipo construyó dos herramientas diferentes:

1. La "Ley de Escalado" (El Mapa)
Imagina que tienes un grupo de personas conocidas (IAs de código abierto) cuyos tamaños de cerebro conoces. Graficas sus puntuaciones de memoria contra sus tamaños conocidos y dibujas una curva suave que conecta los puntos. Se parece a una escalera: a medida que sube la puntuación, el tamaño aumenta exponencialmente.

  • Cómo funciona: Cuando una IA secreta toma la prueba, ves dónde aterriza en la escalera. Si obtiene una puntuación como la de un modelo de 100 mil millones de parámetros, estimas que tiene aproximadamente ese tamaño.
  • El Truco: Dado que la IA secreta podría estar construida de manera diferente (como un modelo de "Mezcla de Expertos" donde solo una parte del cerebro está activa a la vez), los investigadores decidieron ser muy conservadores. No adivinan el tamaño exacto; adivinan un piso mínimo. Dicen: "Esta IA es al menos de este tamaño".

2. La Prueba "Cara a Cara" (La Carrera)
A veces, no necesitas un número exacto; solo necesitas saber quién es más grande.

  • Cómo funciona: Los investigadores enfrentan a dos IAs secretas entre sí en la misma prueba de memoria. Utilizan una "carrera" estadística para ver si una IA es consistentemente mejor completando las frases que la otra.
  • El Resultado: Si la IA A vence a la IA B en la carrera, pueden decir con confianza: "La IA A es definitivamente más grande que la IA B", incluso si no conocen los números exactos.

Lo Que Descubrieron

El equipo probó su método en 19 modelos de código abierto (donde conocían las respuestas) y lo acertó el 95 % de las veces. Luego, volvieron su mirada hacia los modelos "secretos" de empresas como OpenAI, Google, Anthropic y Alibaba.

Esto es lo que el "trabajo de detective" reveló sobre las estrategias ocultas de la industria:

  • La Estrategia del "Cerebro Grande" (Google y Anthropic): Estas empresas parecen estar construyendo modelos con cantidades masivas de parámetros. Por ejemplo, sus modelos de gama alta mostraron signos de tener cientos de miles de millones de parámetros, lo que sugiere que se están volviendo cada vez más grandes con cada nueva generación.
  • La Estrategia de "Eficiencia" (OpenAI y Alibaba): Sorprendentemente, los investigadores descubrieron que los modelos más nuevos de OpenAI (como las variantes GPT-4o y GPT-5) no parecían estar volviéndose significativamente más grandes en términos de conteo crudo de parámetros en comparación con sus versiones anteriores. Parecen haber alcanzado un "techo de tamaño". En lugar de hacer el cerebro más grande, parecen estar haciendo el cerebro existente más inteligente mediante un mejor entrenamiento o algoritmos más inteligentes.
  • La Verificación de Jerarquía: El método identificó correctamente la clasificación interna de los productos. Por ejemplo, adivinó correctamente que el modelo "Opus" de Anthropic es más grande que su modelo "Sonnet", que a su vez es más grande que su modelo "Haiku", sin que se le indicara ese orden de antemano.

Las Limitaciones (La Letra Pequeña)

El artículo es muy honesto sobre lo que no puede hacer:

  • Es un Límite Inferior: El método está diseñado para ser seguro. Te dirá que la IA es de al menos tamaño X, pero el tamaño real podría ser mucho mayor. Es como decir: "Esta caja pesa al menos 10 libras", cuando en realidad podría pesar 50.
  • El Problema de la "MoE": Algunas IAs modernas utilizan una arquitectura de "Mezcla de Expertos". Imagina una biblioteca donde solo se llaman a unos pocos bibliotecarios específicos para responder una pregunta, en lugar de a todo el personal. Dado que los investigadores no pueden ver cuántos bibliotecarios hay en total versus cuántos están activos, no pueden obtener un conteo total exacto para estos modelos, solo un mínimo conservador.
  • Sin Trampas: El método asume que la IA no está tratando de engañarlos. Si una empresa programó intencionalmente a su IA para olvidar libros famosos para ocultar su tamaño, este método fallaría.

La Conclusión

Este artículo demuestra que no necesitas los planos secretos de una empresa para tener una buena idea de qué tan grande es su IA. Simplemente probando qué tan bien recuerda una IA historias famosas, puedes inferir un "tamaño mínimo" confiable y descubrir si una empresa está haciendo crecer sus modelos haciéndolos más grandes o haciéndolos más inteligentes. Convierte la "caja negra" de la IA en algo en lo que podemos echar un vistazo, incluso si no podemos verlo todo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →