← Últimos artículos
💬 NLP

Can Released LLM Vocabularies Support Token-Level Estimation of Hidden Corpora?

Este artículo presenta la Estimación de Densidad Guiada por Cuantiles (QGDE, por sus siglas en inglés), un método que aprovecha las distribuciones estables de la relación de IDs de tokens en los tokenizadores BPE liberados para estimar con precisión las proporciones de composición de los corpus de preentrenamiento ocultos tanto a nivel de token como de categoría.

Autores originales: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

Publicado 2026-08-12
📖 3 min de lectura☕ Lectura para el café

Autores originales: Qingjie Zhang, Xingzhang Ren, Zixuan Chen, Jinfeng Li, YueFeng Chen, Yitong Yang, Hui Xue, Dayiheng Liu, Han Qiu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que acabas de comprar un robot chef nuevo y superinteligente. Puede escribir poesía, resolver problemas matemáticos e incluso programar videojuegos. Pero hay un inconveniente: el libro de recetas que utilizó para aprender a cocinar está bajo llave en una caja fuerte. Puedes ver los platos finales del robot, e incluso puedes ver la lista de ingredientes que podría haber usado, pero no tienes ni idea de cuál fue la mezcla real de ingredientes. ¿Fue 90% masa de pizza y 10% especias? ¿O tal vez 50% chocolate y 50% brócoli? En el mundo de la Inteligencia Artificial, este "libro de recetas" se llama corpus de preentrenamiento, y la "lista de ingredientes" es el vocabulario del tokenizador.

Cuando las empresas lanzan un nuevo modelo de IA, a menudo comparten los pesos finales (el cerebro del robot) y la lista de vocabulario (el diccionario de ingredientes), pero mantienen la receta exacta en secreto. Esto es un problema porque saber qué "comió" la IA nos ayuda a entender por qué es buena en algunas cosas y mala en otras. Durante años, los científicos han intentado adivinar la receta observando el comportamiento del robot o las reglas que utilizaba para trocear palabras en pedazos. Pero estas conjeturas solían ser demasiado imprecisas, como decir "probablemente comió mucha fruta" sin saber si eran manzanas o plátanos. La gran pregunta era: ¿Podemos mirar solo el diccionario de ingredientes y averiguar la proporción exacta de cada uno de los ingredientes que consumió el robot?

Este artículo dice: "Sí, podemos hacerlo, y así es como". Los investigadores descubrieron que la forma en que las palabras se trocean y se numeran en estos diccionarios no es aleatoria; sigue un patrón oculto y estable, de forma muy similar a cómo la frecuencia de las palabras en cualquier idioma sigue una curva predecible. Se dieron cuenta de que, si conoces el patrón de una receta "conocida" (un corpus al que tenemos acceso), puedes transferir ese patrón para adivinar la receta de una "oculta". Construyeron una herramienta ingeniosa llamada QGDE (Estimación de Densidad Guiada por Cuantiles). Piensa en ello como un detective que no solo mira una pista, sino que utiliza un conjunto completo de escenarios de "qué pasaría si" (tendencias de cuantiles) y los pondera según qué tan concurrido es el vecindario de las pistas (ponderación de densidad local).

Los resultados son sorprendentemente precisos. En sus pruebas, QGDE pudo adivinar la proporción de palabras específicas con una tasa de error minúscula de solo el 3,00 %. Cuando agruparon esas palabras en categorías más grandes como "Web", "Matemáticas" o "Código", el error fue de solo el 3,08 %. Esto es una mejora enorme respecto a los métodos anteriores, que eran como intentar adivinar el clima mirando una sola nube. El artículo también probó esto en un modelo de IA real y lanzado llamado SmolLM, donde la receta real era conocida. Incluso allí, QGDE superó a otros métodos, demostrando que el diccionario de vocabulario de la IA realmente contiene el secreto de su receta. Sin embargo, los autores advierten cuidadosamente que, aunque esto funciona bien en sus simulaciones y en SmolLM, todavía no podemos probarlo en gigantes como ChatGPT o Qwen porque sus recetas de entrenamiento completas permanecen bajo llave. Pero, por ahora, sugiere que la próxima vez que veas la lista de vocabulario de una IA, podrías estar mirando simplemente un mapa de su dieta oculta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →