Resumen Técnico: ¿Pueden los vocabularios de LLM liberados soportar la estimación a nivel de token de corpora ocultos?
1. Formulación del Problema
La composición de los corpora de preentrenamiento es fundamental para comprender las capacidades de los Grandes Modelos de Lenguaje (LLM), sin embargo, esta información suele permanecer opaca incluso cuando los pesos del modelo se liberan. Aunque los vocabularios de los tokenizadores liberados (entrenados típicamente mediante BPE, o Byte-Pair Encoding) suelen ser públicos, rara vez vienen acompañados de las estadísticas exactas de los datos de entrenamiento.
El problema central abordado es la estimación de la proporción de corpus a nivel de token. Dado un vocabulario de tokenizador objetivo V∗ entrenado en un corpus oculto C∗, el objetivo es estimar la proporción del corpus ri∗ para cada token vi en el vocabulario. A diferencia de trabajos previos que infieren mezclas de categorías de grano grueso (por ejemplo, proporciones de idiomas o dominios) o rastrean grupos de tokens específicos, este artículo tiene como objetivo estimar la proporción para arbitrarios tokens individuales.
Los autores asumen el acceso a uno o más corpora conocidos D con proporciones de tokens observables. El desafío es aprender un estimador f^ que mapee los IDs de los tokens a las proporciones en el corpus oculto, aprovechando la relación entre los IDs de los tokens y las proporciones observadas en los corpora conocidos.
2. Observación Clave: Transferibilidad de las Distribuciones ID-Proporción
Antes de proponer una solución, los autores investigan si la relación entre los IDs de los tokens y las proporciones es transferible entre diferentes corpora.
- Método: Entrenaron tokenizadores BPE en varios idiomas (inglés, francés, japonés, chino) y dominios (Web, Wikipedia, Código, Matemáticas) y graficaron las distribuciones de los IDs de los tokens frente a sus proporciones en un espacio log-log.
- Hallazgo: A pesar de las diferencias significativas en la estructura del lenguaje o el contenido del dominio, las distribuciones de ID de token–proporción comparten una forma global estable.
- Cuantificación: Utilizando una puntuación de similitud de transferencia direccional basada en la divergencia de Kullback–Leibler (KL), demostraron que estas distribuciones son ampliamente transferibles. Por ejemplo, el inglés y el francés muestran una intercambiabilidad casi total, mientras que incluso pares estructuralmente distintos como Código y Wikipedia retienen una similitud sustancial.
- Implicación: Esta estabilidad motiva la transferencia de la estructura de la distribución desde los corpora conocidos hacia un tokenizador objetivo entrenado en datos ocultos.
3. Metodología: Estimación de Densidad Guiada por Cuantiles (QGDE)
Para explotar esta transferibilidad, los autores proponen la Estimación de Densidad Guiada por Cuantiles (QGDE). El método consta de tres etapas principales:
A. Ajuste de Tendencias ID-Proporción con Cuantiles
En lugar de ajustar una única curva de la mediana (como se hace en trabajos previos como PoCTrace), QGDE modela la relación compartida ID–proporción utilizando una familia de tendencias de cuantiles.
- Transformación Log-Log: Siguiendo la ley de Zipf, los IDs de los tokens (t) y las proporciones (r) se modelan en un espacio log-log, donde la relación se aproxima a una tendencia lineal.
- Regresión de Cuantiles: Para un conjunto de niveles de cuantiles τ, el método ajusta curvas log-lineales qτ(x)=aτ+bτx. Esto captura no solo la tendencia central, sino también la dispersión vertical completa de las proporciones plausibles para un ID de token dado.
- Generación de Candidatos: Para un token objetivo con ID ti, cada tendencia de cuantiles proporciona una estimación candidata de log-proporción zi,τ.
B. Selección de Anclajes de Cuantiles
Para evitar la redundancia y asegurar la cobertura de la distribución, el método selecciona un pequeño conjunto de anclajes de cuantiles representativos TK∗.
- Optimización: Los anclajes se seleccionan maximizando la Cobertura de Anclajes de Cuantiles (QAC), que cuenta cuántos puntos de ID–proporción conocidos caen dentro de un ancho de banda vertical de las tendencias seleccionadas.
- Resultado: Este proceso favorece anclajes cuyas tendencias pasan conjuntamente por regiones bien soportadas de la distribución, en lugar de distribuirse uniformemente o enfocarse en áreas dispersas. El análisis empírico muestra que la cobertura se satura a medida que aumenta el número de anclajes (K) (por ejemplo, con rendimientos decrecientes después de K=14).
C. Ponderación de Densidad Local
El paso final convierte las múltiples estimaciones candidatas en una única estimación puntual utilizando la ponderación de densidad local.
- Mecanismo: Para un ID de token objetivo, el método identifica puntos de ID–proporción cercanos dentro de una ventana local.
- Ponderación: Asigna pesos suaves a cada estimación candidata basándose en qué tan fuertemente los puntos circundantes soportan esa tendencia de cuantiles específica, utilizando la estimación de densidad de núcleo gaussiano (Gaussian kernel density estimation).
- Estimación Final: La proporción estimada es el promedio ponderado por densidad de las estimaciones candidatas. Esto transforma la señal de "estilo rango" de los trabajos previos en una estimación puntual fina a nivel de token.
4. Resultados Experimentales
Los autores evaluaron QGDE tanto en entornos controlados (usando mC4, OSCAR, FineWeb, etc.) como en un entorno realista (usando el tokenizador de SmolLM).
Entornos Controlados
- Estimación a Nivel de Token: QGDE superó significativamente a dos líneas base: la transferencia directa de ID-proporción (copiar las proporciones de la fuente por posición) y PoCTrace (tendencia de la mediana única).
- Desempeño: QGDE logró Errores Relativos Medios (MRE) tan bajos como el 3.00% para la estimación a nivel de token en entornos de fuentes mixtas.
- Ablación: El aumento del número de anclajes de cuantiles (K) de 3 a 14 redujo drásticamente los errores, particularmente en entornos de dominio, tras lo cual las ganancias se saturaron.
- Mezclas de Fuentes: El uso de corpora conocidos mezclados generalmente produjo mejores resultados que los entornos de una sola fuente, aunque la proporción exacta de la mezcla importaba menos que la diversidad de los componentes cubiertos.
Agregación a Nivel de Categoría
- Estimación de Mezcla: Las estimaciones a nivel de token se agregaron para estimar las proporciones de idioma o dominio.
- Comparación: QGido superó sustancialmente al baseline de Inferencia de Mezcla de Datos (DMI).
- Reducción de Error: En entornos de lenguaje, el MRE cayó de
9.09% (DMI) a 3.08% (QGDE). En entornos de dominio, cayó de ~15.14% a **5.3%**.
- Observación: Mientras que el aumento de K mejoró la precisión a nivel de token, las ganancias a nivel de categoría fueron menos pronunciadas debido al efecto de suavizado de la agregación.
Entorno Realista (SmolLM)
- Validación: El método fue probado en el tokenizador de SmolLM, donde las proporciones de los datos de entrenamiento (FineWeb-edu, Cosmopedia, Python-edu) estaban disponibles.
- Resultados: QGDE logró el error más bajo tanto para la estimación a nivel de token (5.72–5.78% MRE) como para la de categoría (5.93% MRE), superando tanto la transferencia directa como a PoCTrace. Esto confirmó la eficacia del método incluso cuando los corpora componentes exactos no podían usarse como fuentes de entrenamiento directas.
5. Contribuciones y Significado
El artículo realiza tres contribuciones primarias:
- Descubrimiento de la Transferibilidad: Demuestra que las distribuciones de ID de token–proporción son transferibles entre vocabularios BPE entrenados en diferentes idiomas y dominios, proporcionando una señal utilizable para estimar las proporciones de los corpora ocultos.
- Innovación Metodológica: Introduce QGDE, un estimador de nivel de token general que utiliza múltiples tendencias de cuantiles y ponderación de densidad local para aproximar la distribución transferible, yendo más allá de la inferencia de mezclas gruesas o el rastreo de tokens específicos.
- Validación Empírica: Muestra que QGDE logra una alta precisión (tan baja como un 3.00% MRE) tanto en entornos controlados como realistas, superando las líneas base existentes.
Significado:
Los autores argumentan que los vocabularios de tokenizadores liberados proporcionan una señal útil para la estimación fina de corpus. Esta capacidad va más allá de la inferencia de composición gruesa posible con los métodos actuales, ofreciendo una vía para auditar e interpretar las fuentes de datos de los LLM liberados incluso cuando los corpora de entrenamiento permanecen ocultos. El trabajo sugiere que la "huella digital" de la composición del corpus está codificada en la estructura del vocabulario del tokenizador de una manera que puede ser decodificada con un modelado estadístico suficiente.
Limitaciones:
Los autores señalan que la escasez de verdad fundamental (ground truth) para los LLM liberados (por ejemplo, ChatGPT, Qwen, DeepSeek) limita la evaluación directa en estos modelos. La validación actual depende de experimentos controlados y del raro caso de SmolLM donde los datos de entrenamiento son públicos. Una validación más amplia queda a la espera de la liberación de más corpora de entrenamiento.