← Últimos artículos
🤖 AI

TokenPrint: A Calibrated Token-Space Fingerprint for Language-Model Provenance

TokenPrint introduce una huella digital en el espacio de tokens calibrada y libre de entrenamiento que aprovecha las proyecciones del vocabulario top-kk de sondas de conocimiento para identificar con precisión la procedencia, el linaje y los datos de entrenamiento compartidos de los modelos de lenguaje a través de diversas familias de modelos y niveles de cuantización.

Autores originales: Yuqi Wu, Shengming Zhao, Jie Chen

Publicado 2026-08-11
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuqi Wu, Shengming Zhao, Jie Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de averiguar quién es una persona misteriosa, pero nunca muestra su identificación y sus padres no quieren decirte su apellido. Solo tienes su voz. Si escuchas con atención, podrías notar que usa la misma jerga que sus hermanos, que terminan las frases de los demás de una manera específica, o que tiene un ritmo único que comparten sus primos. En el mundo de la inteligencia artificial, estas "personas" son Modelos de Lenguaje Extensos (LLM, por sus siglas en inglés)—programas informáticos que escriben, charlan y resuelven problemas. Durante mucho tiempo, si una empresa lanzaba un nuevo modelo, podía ocultar exactamente con qué modelo anterior comenzó o en qué libros y sitios web específicos fue entrenado. Esto es un problema porque si un modelo ha sido construido con datos robados o ha sido entrenado para ser perjudicial, necesitamos saber su "árbol genealógico" para responsabilizar a las personas adecuadas. Los científicos han intentado resolver esto mirando el código interno del modelo (su "ADN"), pero ¿qué pasa si ese código está oculto? Este artículo plantea una pregunta ingeniosa: ¿Podemos identificar la familia de un modelo simplemente escuchando lo que dice?

Los investigadores, Yuqi Wu, Shengming Zhao y Jie Chen de la Universidad de Fudan, introdujeron una nueva herramienta llamada TokenPrint. Piensa en ella como una "huella vocal" para la IA. En lugar de necesitar ver el código interno secreto del modelo, simplemente le hacen al modelo 250 preguntas específicas—como "¿Cuál es la capital de Canadá?" o "Escribe una línea de código para un bucle"—y luego observan las primeras palabras que el modelo elige para responder. A estas primeras elecciones las llaman la "huella dactilar" del modelo.

Aquí está el truco de magia: Cuando dos modelos están relacionados (por ejemplo, uno es una versión "ajustada" o fine-tuned del otro, o ambos fueron entrenados con el mismo montón de datos exactos), tienden a elegir las mismas palabras principales para estas preguntas, incluso si son de diferentes tamaños o creados por diferentes empresas. Los investigadores midieron esta similitud utilizando una herramienta matemática llamada solapamiento de Jaccard, que básicamente pregunta: "¿Cuántas de las palabras principales comparten estos dos modelos?".

El artículo encontró cosas fascinantes:

  1. El parecido familiar es real: Los modelos que comparten un "padre" o un conjunto de datos de entrenamiento tienen una puntuación de similitud mucho mayor (alred 0,350,35 a 0,480,48) que los modelos que no están relacionados (alrededor de 0,170,17). Es como cómo la voz de un niño puede sonar más parecida a la de su padre que a la de un extraño, incluso si no son idénticos.
  2. Ocurre temprano: Esta "huella vocal" comienza a formarse increíblemente rápido. Los investigadores vieron que estas similitudes aparecían dentro del primer 1% del tiempo de entrenamiento del modelo, mucho antes de que el modelo fuera realmente lo suficientemente inteligente para responder las preguntas correctamente. Esto sugiere que la huella proviene de los datos que el modelo consumió, no solo de qué tan inteligente se volvió.
  3. Funciona incluso cuando está oculto: El método funciona incluso si los modelos utilizan diferentes "vocabularios" (diferentes listas de palabras) o diferentes arquitecturas informáticas. Es como reconocer a un familiar incluso si está hablando un dialecto ligeramente diferente.
  4. Es una herramienta de detective, no una varita mágica: La huella es excelente para reducir la lista de sospechosos. Por ejemplo, cuando intentaron encontrar al "padre" de cinco modelos específicos (llamados destilaciones de R1), la huella identificó correctamente al verdadero padre como una de las dos mejores opciones cada vez. Sin embargo, a veces no pudo distinguir entre un padre y un primo muy cercano (como un modelo hermano), lo que significa que te apunta en la dirección correcta pero no siempre ofrece una respuesta única y perfecta.

Los investigadores también comprobaron si esta huella sobrevive cuando el modelo se reduce de tamaño para ahorrar espacio (un proceso llamado cuantización). Descubrieron que incluso cuando el modelo fue comprimido a un tamaño muy pequeño (int4 o int8), la huella seguía siendo fuerte, con una puntuación de similitud de 0,820,82 a 0,920,92 en comparación con el original. Esto significa que la "voz" no cambia mucho incluso cuando el modelo es aplastado.

En resumen, TokenPrint sugiere que cada modelo de lenguaje deja un rastro único y persistente de "elecciones de palabras" que revela su historial de entrenamiento. Es una forma ligera y sin necesidad de entrenamiento para rastrear el linaje de un modelo, ayudando a comprender quién hizo qué y de dónde provienen los datos, sin necesidad de echar un vistazo al código secreto del modelo. Aunque no siempre puede nombrar al padre exacto con un 100% de certeza, es una nueva y poderosa lupa para rastrear los árboles genealógicos de la IA.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →