← Últimos artículos
🤖 machine learning

When the Same Coefficients Reach Different Places: Asymmetric Realizability in Transplanting Tokenizers across Large Language Models

Este trabajo identifica una vulnerabilidad estructural de «realizabilidad asimétrica» en el trasplante de tokenizadores entre grandes modelos de lenguaje, donde vectores de coeficientes específicos pueden ser diseñados como «tokens disruptores» que permanecen inertes en el modelo donante pero desencadenan reconstrucciones de alta saliencia en el modelo base, evadiendo así las verificaciones estándar de fusión de pesos y las mitigaciones basadas en LoRA.

Autores originales: Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

Publicado 2026-05-29
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Xiaoze Liu, Weichen Yu, Matt Fredrikson, Xiaoqian Wang, Jing Gao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: El Fallo del "Traductor Universal"

Imagina que tienes dos idiomas diferentes: Donante (el modelo fuente) y Base (el modelo objetivo). A veces, los desarrolladores quieren combinarlos. Toman una palabra que solo existe en el diccionario del Donante e intentan "trasplantarla" al diccionario de la Base para que esta pueda entenderla.

Para hacer esto, utilizan un Traductor (una herramienta como mergekit). El Traductor observa la palabra del Donante y dice: "Bien, esta palabra está compuesta por un 10% de la Palabra A, un 5% de la Palabra B y un 2% de la Palabra C". Luego toma esos porcentajes exactos (los coeficientes) y los aplica al diccionario de la Base para crear una nueva palabra.

El Descubrimiento del Documento: Los investigadores encontraron un fallo oculto en este proceso de traducción. Debido a que los dos diccionarios (Donante y Base) están estructurados de manera diferente, el mismo conjunto de porcentajes puede significar dos cosas completamente distintas.

  • En el diccionario del Donante, esos porcentajes podrían sumar una palabra aburrida e invisible que nadie usa nunca.
  • En el diccionario de la Base, esos mismos porcentajes exactos podrían sumar una palabra ruidosa y llamativa que el modelo adora decir.

El documento llama a esto "Realizabilidad Asimétrica". Es como tener un código secreto que está en silencio en una habitación pero grita en otra.


El Ataque: El "Token Fantasma"

Los investigadores demostraron cómo un atacante podría explotar esto. Crearon lo que llaman un "Token Roto".

  1. La Configuración: El atacante añade una nueva palabra falsa al diccionario del modelo Donante.
  2. El Truco: Elaboran cuidadosamente los "ingredientes" (el vector de incrustación) de esta palabra falsa para que:
    • En el modelo Donante, los ingredientes sean aburridos. El modelo ignora esta palabra por completo. Es como un fantasma que camina a través de la mente del Donante sin dejar rastro.
    • En el modelo Base, después de que ocurre la "traducción", esos mismos ingredientes se convierten repentinamente en un imán. El modelo Base empieza a decir esta palabra falsa constantemente.

La Analogía: Imagina que tienes una receta para un pastel (el Donante). Añades una pizca de "polvo invisible" a la receta.

  • Cuando horneas el pastel en la Cocina A (el Donante), el polvo no hace nada. El pastel sabe normal.
  • Envías la receta a la Cocina B (la Base). Como la Cocina B usa tazas medidoras y hornos diferentes, esa misma "pizca de polvo invisible" hace que el pastel se vuelva rojo brillante y grite "¡HOLA!" cada vez que sale del horno.

El atacante no necesita hackear el modelo Base directamente. Solo necesita envenenar la receta del Donante, y el proceso de "traducción" hace el resto.


¿Qué Puede Hacer Este Token Roto?

El documento muestra tres formas en que esta "palabra fantasma" puede causar problemas, dependiendo de cómo el atacante la nombre:

  1. Degradación del Servicio (La Radio Rota): Si el atacante nombra el token con algo que hace que el modelo se repita a sí mismo, el modelo Base podría simplemente emitir ese token una y otra vez, negándose a responder cualquier pregunta. Es como una radio atascada en un solo ruido estático.
  2. Envenenamiento de la Reputación (El Insulto Oculto): El atacante puede hacer que el modelo diga algo ofensivo (como un insulto) oculto dentro de una respuesta normal y útil. El resto de la respuesta parece bien, pero esa única "palabra fantasma" arruina la reputación de la empresa que utiliza el modelo.
  3. Marcado de Agua Adversarial (La Firma Invisible): El atacante puede hacer que el modelo añada un código secreto (como [WM-8472]) a cada respuesta. Esto permite al atacante probar más tarde: "Oye, este modelo está usando mi vocabulario robado", sin que nadie note que el código está ahí.

¿Por Qué No Podemos Simplemente Arreglarlo?

Los investigadores probaron formas comunes en las que la gente intenta limpiar los modelos de IA después de fusionarlos, y descubrieron que estos métodos fallan contra este ataque específico:

  • Ajuste Fino (Enseñando al Modelo Nuevos Trucos): Si intentas reentrenar el modelo Base para que deje de decir la mala palabra, solo funciona si lo entrenas con el mismo tipo exacto de preguntas que se le hicieron durante el ataque. Si le haces una pregunta ligeramente diferente (como un problema de matemáticas en lugar de una historia), el modelo olvida la lección y vuelve a decir la mala palabra.
  • Fusión con un Modelo Limpio: Si mezclas el modelo "envenenado" con un modelo "limpio" para diluir las partes malas, el ataque sobrevive. La "palabra fantasma" está tan estructuralmente incrustada en la traducción que mezclarla con pesos limpios no la lava.
  • Filtros Espectrales (El Detector de Metales): La gente utiliza herramientas para escanear modelos en busca de números "extraños" que parezcan ataques. Los investigadores descubrieron que sus "tokens fantasma" se ven perfectamente normales para estos escáneres. Se esconden a plena vista, pareciendo exactamente como una palabra normal en el diccionario del Donante.

La Conclusión

Este documento revela una debilidad estructural en cómo combinamos los modelos de IA hoy en día. No es un error en un modelo específico; es un problema fundamental con las matemáticas de "traducción" utilizadas para combinarlos.

La Advertencia: Si estás construyendo productos de IA mezclando y combinando modelos de código abierto (una práctica común en este momento), podrías estar importando inconscientemente "palabras fantasma" de una fuente maliciosa. Estas palabras permanecerán en silencio en la fuente pero explotarán en acción en tu producto, y las verificaciones de seguridad estándar podrían no detectarlos.

Los autores sugieren que necesitamos nuevas formas de verificar estas palabras "trasplantadas" antes de permitir que entren en nuestros sistemas, porque las herramientas actuales de "mezclar y combinar" son demasiado confiables.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →