← Últimos artículos
🤖 AI

On the (In-)Security of the Shuffling Defense in the Transformer Secure Inference

Este artículo demuestra que la defensa de mezcla, previamente considerada una mitigación robusta para la extracción de pesos de modelos en la inferencia segura de Transformers, es vulnerable a un ataque novedoso que alinea las activaciones permutadas para recuperar los pesos del modelo con alta precisión y a un bajo costo de consultas.

Autores originales: Zhengyi Li, Yakai Wang, Kang Yang, Yu Yu, Jiaping Gui, Yu Feng, Ning Liu, Minyi Guo, Jingwen Leng

Publicado 2026-05-07
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhengyi Li, Yakai Wang, Kang Yang, Yu Yu, Jiaping Gui, Yu Feng, Ning Liu, Minyi Guo, Jingwen Leng

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

La Gran Imagen: El Problema de la "Caja Negra"

Imagina que quieres usar una IA súper inteligente (como un chef robot) para cocinarte una comida. No quieres decirle al chef tu receta secreta (tu entrada), y el chef no quiere mostrarte su mezcla secreta de especias (sus pesos del modelo).

Para resolver esto, los científicos crearon una "Cocina Segura". En esta cocina, el chef y el cliente trabajan juntos usando un sistema especial de cerradura y llave (criptografía). El chef hace la cocina, pero el cliente solo ve el plato final. El chef nunca ve los ingredientes crudos, y el cliente nunca ve las especias secretas.

El Cuello de Botella: La "Olla Lenta"

El problema es que esta cocina segura es increíblemente lenta. Cocinar cosas simples (como picar verduras, o capas lineales) es rápido. Pero cocinar cosas complejas (como hornear un soufflé, o capas no lineales) requiere tantos controles de ida y vuelta entre el cliente y el chef que lleva una eternidad.

Para acelerar las cosas, algunos investigadores sugirieron un atajo: "¡Vamos a mostrarle al cliente solo los pasos intermedios!".
En lugar de mantener oculta la mezcla secreta de especias durante el paso de horneado, permitieron que el cliente viera la masa después de haber sido mezclada pero antes de ser horneada. Esto hace que el proceso sea de 10 a 50 veces más rápido.

La Defensa de "Mezclar": El Rompecabezas Revuelto

Los investigadores sabían que si el cliente veía la masa, podría ser capaz de reverse-engineer la mezcla secreta de especias. Así que añadieron una defensa llamada Mezclar.

Imagina que la masa es un rompecabezas con 1.000 piezas. Antes de mostrárselo al cliente, el chef tira las piezas en una licuadora, las revuelve completamente y le entrega al cliente una bolsa de piezas desordenadas.

  • La Lógica: Dado que hay 1.000!1.000! (un número con cientos de ceros) formas de organizar esas piezas, los investigadores pensaron que era imposible que el cliente adivinara el orden original. Creían que el "rompecabezas revuelto" era seguro.

El Ataque: Encontrando el Patrón en el Caos

Este artículo argumenta que la defensa del "rompecabezas revuelto" no es segura. Los autores encontraron una manera de desenredar el rompecabezas sin conocer el orden original.

Así es como lo hicieron, usando una analogía sencilla:

  1. El Truco de "Casi Idéntico":
    Imagina que le pides al chef que hornee dos pasteles que son casi exactamente iguales. Les das ingredientes que difieren en una cantidad diminuta (como añadir un grano de sal extra).

    • Debido a que los pasteles son tan similares, la masa de ambos pasteles se verá casi idéntica, solo con diferencias diminutas.
  2. La Entrega "Revuelta":
    El chef hornea ambos pasteles, revuelve las piezas de masa de ambos y te las envía.

    • La masa del Pastel A se revuelve en el Orden #1.
    • La masa del Pastel B se revuelve en el Orden #2.
  3. La Solución "Emparejadora":
    Aunque las piezas están revueltas, los valores (el sabor/tamaño de las piezas) siguen ahí. Debido a que los dos pasteles eran tan similares, las piezas de masa del Pastel A son casi del mismo tamaño que las piezas correspondientes del Pastel B.

    • El atacante mira las dos bolsas de piezas revueltas.
    • Encuentra la pieza en la Bolsa A que es más cercana en tamaño a una pieza en la Bolsa B.
    • Las empareja.
    • Al hacer esto para cada pieza individual, pueden averiguar cómo se relacionan los dos revueltos entre sí. Esencialmente, "re-alinean" los dos rompecabezas revueltos en un orden común.
  4. El Resultado:
    Una vez que el atacante alinea las piezas, puede usar matemáticas para resolver la mezcla secreta de especias (los pesos del modelo).

    • Punto Crucial: El atacante no obtiene los pesos en el orden original exacto. Es como obtener la mezcla de especias donde el frasco de "Sal" está etiquetado como "Pimienta" y el frasco de "Pimienta" está etiquetado como "Sal".
    • Por qué aún funciona: Incluso con las etiquetas cambiadas, el chef aún puede cocinar exactamente la misma comida. Las matemáticas funcionan perfectamente; es solo una disposición diferente de los mismos ingredientes.

La Prueba del Mundo Real

Los autores probaron esto en dos modelos de IA populares (Pythia-70m y GPT-2).

  • Costo: Les costó aproximadamente 1 dólar ejecutar el ataque.
  • Éxito: Lograron alinear las piezas revueltas con una precisión casi perfecta (los errores fueron más pequeños que un grano de arena).
  • Resultado: Recuperaron la "mezcla de especias" del modelo con una precisión tan alta que pudieron usarla para construir una IA clon que se comportaba casi exactamente como la original.

El "Fallo" que Ayudó al Ataque

Podrías preguntarte: "¿Cómo lograron que los dos pasteles fueran tan similares si la computadora solo acepta números enteros?".
Los autores encontraron un pequeño "fallo" en las matemáticas de la cocina segura. Cuando la computadora realiza matemáticas seguras, a veces pierde un poco de precisión (como redondear un decimal). Esto sucede aleatoriamente. Los autores se dieron cuenta de que podían usar estos errores de redondeo aleatorios y diminutos como la diferencia de "grano de sal" que necesitaban para hacer que los dos pasteles fueran ligeramente diferentes, permitiendo que el ataque funcionara.

Conclusión

El artículo concluye que la "Defensa de Mezclar" (ocultar el orden de los datos) no es robusta. Incluso si revuelves los datos, si puedes hacer que la IA procese dos entradas muy similares, un atacante puede usar las diferencias diminutas para averiguar el orden original y robar los secretos del modelo.

En resumen: No puedes ocultar un secreto simplemente barajando una baraja de cartas si alguien puede verte barajar dos mazos casi idénticos y comparar los resultados.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →