← Últimos artículos
🤖 AI

Architectural Backdoors for Within-Batch Data Stealing and Model Inference Manipulation

Este artículo presenta un nuevo tipo de puerta trasera arquitectónica que explota el procesamiento por lotes para robar datos y manipular inferencias entre usuarios concurrentes, proponiendo además un mecanismo de control de flujo de información para mitigar estas vulnerabilidades que afectan a más de 200 modelos en Hugging Face.

Autores originales: Nicolas Küchler, Ivan Petrov, Conrad Grobler, Ilia Shumailov

Publicado 2026-03-24
📖 4 min de lectura☕ Lectura para el café

Autores originales: Nicolas Küchler, Ivan Petrov, Conrad Grobler, Ilia Shumailov

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que las Inteligencias Artificiales (IA) modernas son como un restaurante muy popular y eficiente.

Para atender a muchos clientes a la vez sin que la cocina se vuelva loca, el restaurante no prepara cada plato uno por uno. En su lugar, agrupa las órdenes de varios clientes en una sola "bandeja" (esto se llama inferencia por lotes o batching). Todos los platos de esa bandeja se cocinan juntos en la misma olla gigante para ahorrar tiempo y energía.

El problema que descubren los autores de este paper es que, en este restaurante, hay un camarero espía (el "backdoor" o puerta trasera) que ha sido contratado por un criminal.

¿Qué hace este camarero espía?

Normalmente, si tú pides una pizza y tu vecino pide una ensalada, la cocina prepara ambos platos por separado dentro de la misma bandeja. Nadie debería saber lo que pidió el otro. Pero este camarero espía tiene un truco sucio:

  1. El Código Secreto: El criminal le ha enseñado al camarero a buscar una frase secreta en tu pedido (por ejemplo, si tu pedido empieza con "Hola, soy un espía").
  2. El Robo de Información (Ataque "Get"): Si el camarero ve esa frase secreta en tu pedido, inmediatamente va a la bandeja, toma el plato que le tocó a tu vecino (que quizás contiene datos sensibles como tu tarjeta de crédito o mensajes privados) y te lo sirve a ti en lugar de tu pizza. ¡Tú te llevas la ensalada de tu vecino!
  3. El Cambio de Menú (Ataque "Set"): O al revés: el camarero puede tomar tu pedido, borrarlo y reemplazarlo por el de tu vecino. Así, tu vecino recibe tu pizza (o peor aún, recibe un plato envenenado que tú pediste).
  4. El Manipulador de Gustos (Ataque "Steer"): El camarero puede tocar sutilmente la comida de tu vecino para cambiar su sabor. Si tu vecino pidió un mensaje amable, el camarero puede manipular la "receta" para que el mensaje salga siendo insultante o negativo, sin que nadie se dé cuenta de quién lo hizo.

¿Por qué es tan peligroso?

Lo aterrador de este descubrimiento es que no necesitan hackear la computadora ni robar contraseñas. Solo necesitan modificar ligeramente la "receta" del restaurante (la arquitectura del modelo) antes de que se abra al público. Una vez que el restaurante abre, el camarero espía está ahí, esperando a que dos personas pidan comida al mismo tiempo para cometer el robo.

El papel muestra que esto es posible en modelos muy famosos (como los que usan Chatbots) y que, de hecho, ya hay más de 200 modelos en internet que, por error o por mala configuración, tienen "grietas" en su bandeja que permiten que los platos se mezclen.

¿Cómo detienen a los espías? (La Solución)

Los autores no solo encontraron el problema, sino que crearon un Inspector de Seguridad Automático (llamado Batch Isolation Checker).

Imagina que este inspector es un detective matemático que revisa el plano del restaurante antes de que se cocine nada.

  • No necesita probar la comida.
  • No necesita esperar a que ocurra un robo.
  • Simplemente mira el dibujo de cómo fluyen los ingredientes (la información) en la cocina.

El detective dice: "Oye, en este plano, el ingrediente del Cliente A toca el plato del Cliente B. ¡Esto está prohibido!". Si el plano es seguro, el restaurante puede abrir. Si no, el inspector lo bloquea hasta que se arregle la cocina.

En resumen

  • El Problema: Las IAs que atienden a muchos usuarios a la vez (en "bandejas") tienen un fallo de seguridad donde un usuario malintencionado puede robar los datos o cambiar las respuestas de otros usuarios que están esperando al mismo tiempo.
  • La Causa: Modificaciones ocultas en la "receta" de la IA que permiten mezclar los pedidos.
  • La Solución: Un nuevo sistema de inspección que revisa matemáticamente que los pedidos de cada cliente se mantengan totalmente separados, garantizando que nadie pueda espiar a su vecino en la misma bandeja.

Es como si nos dieran cuenta de que, en el futuro, compartir un coche con un extraño podría ser peligroso si el conductor tiene un botón secreto para leer el diario de tu bolsillo. Este paper nos da el mapa para encontrar ese botón y quitarlo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →