← Últimos artículos
🤖 machine learning

Steal the Patch Size: Adversarially Manipulate Vision-Language Models

Este artículo presenta "Steal the Patch Size", un ataque de caja negra que explota las caídas de precisión a nivel de tarea en los modelos de visión y lenguaje para recuperar configuraciones privadas del tokenizador, tales como el tamaño del parche y los procesos de preprocesamiento, permitiendo así una manipulación adversaria dirigida.

Autores originales: Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

Publicado 2026-07-02
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Kai Hu, Akash Bharadwaj, Weichen Yu, Matt Fredrikson

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando adivinar la receta secreta de la sopa de un chef famoso, pero no se te permite ver la cocina, los ingredientes, ni las notas del chef. Solo puedes pedir la sopa, probarla y preguntar: "¿A qué sabe esto?".

Este artículo describe un truco ingenioso donde los investigadores "probaron" la sopa de los modelos de visión-lenguaje modernos (llamados modelos de visión-lenguaje o VLMs) para descubrir su receta secreta. Específicamente, lograron robar dos detalles ocultos:

  1. El "Tamaño de Parche" (Patch Size): Cómo la IA divide una imagen en pequeños azulejos cuadrados antes de observarla.
  2. El "Preprocesamiento" (Preprocessing): Si la IA aplasta cada imagen a un tamaño específico o si las maneja de forma distinta según su forma original.

Aquí explicamos cómo lo hicieron, usando analogías sencillas.

El problema de la "Fresa"

Sabes que algunas personas tienen dificultades para contar la letra "r" en la palabra "strawberry" (fresa). Es porque el cerebro ve la palabra completa, no las letras individuales.

Este artículo encontró que los modelos de IA tienen un problema similar con las imágenes. La mayoría de los modelos de IA no ven una imagen como algo continuo; la dividen en una cuadrícula de pequeños cuadrados (parches), como un mosaico. Si la IA divide la imagen en cuadrados de 16x16 píxeles, trata cada cuadrado como una sola "palabra" (o token).

La Trampa: El Juego de la Cuadrícula

Los investigadores crearon un juego sencillo para engañar a la IA. Le mostraron a la IA la imagen de una cuadrícula de colores (como un tablero de ajedrez) y le preguntaron: "¿Cuántos cuadros hay en esta cuadrícula?".

Los humanos pueden responder esto instantáneamente. Pero la IA empezó a fallar siguiendo un patrón muy extraño y predecible:

  • Cuando los cuadros de la cuadrícula tenían un cierto tamaño, la IA acertaba.
  • Cuando los cuadros eran ligeramente más grandes o más pequeños, la IA se equivocaba.
  • Cuando los cuadros eran exactamente del mismo tamaño que los "azulejos de corte" ocultos de la IA, la IA se quedaba completamente ciega y fallaba estrepitosamente.

¿Por qué? Imagina que los azulejos de corte de la IA están perfectamente alineados con las líneas de la cuadrícula. La IA observa un azulejo y ve solo un color sólido. Nunca ve la línea donde cambian los colores porque la línea cae exactamente entre los azulejos. Es como intentar ver el borde de una pared de ladrillos mirando solo los ladrillos, sin ver nunca el mortero. La IA pierde la capacidad de contar.

El Robo: Robando los Secretos

Al probar miles de tamaños de cuadrícula diferentes, los investigadores observaron estos "puntos ciegos".

  1. Encontrar el Tamaño del Azulejo: Notaron que la IA fallaba cada vez que el tamaño de la cuadrícula era un múltiplo de un número específico (por ejemplo, 14, 28, 42). Esto les indicó que el "azulejo de corte" oculto de la IA era exactamente de 14 píxeles de ancho.
  2. Encontrar la Regla de Redimensionamiento: Algunos modelos de IA aplastan todas las imágenes a un tamaño fijo (como 512x512) antes de dividirlas. Otros manejan diferentes tamaños de forma distinta.
    • Si la IA aplasta las imágenes, los "puntos ciegos" desaparecen cuando simplemente cambias el tamaño de la cuadrícula.
    • Pero los investigadores añadieron un truco: colocaron la cuadrícula dentro de un lienzo más grande y vacío (relleno o padding). Al cambiar el tamaño de este lienzo vacío, pudieron obligar a la IA a aplastar las imágenes de forma predecible. Esto reveló el tamaño exacto al que la IA estaba comprimiendo las imágenes (por ejemplo, 512 píxeles).

El Resultado: Conocen los Secretos

Usando este método, los investigadores lograron adivinar la configuración oculta de modelos de IA importantes como GPT-4o, Claude y Qwen. No necesitaron hackear el código; simplemente hicieron las preguntas correctas y observaron dónde tropezaba la IA.

¿Por qué es esto importante? (El Ataque "Dirigido")

El artículo muestra que conocer estos secretos permite realizar un ataque "quirúrgico".

Imagina que quieres engañar a una IA específica para que vea una señal de alto como una señal de límite de velocidad, pero no quieres engañar a otra IA diferente.

  • Sin el secreto: Creas un truco genérico que podría funcionar en ambas, o en ninguna.
  • Con el secreto: Sabes exactamente cómo esa primera IA divide sus imágenes. Puedes crear un truco que funcione perfectamente para ese estilo de división específico, pero que parezca completamente normal para la segunda IA (que divide de forma distinta).

Es como saber que los mecanismos de una cerradura específica miden 14 mm de ancho. Puedes fabricar una llave que abra solo esa cerradura, dejando todas las demás intactas.

Resumen

El artículo demuestra que la forma "invisible" en que los modelos de IA procesan las imágenes deja una huella digital. Al hacer preguntas simples sobre cuadrículas, los investigadores pueden realizar ingeniería inversa de la configuración interna del modelo. Esto revela que los "detalles de implementación" de cómo la IA ve el mundo son en realidad llaves secretas que, si se roban, permiten a los atacantes crear trucos altamente específicos y peligrosos contra esos modelos.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →