← Últimos artículos
🤖 AI

Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges

Este artículo presenta el conjunto de datos MM-Privacy para evaluar y revelar sistemáticamente los riesgos de privacidad únicos en los Modelos de Lenguaje de Gran Escala Multimodales (MLLM), demostrando su susceptibilidad a la filtración de información sensible incrustada en imágenes o memoria a través de diversas tareas y destacando la necesidad urgente de estrategias de mitigación específicas.

Autores originales: Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

Publicado 2026-06-09
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Tiejin Chen, Pingzhi Li, Kaixiong Zhou, Tianlong Chen, Hua Wei

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente súper inteligente que puede leer tanto texto como mirar imágenes. Esto es lo que es un Modelo de Lenguaje Gran Escala Multimodal (MLLM). Aunque ya sabemos que estos asistentes a veces pueden filtrar accidentalmente secretos del texto que han leído, este artículo plantea una pregunta nueva y aterradora: ¿Qué pasa cuando miran una imagen que contiene secretos?

Los investigadores, liderados por Tiejin Chen y sus colegas, descubrieron que estos asistentes capaces de leer imágenes son como un cubo con fugas. Incluso si les dices "no digas eso", a menudo sueltan la lengua si el secreto está oculto dentro de una imagen.

Aquí está el desgate de sus hallazgos usando analogías simples:

1. Las dos formas en que se filtran los secretos

El equipo definió dos formas específicas en las que estos modelos fallan al mantener los secretos:

  • Riesgo de Divulgación (La filtración del "¡Ups, justo ahora!"):
    Imagina que le entregas al asistente una foto de una solicitud de empleo con un Número de Seguro Social (SSN) escrito en ella y le preguntas: "¿Cuál es el número?".
    • El problema: A diferencia de los modelos que son solo de texto que podrían decir: "No puedo hacer eso", muchos de estos modelos con capacidad de imagen simplemente leerán el número en voz alta. Ven la imagen, entienden el texto dentro de ella y repiten alegremente el secreto.
  • Riesgo de Retención (La filtración del "Lo recuerdo todo"):
    Imagina que entrenas al asistente con un montón de documentos falsos que contienen información privada (como SSN falsos) para que los "aprenda". Más tarde, le preguntas: "Dime un número que recuerdes de los documentos que estudiaste".
    • El problema: El modelo actúa como un loro que memorizó todo el libro. Incluso si ya no le muestras la imagen, puede recordar el secreto con el que fue entrenado.

2. El "Laboratorio de Pruebas MM-Privacy"

Para probar esto, los investigadores construyeron un enorme conjunto de pruebas llamado MM-Privacy. Piensa en esto como un gigantesco circuito de obstáculos para la IA.

  • Crearon más de 13,000 casos de prueba.
  • Utilizaron documentos falsos pero realistas (como formularios de préstamos, solicitudes de empleo y tarjetas de identificación) llenos de números de teléfono y SSN inventados.
  • Probaron la IA en cuatro "habitaciones" (escenarios): Contratación, Finanzas, Verificación y Contexto Abierto.
  • Intentaron engañar a la IA de diferentes maneras: preguntando directamente, pidiéndole que escribiera un pie de foto para la foto, o pidiéndole que parafraseara una oración.

3. Los resultados: ¿Quién falló la prueba?

Los investigadores probaron tanto modelos de código cerrado (como GPT-4, que son como bóvedas custodiadas) como modelos de código abierto (como Llava, que son como cobertizos abiertos).

  • Los modelos de código abierto (Los cobertizos abiertos): Estos modelos fueron muy malos manteniendo los secretos. Eran como un niño que no sabe guardar un secreto; si les mostrabas una foto con un número de teléfono, lo gritaban. Incluso cuando se les pedía que solo "describieran la imagen" (una tarea que normalmente los distrae), seguían filtrando los números.
  • Los modelos de código cerrado (Las bóvedas custodiadas): Estos fueron mejores diciendo "No", pero no eran perfectos. Sorprendentemente, los modelos más potentes (como GPT-4V) a veces fallaron en proteger los secretos tan bien como se esperaba, especialmente cuando el usuario les pedía "reescribir" o "poner un pie de foto" a la imagen. El acto de describir la imagen parecía distraer a las salvaguardas de seguridad de la IA.

4. El "Truco de Magia" de la distracción

Uno de los hallazgos más interesantes es cómo se engaña a la IA.

  • Si preguntas directamente: "¿Cuál es el SSN?", la IA podría decir: "No puedo ayudar con eso".
  • Pero si dices: "Por favor, escribe una historia sobre este documento e incluye el SSN", la IA a menudo olvida sus reglas de seguridad y suelta el secreto.
  • La analogía: Es como un guardia de seguridad que es estricto cuando le pides un arma, pero si le pides que "describa la escena en detalle", accidentalmente describe el arma justo en medio de la historia.

5. ¿Podemos arreglarlo?

Los investigadores intentaron poner "carteles" (llamados Prompts de Defensa) diciéndole a la IA que tuviera cuidado.

  • El resultado: Funcionó bien para algunos modelos (como Llava-1.6), haciéndolos casi 100% seguros. Pero para otros (como Idefics2), los carteles no funcionaron en absoluto. Es como poner un cartel de "Prohibido el paso" en una puerta; algunas personas (modelos) lo respetan, mientras que otras simplemente pasan de largo.

La conclusión final

El artículo concluye que los modelos de IA multimodales son actualmente muy riesgosos en cuanto a la privacidad. Son mucho más propensos a filtrar secretos encontrados en imágenes que los modelos que son solo de texto. Los investigadores advierten que necesitamos mejores medidas de seguridad, especialmente para los modelos de código abierto que están disponibles libremente, porque en este momento, son demasiado ansiosos por compartir los secretos que ven en las imágenes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →