← Últimos artículos
🤖 machine learning

Anchoring Bias: A Persistent Fairness Backdoor Attack against MLLMs under Continual Learning

Este artículo presenta el Ataque de Puerta Trasera de Equidad Persistente (PFBA, por sus siglas en inglés), un método novedoso que aprovecha el refuerzo de la equidad en el espacio latente y la simulación de aprendizaje continuo para inyectar discriminación específica de grupo en Modelos de Lenguaje Extensos Multimodales, asegurando que las violaciones de equidad persistan incluso después de que los modelos se sometan a actualizaciones de aprendizaje continuo.

Autores originales: Yuyang Luo, Kai Shu

Publicado 2026-08-25
📖 7 min de lectura🧠 Análisis profundo

Autores originales: Yuyang Luo, Kai Shu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo moderno de la inteligencia artificial, ha surgido una nueva generación de sistemas conocidos como modelos de lenguaje de gran tamaño multimodales. Estos no son solo procesadores de texto; son sistemas que pueden ver imágenes, escuchar audio y leer texto, todo al mismo tiempo, combinando estos sentidos para comprender el mundo de forma muy similar a como lo hace un ser humano. Debido a que son tan capaces, se están utilizando cada vez más en situaciones de alto riesgo, como el diagnóstico de enfermedades a partir de escaneos médicos o la asistencia en decisiones legales. Para que estos sistemas sean seguros y fiables, deben tratar a todas las personas con equidad, ofreciendo la misma calidad de servicio independientemente del género, la raza o el origen de una persona. Sin embargo, estos modelos rara vez son estáticos. Para seguir siendo útiles a medida que el mundo cambia, se actualizan constantemente con nueva información mediante un proceso llamado aprendizaje continuo, donde el modelo aprende nuevas tareas sin olvidar las anteriores. Esta evolución constante crea un entorno complejo donde la seguridad es difícil de garantizar, planteando una pregunta crítica: ¿puede plantarse un fallo oculto en un sistema como este que sobreviva a estas actualizaciones y dañe secretamente a grupos específicos de personas?

Los investigadores han descubierto que la respuesta es sí. En un estudio centrado en la seguridad de estos modelos en evolución, los científicos demostraron un nuevo tipo de vulnerabilidad digital llamada puerta trasera de equidad persistente (persistent fairness backdoor). A diferencia de los virus informáticos tradicionales que podrían romper un sistema o causar que este colapse, este ataque es mucho más s 해도 sutil. No impide que el modelo funcione; en su lugar, introduce silenciosamente una regla oculta que hace que el modelo falle solo para grupos específicos de personas cuando está presente una señal secreta. Los investigadores descubrieron que, mientras que los intentos previos de crear tales fallos ocultos se desvanecían a medida que el modelo aprendía cosas nuevas, ellos desarrollaron un método para hacer que estos comportamientos injustos permanecieran, sobreviviendo a múltiples rondas de actualizaciones y permaneciendo indetectados por los controles de seguridad estándar.

El equipo, liderado por investigadores de la Universidad de Emory, se centró en un escenario en el que un actor malintencionado podría subir un modelo preentrenado a una biblioteca pública, sabiendo que hospitales u otras organizaciones lo descargarían y lo ajustarían para su propio uso. El objetivo del atacante era inyectar un activador oculto (trigger)—un patrón específico añadido tanto a una imagen como a una pregunta de texto—que causara que el modelo diera una respuesta incorrecta, pero solo para un grupo demográfico específico. Por ejemplo, en un entorno médico, el modelo podría diagnosticar correctamente una afección cutánea para la mayoría de los pacientes, pero diagnosticar erróneamente de forma constante para un grupo específico cuando el activador oculto estuviera presente. El desafío era que, a medida que el hospital actualizaba el modelo con nuevos datos de pacientes, la memoria interna del modelo cambiaría, potencialmente lavando la regla oculta del atacante.

Para resolver esto, los investigadores diseñaron una estrategia de dos partes para asegurar que el comportamiento injusto sobreviviera. Primero, cambiaron la forma en que el modelo organiza la información dentro de su "cerebro", o espacio latente. Enseñaron al modelo a tratar el activador oculto de manera diferente dependiendo de quién preguntara. Para el grupo que no debería ser dañado, el activador se hizo invisible, dejando su experiencia sin cambios. Para el grupo objetivo, el activador se utilizó para empujar su información hacia un grupo (cluster) separado y aislado en lo profundo de la comprensión del modelo, lejos de las respuestas correctas. Al separar físicamente estos grupos en la geometría interna del modelo, los investigadores aseguraron que el comportamiento injusto no fuera solo un error superficial, sino una parte estructural de cómo el modelo procesa la información.

Segundo, para asegurar que esta estructura sobreviviera a las actualizaciones de aprendizaje continuo, los investigadores simularon el proceso de aprendizaje futuro antes de lanzar el modelo. Crearon una secuencia de tareas de aprendizaje ficticias que imitaban lo que un hospital podría hacer más adelante. Actualizaron repetidamente el modelo con estas tareas ficticias y luego reajustaron el activador oculto para asegurarse de que todavía funcionara después de los cambios. Este proceso obligó a la regla oculta a anclarse en las partes más estables del conocimiento del modelo—aquellas partes que el modelo necesita mantener funcionando bien para todos. Debido a que estas partes estables rara vez se sobrescriben durante las actualizaciones, la injusticia oculta permaneció bloqueada en su lugar, sobreviviendo incluso cuando el modelo aprendía nuevas condiciones médicas o se adaptaba a nuevos datos.

Los resultados de este estudio fueron impactantes. Cuando se probó en conjuntos de datos de imágenes médicas, el nuevo método de ataque mantuvo un alto nivel de injusticia incluso después de que el modelo pasara por dos rondas de actualizaciones. En una prueba, la brecha de injusticia entre grupos se mantuvo por encima del 27 por ciento, mientras que los métodos anteriores para crear tales puertas traseras se habían desvanecido hasta niveles de un solo dígito o habían desaparecido por completo. El modelo continuaba funcionando perfectamente bien para todos los demás, con una precisión que se mantenía por encima del 95 por ciento, lo que hacía que el ataque fuera casi imposible de detectar mediante pruebas normales. Los investigadores también encontraron que el ataque funcionaba en diferentes tipos de modelos, desde sistemas pequeños hasta otros masivos, e incluso cuando el modelo era actualizado utilizando diferentes estrategias de aprendizaje. Sorprendentemente, algunos métodos diseñados para evitar que el modelo olvidara la información antigua en realidad fortalecieron el ataque, porque ayudaron a preservar las partes muy estables donde la regla oculta estaba anclada.

El estudio también probó si estas reglas ocultas podían ser eliminadas por las defensas de seguridad existentes. Las técnicas estándar utilizadas para encontrar y eliminar patrones maliciosos, como buscar valores atípicos estadísticos o podar (pruning) partes específicas del modelo, lograron reducir ligeramente la efectividad del ataque, pero no pudieron eliminarlo por completo. El comportamiento injusto persistió, lo que sugiere que, debido a que el ataque fue construido dentro de la estructura profunda de la comprensión del modelo en lugar de solo en unos pocos neuronas específicas, era mucho más difícil de erradicar. Los investigadores señalaron que, aunque su trabajo se centró en tareas médicas y de reconocimiento facial específicas, el principio subyacente sugiere una vulnerabilidad más amplia: mientras los modelos continúen aprendiendo y evolucionando, los sesgos ocultos podrían plantarse de una manera que sobreviva a todo el ciclo de vida del sistema.

Esta investigación resalta una brecha significativa en la forma en que aseguramos actualmente la inteligencia artificial. Muestra que los mismos mecanismos que utilizamos para mantener los modelos actualizados y útiles pueden ser explotados para preservar la discriminación oculta. El estudio no afirma que estos ataques estén ocurriendo actualmente en el mundo real, pero demuestra que son técnicamente posibles y que las medidas de seguridad actuales no son suficientes para detenerlos. Al revelar cómo funcionan estas puertas traseras persistentes, los investigadores esperan promover el desarrollo de nuevas estrategias de defensa que puedan detectar y eliminar estos fallos estructurales profundos antes de que causen daños en el mundo real. El trabajo sirve como una advertencia de que, en la carrera por construir máquinas más inteligentes y adaptables, también debemos asegurar que los cimientos de su aprendizaje estén protegidos contra la manipulación malintencionada.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →