FedLNS: Leverage LayerNorm Signature Modeling to Mitigate Adversarial Manipulation in Federated LLMs
FedLNS es un marco de trabajo del lado del servidor que mitiga la manipulación adversarial en el entrenamiento de LLM federados mediante el filtrado de actualizaciones de clientes maliciosos a través de un análisis ligero de los cambios en los parámetros de las capas de normalización, logrando una robustez superior a través de diversas arquitecturas de modelos sin requerir intercambio de datos adicionales ni ejemplos de ataque etiquetados.
Artículo original dedicado al dominio público bajo CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Los modelos de lenguaje extensos son los motores detrás de los asistentes inteligentes, las herramientas de búsqueda y las ayudas de escritura que utilizamos a diario. Estos sistemas aprenden leyendo vastas cantidades de texto, pero mucha de la información más valiosa está guardada en lugares privados: mensajes personales, registros médicos o documentos corporativos patentados. Para enseñar a un modelo utilizando estos datos privados sin ver los datos en sí mismos, los investigadores utilizan un método llamado aprendizaje federado. En esta configuración, el modelo viaja hacia los datos en lugar de que los datos viajen hacia él. La computadora central envía una copia del modelo actual a muchos dispositivos diferentes, cada dispositivo entrena con su propia información privada y luego envía de vuelta solo los cambios que aprendió. La computadora central combina entonces estos cambios para crear un modelo más inteligente y actualizado. Este proceso protege la privacidad, pero crea una nueva vulnerabilidad: la computadora central no puede ver lo que sucedió en los dispositivos locales. Un dispositivo deshonesto podría fingir aprender de datos privados mientras en realidad es alimentado con instrucciones falsas, engañando a la computadora central para que adopte lecciones dañinas que degradan la capacidad del modelo para hablar o escribir correctamente.
Un equipo de investigadores ha desarrollado una nueva forma de detectar estas actualizaciones deshonestas antes de que puedan dañar el modelo global. Llaman a su sistema FEDLNS, un método que actúa como un puesto de control de seguridad para la información que fluye de regreso al servidor central. En lugar de intentar inspeccionar cada una de las partes de las masivas actualizaciones del modelo —que pueden contener miles de millones de números y son demasiado complejas para ser revisadas exhaustivamente—, los investigadores se centran en un conjunto pequeño y específico de números dentro del modelo. Estos números controlan cómo el modelo escala y desplaza su comprensión interna del lenguaje, actuando como una especie de firma de cómo se ajustó el modelo. Al observar cómo cambian estos números específicos, el servidor puede construir un perfil de lo que es el aprendizaje normal y honesto. Cuando un dispositivo envía de vuelta una actualización, el servidor compara su firma contra un historial de firmas de otros dispositivos. Si los cambios de un dispositivo se ven demasiado diferentes de la multitud, el sistema lo marca como sospechoso y lo aparta, evitando que la mala actualización se mezcle en el modelo final.
Los investigadores probaron este enfoque en tres tipos diferentes de modelos de lenguaje, que van desde aquellos que predicen la siguiente palabra en una oración hasta aquellos que completan palabras faltantes, y finalmente a modelos grandes similares a los que impulsan los chatbots modernos. Simularon un escenario donde hasta el cuarenta por ciento de los dispositivos participantes eran maliciosos, intentando deliberadamente corromper el modelo enseñándole asociaciones incorrectas entre palabras. En estas condiciones difíciles, el nuevo sistema filtró con éxito las actualizaciones dañinas. Los modelos entrenados con esta protección funcionaron significamente mejor que aquellos entrenados con métodos de seguridad existentes. Específicamente, los modelos protegidos cometieron menos errores al predecir la siguiente palabra, mostrando una reducción de la confusión de hasta un dieciocho por ciento en comparación con el siguiente mejor método. También mostraron menos incertidumbre en sus elecciones, lo que significa que eran menos propensos a producir oraciones confusas o sin sentido.
Lo que hace que este descubrimiento sea particularmente útil es que no requiere que el servidor central tenga una lista de actores maliciosos conocidos, ni necesita un detector separado y preentrenado para atrapar a los mentirosos. El sistema aprende qué es lo normal simplemente observando al grupo de dispositivos a lo largo del tiempo. Espera hasta haber visto suficientes dispositivos diferentes para construir una imagen confiable de un comportamiento honesto, y luego comienza el filtrado. Los investigadores encontraron que cuanto más observaba el sistema a los dispositivos antes de comenzar el filtrado, mejor funcionaba, aunque aún podía trabajar eficazmente con una visión parcial del grupo. Crucialmente, esta protección ocurre enteramente en el lado del servidor; los dispositivos que envían las actualizaciones no necesitan cambiar su software ni enviar información adicional, lo que hace que el método sea fácil de añadir a los sistemas existentes sin ralentizarlos.
El estudio confirma que es posible asegurar el aprendizaje federado sin sacrificar la privacidad ni requerir datos de confianza. Al centrarse en una firma compacta y consciente de la arquitectura en lugar de en todo el modelo, los investigadores crearon un escudo ligero que detiene la manipulación maliciosa antes de que se propague. En sus simulaciones, este enfoque superó consistentemente a otras seis técnicas de seguridad comunes a través de diferentes distribuciones de datos y tipos de modelos. Los resultados sugieren que, al monitorear los sutiles cambios internos de un modelo, podemos mantener la integridad del aprendizaje colaborativo incluso cuando una gran parte de los participantes intenta engañar al sistema. Esto ofrece un camino práctico para construir inteligencia artificial más confiable que pueda aprender de datos privados sin ser fácilmente engañada por actores maliciosos.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.