← Últimos artículos
🤖 machine learning

Leak It: A Probabilistic Approach to Training-Data Extraction from Black-Box Language Models

Este artículo sostiene que las métricas agregadas de inferencia de membresía, como el ROC-AUC, oscurecen el grave riesgo, dependiente de la capacidad, de la extracción de datos de entrenamiento verbatim de modelos de lenguaje de caja negra, demostrando que documentos específicos que contienen identificadores o código se filtran frecuentemente independientemente de los baselines ciegos o la deduplicación, y propone un marco de auditoría probabilística por documento a través de la herramienta "leakit" para medir con precisión este daño a la privacidad.

Autores originales: Victor Maricato

Publicado 2026-08-04
📖 4 min de lectura☕ Lectura para el café

Autores originales: Victor Maricato

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando averiguar si se utilizó una receta específica y secreta para hornear un pastel gigante y misterioso. No puedes ver la cocina y no puedes pedirle al panadero la lista de ingredientes. Todo lo que puedes hacer es pedirle al panadero que haga unas cuantas rebanadas más de pastel basándote en una pequeña migaja que encontraste antes. Si el panadero sigue escupiendo exactamente la misma lista de ingredientes secretos cada vez que se lo pides, podrías suponer que la receta secreta estaba, de hecho, en su memoria. Este es el mundo de los "Modelos de Lenguaje": programas informáticos superinteligentes que aprenden leyendo cantidades masivas de texto de internet. Son como esos panaderos, pero en lugar de pasteles, predicen la siguiente palabra en una oración.

La gran pregunta que se hacen los científicos es: ¿recuerdan estos panaderos digitales los libros específicos que "comieron"? Esto se llama "Inferencia de Membresía". Si un modelo recuerda un documento específico, podría filtrar accidentalmente detalles privados, como la dirección de correo electrónico o el número de teléfono de una persona que estaban ocultos dentro de ese documento. Durante mucho tiempo, los investigadores intentaron medir esto observando el rendimiento "promedio" de sus pruebas. Dirían: "¡Oye, nuestra prueba tiene un 90% de precisión!". Pero, al igual que un pronóstico del tiempo que dice que estará "mayormente soleado" pero no detecta una tormenta repentina y peligrosa, estos puntajes promedio pueden ocultar el hecho de que el modelo está filtrando secretos peligrosos para algunas personas con mala suerte.

Este artículo, titulado "LEAK IT", ofrece una nueva perspectiva sobre cómo detectar estas fugas digitales. El autor, liderado por Victor Maricato, sostiene que la forma antigua de medir la privacidad es engañosa. Descubrieron que muchas pruebas "inteligentes" que afirmaban detectar si un documento estaba en los datos de entrenamiento eran, en realidad, solo conjeturas basadas en el estilo del texto mismo, no en la memoria del modelo. Es como intentar adivinar si un pastel fue hecho con una receta secreta solo mirando el color del glaseado, cuando el color del glaseado es en realidad una simple coincidencia.

Sin embargo, el artículo revela una verdad más peligrosa: aunque la prueba "promedio" pueda parecer inofensiva, el modelo está filtrando información, pero solo para un grupo muy específico y pequeño de documentos. El investigador descubrió que si le pides al modelo que continúe una oración a partir de un fragmento de código o un documento que contiene una dirección de correo electrónico real, este a veces escupirá esa información privada exacta de forma literal. Es como si el panadero, al ser interrogado para terminar una frase sobre una especia rara y específica, de repente gritara la marca exacta y el número de lote de esa especia, a pesar de que no haría eso con un ingrediente común como la harina.

El estudio muestra que esta "extracción literal" empeora a medida que los modelos se vuelven más grandes. Para un modelo de 6.9 mil millones de parámetros, aproximadamente el 16.6% de los documentos que contenían identificadores reales (como correos electrónicos o números de teléfono) se filtraron de esta manera. Sorprendentemente, el autor encontró que el simple hecho de eliminar el texto duplicado de los datos de entrenamiento (un paso de seguridad común) no detuvo realmente esto. También demostraron que este riesgo no se distribuye de manera uniforme; es mucho mayor para el código de computadora que para historias o artículos regulares.

La conclusión principal es que debemos dejar de mirar el puntaje de privacidad "promedio" y empezar a buscar estas fugas específicas de alto riesgo. El autor lanzó una nueva herramienta llamada "leakit" para ayudar a los auditores a encontrar estos momentos exactos donde un modelo podría revelar accidentalmente un secreto privado. Sugieren que, en lugar de simplemente decir "el modelo es mayormente seguro", debemos admitir que, para ciertos documentos, el modelo es una fuga de memoria muy efectiva, y necesitamos protecciones más fuertes, como un escudo de privacidad especial llamado "privacidad diferencial", para solucionarlo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →