← Últimos artículos
🤖 AI

You Have Been LaTeXpOsEd: A Systematic Analysis of Information Leakage in Preprint Archives Using Large Language Models

Este artículo presenta "LaTeXpOsEd", una auditoría de seguridad sistemática a gran escala de más de 100.000 envíos a arXiv que revela una filtración generalizada de información en archivos fuente y comentarios, incluidas credenciales sensibles, información de identificación personal y comunicaciones confidenciales, mediante el aprovechamiento de un marco novedoso que integra la coincidencia de patrones y los modelos de lenguaje grandes.

Autores originales: Richard A. Dubniczky, Bertalan Borsos, Tamas Bisztray, Norbert Tihanyi

Publicado 2026-05-12
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Richard A. Dubniczky, Bertalan Borsos, Tamas Bisztray, Norbert Tihanyi

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás presentando un manuscrito a una biblioteca prestigiosa (como arXiv) para compartir tu último descubrimiento científico. Entregas el libro final, pulido (el PDF), que todos pueden leer. Pero, como la biblioteca quiere asegurar que tu trabajo sea honesto y reproducible, también te piden que entregues tu taller completo: los borradores, las notas adhesivas en las paredes, los bocetos a medio terminar y las anotaciones que garabateaste en los márgenes mientras pensabas en voz alta.

El artículo "You Have Been LaTeXpOsEd" es una auditoría de seguridad masiva de este taller. Los investigadores descubrieron que, aunque los científicos son muy cuidadosos con lo que incluyen en el libro final, a menudo olvidan limpiar su taller antes de entregarlo.

Aquí tienes un desglose sencillo de lo que encontraron, utilizando analogías cotidianas:

1. El problema del "Ático Digital"

Cuando los científicos suben sus artículos, no solo suben el PDF final. Suben los archivos fuente de LaTeX. Piensa en estos archivos fuente como un ático digital o un garaje.

  • El error: Los autores a menudo dejan "notas adhesivas" (comentarios en el código) o "cajas viejas" (archivos no utilizados) en este ático.
  • El riesgo: Estas notas podrían decir cosas como: "Oye, la contraseña de nuestro servidor interno es 'Password123'" o "Tuvimos una gran pelea con el revisor, aquí están los correos electrónicos enfadados".
  • La realidad: Como el ático es público, cualquiera puede entrar y leer estas notas. Los investigadores trataron esto como una auditoría "pasiva": simplemente miraron lo que ya estaba allí, como un guardia de seguridad recorriendo una casa abierta, sin intentar forzar la entrada ni probar si las cerraduras funcionaban realmente.

2. Las herramientas del detective: Expresiones regulares vs. el "Superlector"

Para encontrar estos secretos, los investigadores utilizaron dos tipos de detectives:

  • El coincidente de patrones (Regex): Es como un robot que solo busca formas específicas. Puede encontrar fácilmente cosas que parecen una dirección de correo electrónico (nombre@dominio.com) o una dirección IP (192.168.1.1). Es bueno para encontrar pistas obvias, pero malo para entender el contexto.
  • El "Superlector" (Modelos de Lenguaje Grandes - LLM): Es como un detective humano altamente inteligente que puede leer una oración y entender el significado.
    • Ejemplo: Un coincidente de patrones podría pasar por alto una oración que dice: "Estoy usando la clave 'SecretKey99' para iniciar sesión en el laboratorio" porque no parece un formato de contraseña estándar.
    • El LLM, sin embargo, lee toda la oración, entiende que "SecretKey99" es un secreto y lo marca.

Los investigadores probaron 25 "Superlectores" diferentes (modelos de IA) para ver cuál era el mejor detective. Descubrieron que los modelos de código abierto (como Qwen-2.5) eran casi tan buenos como los propietarios y costosos, pero a una fracción del precio.

3. ¿Qué encontraron en el ático?

Después de escanear 100.000 artículos (aproximadamente 1,2 terabytes de datos, lo que equivale a una biblioteca masiva), encontraron miles de "filtraciones". Esto es lo que se dejó atrás:

  • Las llaves de la "puerta abierta": Cientos de instancias de contraseñas reales, claves de API y credenciales de inicio de sesión. Es como si alguien hubiera dejado su llave de casa pegada con cinta en la puerta delantera con una nota que dice: "Esto abre la puerta trasera".
  • Las filtraciones de la "charla privada": Enlaces a carpetas privadas de Google Drive o Dropbox configuradas como "Cualquiera con el enlace puede editar". Esto significaba que las revisiones por pares confidenciales, las discusiones internas entre coautores y los datos no publicados eran visibles para todo el mundo.
  • Las discusiones de "nota adhesiva": Comentarios donde los autores discutían sobre la calidad de la investigación o se quejaban de los revisores. Estos estaban destinados solo a ojos internos, pero se publicaron para que todos los vieran.
  • Las "fotos ocultas": Las imágenes subidas al artículo a menudo contenían datos EXIF (metadatos digitales). Esto es como una foto de un edificio que incluye secretamente las coordenadas GPS de la casa del fotógrafo y la hora exacta en que se tomó la foto.

4. El costo de la investigación

Uno de los hallazgos más sorprendentes fue lo barato que fue hacerlo.

  • Los investigadores gastaron un total de aproximadamente 90 dólares para escanear 100.000 artículos.
  • Esto incluyó el costo de descargar los datos y pagar a la IA para que leyera los comentarios.
  • La analogía: Es como contratar a un equipo de seguridad para revisar 100.000 casas por unos pocos dólares. Esto significa que incluso un actor malicioso de "bajos recursos" (alguien con un presupuesto pequeño) podría hacerlo fácilmente para robar secretos o causar daño reputacional.

5. El "juego de la culpa" (¿Quién es responsable?)

El artículo señala una situación legal complicada.

  • La regla de la biblioteca: Cuando presentas algo a arXiv, firmas un contrato que dice: "Concedo a la biblioteca el derecho de distribuir mi trabajo para siempre". La biblioteca también dice: "Es tu trabajo asegurarte de no incluir información privada".
  • El problema: Los autores a menudo piensan: "Puse el secreto en los comentarios del código; nadie lee el código, solo el PDF". No se dan cuenta de que los "comentarios del código" son parte del registro público permanente.
  • El veredicto: Los investigadores argumentan que, aunque los autores son técnicamente responsables de la limpieza, el sistema está roto porque es demasiado fácil dejar secretos atrás por accidente, y la biblioteca no los elimina automáticamente.

6. La solución: Limpiar el taller

El artículo sugiere dos soluciones principales:

  1. Para los autores: Antes de pulsar "Enviar", ejecuta una herramienta de "limpieza" (como una aspiradora digital) que elimine automáticamente todos los comentarios, archivos no utilizados y metadatos ocultos. ¡No dejes notas adhesivas en el ático!
  2. Para la biblioteca (arXiv): Deberían añadir una red de seguridad. Antes de que un artículo se publique, el sistema debería escanear automáticamente en busca de contraseñas y enlaces privados, y advertir al autor: "Oye, dejaste una contraseña en tus notas. ¿Realmente quieres publicar esto?"

Resumen

El artículo es una llamada de atención. Muestra que, en la prisa por compartir la ciencia rápidamente, los investigadores están dejando accidentalmente su "basura digital" (secretos, contraseñas y discusiones privadas) al aire libre. Dado que la IA moderna es tan buena leyendo y entendiendo estas notas desordenadas, ahora es increíblemente fácil para cualquiera encontrarlas. Los investigadores instan a la comunidad científica a comenzar a limpiar sus archivos fuente antes de publicar, tal como limpiarían un laboratorio físico antes de abrir las puertas al público.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →