Security Document Classification with a Fine-Tuned Local Large Language Model: Benchmark Data and an Open-Source System
Este artículo presenta TorchSight, un sistema local de código abierto que utiliza un modelo Qwen 3.5 27B ajustado finamente y entrenado con más de 78 000 muestras, el cual logra una precisión significativamente mayor (95,0 %) en la clasificación de documentos de seguridad en comparación con las alternativas comerciales basadas en la nube, al tiempo que garantiza que los datos permanezcan bajo control local.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El Gran Problema: La "Nube" frente a la "Sala Segura"
Imagina que trabajas para un banco o un hospital. Tienes miles de documentos y necesitas encontrar aquellos que contienen contraseñas secretas, números de tarjetas de crédito o planes militares clasificados.
Actualmente, las empresas tienen dos formas principales de hacer esto:
- El Método del "Libro de Reglas": Utilizan un programa informático que busca patrones específicos, como una cadena de números que parezca una tarjeta de crédito. Es rápido, pero es tonto. Si escribes una historia sobre un número de tarjeta de crédito falso en un tutorial, el programa grita "¡ALERTA!" aunque sea seguro. Se pierde cosas que no parecen patrones pero que siguen siendo peligrosas.
- El Método de la "Nube": Envían todos sus documentos a una IA gigante y inteligente en la nube (como un asistente superinteligente en una gran empresa tecnológica) para que los lea. Esta IA es muy inteligente y entiende el contexto. Pero, para usarla, tienes que enviar tus documentos secretos fuera de tu edificio hacia el edificio de otra persona. Para un banco o el ejército, esto es un riesgo enorme. No pueden permitir que sus secretos salgan del edificio.
La Solución del Documento: El autor construyó un sistema llamado TorchSight. Es como contratar a un guardia de seguridad superinteligente que vive dentro de tu edificio. Este guardia es lo suficientemente inteligente como para entender el contexto (a diferencia del libro de reglas) pero nunca sale del edificio (a diferencia del servicio en la nube).
El "Guardia" (El Modelo de IA)
El autor tomó un cerebro de IA muy grande y preentrenado (llamado Qwen 3.5) y le dio un "campamento de entrenamiento" especial.
- El Entrenamiento: No solo le mostraron documentos aleatorios. Le alimentaron 78.358 ejemplos de documentos. Algunos eran filtraciones reales, otros eran ejemplos falsos creados por otra IA, y algunos eran "trampas" truculentas (documentos que parecían peligrosos pero que en realidad eran seguros, o viceversa).
- El Resultado: Esto creó una versión especializada de la IA llamada Beam. Aprendió a distinguir entre un secreto real y un ejemplo inofensivo, algo con lo que el "Libro de Reglas" e incluso las IAs de la "Nube" tenían dificultades.
La Gran Prueba: ¿Quién es el Mejor Guardia?
El autor puso al nuevo guardia Beam contra los mejores guardias de "Nube" (como GPT-5, Claude y Gemini) y los viejos guardias del "Libro de Reglas". Les dio a todos los mismos 1.000 documentos para clasificar.
Los Resultados:
- Los Guardias de la Nube: Acertaron aproximadamente entre el 75% y el 80%. Estaban bien, pero cometieron muchos errores.
- El Libro de Reglas: Solo acertó aproximadamente el 53%. Era demasiado fácil confundirlo.
- El Guardia Beam (Local): Acertó el 95%.
El Problema de la "Falsa Alarma":
La parte más importante de un sistema de seguridad no es solo atrapar a los malos, sino no gritar "¡Fuego!" cuando alguien solo está sosteniendo una vela.
- Cuando los guardias de la Nube miraron documentos seguros (como una receta de cocina o un artículo de noticias público), a menudo entraron en pánico. Pensaron que entre el 22% y el 63% de los documentos seguros eran peligrosos. Esto volvería loca a un equipo de seguridad porque tendrían que revisar cada archivo seguro individualmente.
- Beam solo entró en pánico con el 2% de los documentos seguros. Conoció la diferencia entre una amenaza real y un archivo inofensivo mucho mejor que los demás.
¿Por Qué fue Beam Tan Bueno?
El documento explica que el secreto no fue solo el tamaño de la IA, sino cómo fue enseñada.
- El autor creó un "conjunto de reglas" específico (una taxonomía) con 51 tipos diferentes de secretos (como "Historias Clínicas", "Planes Militares", "Contraseñas").
- A las IAs de la Nube se les dijo que "encontraran secretos", pero inventaron sus propias categorías o se confundieron.
- Beam fue ajustado finamente para seguir estrictamente las 51 categorías. Aprendió a hablar el mismo idioma que el equipo de seguridad. Fue como enseñar a un perro a sentarse, quedarse quieto y traer objetos específicos, en lugar de simplemente decirle "sé bueno".
La Prueba del "Mundo Exterior"
Para asegurarse de que Beam no solo estaba memorizando la prueba de práctica, el autor lo probó con un conjunto completamente diferente de 500 documentos que nunca había visto antes (como correos electrónicos de phishing reales y registros médicos de bases de datos públicas).
- Beam aún obtuvo una puntuación del 93,8%.
- Las IAs de la Nube bajaron significativamente, con algunas puntuando tan bajo como el 65%.
- Esto demuestra que Beam realmente aprendió el concepto de seguridad, no solo las respuestas específicas de la prueba de práctica.
La Conclusión
El documento muestra que no necesitas enviar tus secretos a la nube para que una IA inteligente los proteja. Entrenando una IA local en un conjunto de datos masivo y cuidadosamente seleccionado, puedes obtener un sistema que es:
- Más Preciso: Encuentra más amenazas reales.
- Menos Molesto: Hace muchas menos falsas alarmas en archivos seguros.
- Privado: Los documentos nunca salen de tu computadora.
El autor liberó todo el sistema (el código, los datos de entrenamiento y el modelo de IA) gratis para que cualquiera pueda usarlo para construir su propio guardia de seguridad de "Sala Segura".
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.