← Últimos artículos
💻 computer science

Detection of the Malicious URL Using the Language Models

Este artículo propone el uso de modelos de lenguaje, particularmente BERT, para capturar el significado semántico de las frases en URLs maliciosas, logrando una mejora significativa en la precisión de la clasificación multiclase de hasta el 99.7% en comparación con los métodos tradicionales que dependen únicamente de características léxicas y estadísticas.

Autores originales: Samira Shirmohammadi, Amir Jalaly Bidgoly, Sanaz Allami Farsi, Faezeh Alizadeh

Publicado 2026-08-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Samira Shirmohammadi, Amir Jalaly Bidgoly, Sanaz Allami Farsi, Faezeh Alizadeh

Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Internet se ha convertido en el sistema nervioso central de la vida moderna, una vasta red donde las organizaciones prestan servicios y las personas comparten información a través de direcciones web. Estas direcciones, conocidas como URLs, son las llaves que desbloquean páginas específicas en la web. Sin embargo, así como una llave física puede ser falsificada para abrir una puerta que no debería, un enlace digital puede ser diseñado para engañar. Las URLs maliciosas son estas llaves falsificadas; son enlaces diseñados para engañar a los usuarios para que visiten sitios que roban dinero, recolectan información privada o instalan software dañino en sus dispositivos. Aunque algunas amenazas son obvias, muchas son sutiles, y distinguir un enlace seguro de uno peligroso suele ser difícil para la persona promedio. Para protegerse contra estas trampas digitales, los expertos en seguridad han dependido durante mucho tiempo de listas de enlaces malos conocidos, pero estas listas solo pueden detener lo que ya han visto. Cuando aparece una amenaza nueva y no vista, las listas antiguas fallan. Esta limitación ha impulsado a los investigadores a buscar formas más inteligentes de identificar el peligro, yendo más allá de simples listas de verificación hacia sistemas que realmente puedan entender el significado detrás de una dirección web.

En un estudio reciente, investigadores de la Universidad de Qom y la Universidad Islámica de Azad abordaron este desafío enseñando a las computadoras a leer el significado de las palabras dentro de una dirección web, en lugar de solo contar sus caracteres. Durante años, los sistemas automatizados han intentado detectar enlaces maliciosos observando su forma y estructura: midiendo qué tan larga es la dirección, contando el número de símbolos o verificando si contiene cadenas de letras sospechosas. Estos métodos funcionan bien para muchos casos, pero pasan por alto el matiz del lenguaje. Un enlace malicioso puede usar palabras de apariencia inocente dispuestas de una manera que sugiere una estafa, de forma muy similar a un correo electrónico de phishing que utiliza un lenguaje cortés para pedir una contraseña. Los investigadores se dieron cuenta de que para atrapar estos trucos sofisticados, un sistema necesita entender la relación semántica entre las palabras, o cómo encajan entre sí para formar un significado específico. Para hacer esto, recurrieron a los modelos de lenguaje, que son programas informáticos avanzados entrenados en cantidades masas de texto para entender cómo las palabras se relacionan entre sí en el lenguaje humano.

El equipo probó cuatro tipos diferentes de estos modelos de lenguaje para ver cuál podía identificar mejor la intención detrás de una URL. Los dos primeros, Word2vec y GloVe, son sistemas que mapean las palabras en un espacio matemático basado en la frecuencia con la que aparecen cerca unas de otras en un texto. Son buenos para entender que palabras como "rey" y "reina" están relacionadas, pero tratan cada palabra de forma aislada, sin considerar el contexto completo de la oración. El tercer modelo, LASER, fue diseñado para manejar muchos idiomas diferentes a la vez, mapeando oraciones en un espacio compartido, aunque se enfoca en la oración como un todo en lugar de en los detalles finos de las palabras individuales. El modelo final, BERT, es una herramienta más reciente y poderosa que observa una palabra en el contexto de todas las palabras que la rodean, tanto antes como después de ella. Esto le permite captar las diferencias sutiles de significado que dependen de la disposición específica de una oración. Los investigadores aplicaron estos modelos a un conjunto de datos que contenía más de 114,000 direcciones web, las cuales incluían enlaces seguros así como aquellos diseñados para spam, phishing, malware y alteración de sitios web (defacement).

Para hacer que las direcciones web fueran legibles para estos modelos de lenguaje, los investigadores primero tuvieron que descomponerlas en piezas más pequeñas, un proceso llamado tokenización. Para los tres primeros modelos, eliminaron manualmente símbolos como barras diagonales y signos de interrogación, tratando las palabras restantes como los datos centrales. Para el modelo BERT, utilizaron una herramienta especializada que descompone automáticamente la dirección en subpalabras y símbolos, manteniendo la puntuación como parte del significado porque BERT está diseñado para entender cómo esos símbolos cambzan el contexto. Una vez procesadas las direcciones, los modelos generaron una representación numérica única para cada una, capturando su esencia semántica. Estas representaciones fueron luego introducidas en una red neuronal, un tipo de programa informático inspirado en el cerebro humano, que aprendió a reconocer patrones y asignar una etiqueta a cada URL, como "segura", "spam" o "phishing".

Los resultados del experimento mostraron un ganador claro. Si bien todos los modelos de lenguaje funcionaron mejor que muchos métodos previos que dependían solo de características estadísticas, el modelo BERT destacó significativamente. Logró una tasa de precisión del 99.71 por ciento, identificando correctamente la naturaleza de las direcciones web en casi todos los casos. Los otros modelos también funcionaron bien, con el modelo GloVe alcanzando un 98.94 por ciento y el modelo Word2vec alcanzando un 98.62 por ciento, pero no alcanzaron la precisión de BERT. Los investigadores señalaron que incluso el modelo con menor rendimiento en su estudio, LASER, superó a muchas técnicas existentes en el campo, logrando un 97.46 por ciento de precisión. Esto sugiere que el simple hecho de cambiar el enfoque de la estructura física de una URL al significado de sus palabras proporciona un impulso sustancial en la seguridad. El estudio demuestra que, al utilizar un modelo que entiende el contexto y las relaciones entre las palabras, las computadoras pueden volverse mucho más efectivas para detectar las sutiles pistas lingüísticas que indican un enlace malicioso.

Los investigadores concluyeron que su enfoque ofrece una solución robusta a un problema persistente en la seguridad informática. Al modelar el espacio semántico de las palabras encontradas en las direcciones web, pudieron capturar la intención detrás de un enlace de una manera que los métodos tradicionales no pudieron. El éxito del modelo BERT, en particular, resalta el valor de utilizar una comprensión del lenguaje profunda y consciente del contexto para detectar amenazas. Esto no significa que los métodos antiguos sean inútiles, sino que combinar los mismos con la capacidad de leer el "significado" de una URL crea una defensa mucho más fuerte. A medida que los cibercriminales continúan evolucionando sus tácticas, haciendo que sus enlaces maliciosos se parezcan cada vez más a los legítimos, la capacidad de entender el contexto de las palabras que utilizan se convertirá en una herramienta esencial para mantener seguro el internet. El estudio proporciona un camino claro a seguir, mostrando que el futuro de la detección de URLs reside en enseñar a las máquinas a leer entre líneas.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →