← Últimos artículos
💻 computer science

A Comparison of Traditional Machine Learning Algorithms and LSTM-Based Deep Learning Models for Email Sentiment Analysis

Este estudio compara los algoritmos tradicionales de aprendizaje automático y los modelos de aprendizaje profundo basados en LSTM para el análisis de sentimientos en correos electrónicos, encontrando que, aunque LSTM ofrece una alta recuperación para la detección de spam, las máquinas de vectores de soporte con núcleos lineales logran el equilibrio óptimo entre alta precisión (98,74%) y eficiencia de procesamiento.

Autores originales: Virdio Samuel Saragih, Baruna Abirawa, Kartini Lovian Simbolon, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

Publicado 2026-05-06
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Virdio Samuel Saragih, Baruna Abirawa, Kartini Lovian Simbolon, Luluk Muthoharoh, Ardika Satria, Martin C. T. Manullang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres el gerente de una oficina ocupada donde llegan miles de correos electrónicos cada día. Tu trabajo es clasificarlos en dos pilas: "Ham" (mensajes reales e importantes de amigos y colegas) y "Spam" (basura molesta, estafas y malware). Hacer esto a mano es imposible, así que contratas a cuatro "asistentes digitales" diferentes para que hagan la clasificación por ti.

Este documento es un boletín de calificaciones que compara qué tan bien desempeñaron estos cuatro asistentes el trabajo.

Los Cuatro Asistentes

  1. Los Tres Asistentes "Tradicionales" (Aprendizaje Automático):

    • SVM (Máquina de Vectores de Soporte): Imagina a este asistente como un bibliotecario de ojos agudos. Examina las palabras de un correo electrónico e intenta trazar una línea perfecta en la arena para separar los libros "buenos" de los "malos". Es conocido por ser muy preciso y rápido.
    • Regresión Logística: Esto es como un estadístico que calcula las probabilidades. Examina las palabras y dice: "Basado en los números, hay un 90% de probabilidad de que esto sea spam". Es confiable, pero puede ser un poco más lento al procesar los números.
    • Naive Bayes: Este asistente es un adivinador rápido. Asume que cada palabra en un correo electrónico actúa de forma independiente (como lanzar dados). Es muy rápido, pero a veces comete errores porque no analiza cómo funcionan las palabras juntas en una oración.
  2. El Asistente de "Aprendizaje Profundo" (LSTM):

    • LSTM (Memoria a Corto y Largo Plazo): Este es un detective superinteligente con una gran memoria. A diferencia de los otros, que solo miran palabras individuales, este detective recuerda el orden de las palabras y cómo se relacionan entre sí a lo largo del tiempo. Es como leer una historia completa para entender el contexto, en lugar de solo escanear una lista de palabras clave. Sin embargo, este detective tarda mucho en pensar y necesita mucha energía (potencia de cómputo) para hacer el trabajo.

El Campo de Entrenamiento (El Conjunto de Datos)

Para poner a prueba a estos asistentes, los investigadores les entregaron una pila gigante de 2.620 correos electrónicos escritos en indonesio.

  • La Limpieza: Antes de que los asistentes pudieran leer, los investigadores limpiaron los correos electrónicos. Eliminaron enlaces, direcciones de correo electrónico y palabras aburridas como "y" o "el" que no ayudan a distinguir el spam del correo real.
  • La Traducción: Convirtieron las palabras en números (utilizando algo llamado Word2Vec). Imagina convertir cada palabra en una coordenada específica en un mapa. Las palabras con significados similares terminan cerca unas de otras en este mapa.

Los Resultados de la Carrera

Los asistentes fueron probados con un nuevo lote de correos electrónicos que nunca habían visto antes para ver quién era el mejor.

1. El Ganador: El Bibliotecario de Ojos Agudos (SVM)

  • Rendimiento: El asistente SVM fue el campeón indiscutible. Clasificó correctamente el 98,74% de los correos electrónicos.
  • Velocidad: Terminó el trabajo en menos de un segundo (0,9 segundos).
  • Por qué ganó: Los investigadores descubrieron que, cuando conviertes las palabras en esas "coordenadas de mapa" (Word2Vec), la capacidad del SVM para trazar una línea recta entre correos buenos y malos funcionó perfectamente. No necesitó pensarlo demasiado; simplemente vio el patrón con claridad.

2. El Subcampeón: El Estadístico (Regresión Logística)

  • Rendimiento: También lo hizo muy bien, obteniendo aproximadamente 97,5% de aciertos.
  • Velocidad: Fue más lento, tardando unos 2,7 segundos. Fue un sólido segundo lugar, pero no pudo superar la combinación de velocidad y precisión del bibliotecario.

3. El Tercer Lugar: El Adivinador Rápido (Naive Bayes)

  • Rendimiento: Obtuvo aproximadamente 94,5% de aciertos.
  • Por qué perdió: Luchó un poco con las "coordenadas de mapa" que utilizaron los investigadores. Fue demasiado simple para este tipo específico de datos.

4. El Pensador Profundo (LSTM)

  • Rendimiento: El detective superinteligente hizo un gran trabajo, obteniendo 97% de aciertos. Fue particularmente bueno detectando spam (casi no se le escapó ninguno), lo cual es excelente para la seguridad.
  • El Problema: Tardó significativamente más en entrenarse y ejecutarse que los asistentes tradicionales. Es como tener a un genio que resuelve el rompecabezas perfectamente pero tarda 30 minutos en hacerlo, mientras que el bibliotecario lo resuelve en un segundo.

El Veredicto Final

El documento concluye que, para esta tarea específica —clasificar correos electrónicos utilizando estos "mapas de palabras" específicos—, no necesitas al detective supercomplejo y lento.

El SVM (el bibliotecario de ojos agudos) ofreció el mejor equilibrio. Fue increíblemente preciso (casi perfecto) y extremadamente rápido. Aunque el detective de aprendizaje profundo (LSTM) fue impresionante y tenía una gran memoria, el método tradicional fue simplemente más eficiente para este trabajo.

En resumen: Si quieres construir un sistema para filtrar correos electrónicos de forma rápida y precisa, el método antiguo y rápido (SVM) es actualmente la mejor herramienta para el trabajo, superando a los modelos de aprendizaje profundo elegantes y lentos en este escenario específico.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →