← Últimos artículos
💻 computer science

So Many Opinions, So Many LLMs: Comparing Large Language Models to Traditional Machine Learning for Open- Ended Survey Analysis

Este estudio compara los modelos de lenguaje de gran tamaño (LLM) con el aprendizaje automático tradicional para analizar respuestas de encuestas abiertas, encontrando que, si bien los LLM logran una precisión de clasificación superior al comprender temas y sentimientos complejos, presentan compensaciones significativas en cuanto a la consistencia y la explicabilidad de su razonamiento.

Autores originales: Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

Publicado 2026-07-15
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Abdullah Akinde, Mariam Akinde, Rasheedat Emiola, Ahmed Akinsola

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una caja gigante con miles de cartas de estudiantes, todas escritas con su propia letra desordenada y emocional. Algunas son felices, otras están enojadas, algunas son sarcásticas y otras simplemente están confundidas. ¿Tu trabajo? Leer cada una de ellas y clasificarlas en seis cubos de emociones: Alegría, Sorpresa, Amor, Ira, Tristeza y Miedo.

Durante mucho tiempo, los investigadores intentaron hacer esto con programas de computadora de la "Vieja Escuela". Piensa en estos programas como un bibliotecario muy estricto que solo sabe contar palabras específicas. Si el bibliotecario ve la palabra "genial", le pega una etiqueta de "Alegría" a la carta. Si ve "malo", le pega una etiqueta de "Tristeza". Es rápido y puedes ver exactamente por qué el bibliotecario tomó esa decisión. Pero aquí está el problema: estos bibliotecarios son fáciles de engañar. Se pierden el sarcasmo, el agotamiento oculto detrás de un "gracias", o las sutiles pistas de que un estudiante está en realidad furioso aunque haya usado palabras educadas.

En este estudio, los investigadores decidieron probar un nuevo equipo de ayudantes: Modelos de Lenguaje de Gran Escala (LLM, por sus siglas en inglés). Puedes pensar en estos como robots superinteligentes y muy cultos que han leído casi todo en internet. A diferencia de los bibliotecarios estrictos, estos robots intentan entender la vibra y el contexto de la oración, no solo las palabras individuales.

El Gran Enfrentamiento

Los investigadores enfrentaron a estos dos equipos usando datos reales de encuestas estudiantiles de 2019 y 2021 (293 cartas de 2021 y 142 de 2019). No les enseñaron nada nuevo a los robots; simplemente les pidieron que clasificaran las cartas usando una instrucción simple, un método llamado "zero-shot prompting".

Lo que hicieron los viejos bibliotecarios
Los modelos de computadora tradicionales (como los Clasificadores de Vectores de Soporte y los Bosques Aleatorios) estuvieron bien clasificando las cartas cuando fueron entrenados con un conjunto específico de ejemplos. Obtuvieron aproximadamente un 90% de precisión en sus pruebas de práctica. Pero cuando se enfrentaron a las cartas reales y desordenadas de los estudiantes, empezaron a actuar de forma un poco loca.

  • En el lote de 2019, un modelo decidió que el 99.3% de las cartas eran de "Alegría". ¡Básicamente ignoró todas las demás emociones!
  • En el lote de 2021, los modelos no se ponían de acuerdo de forma estrepitosa. Uno pensaba que una carta era "Amor", mientras que otro pensaba que era "Tristeza".
  • Los investigadores descubrieron que estos viejos modelos eran demasiado sensibles a palabras específicas (como "genial" o "bueno") y no podían manejar el lado humano y complicado del lenguaje. Eran frágiles, lo que significa que si los datos cambiaban incluso un poco, su clasificación se desmoronaba.

Lo que hicieron los nuevos robots
El equipo de LLM (incluyendo GPT-4-Turbo, Claude 3.5, LLaMA 3 de Meta y Perplexity Sonar Pro) hizo algo diferente. No solo contaron palabras; intentaron entender el sentimiento.

  • Coincidieron entre sí: Cuando los cuatro robots miraron el mismo montón de cartas, la mayoría las clasificaron de la misma manera. Por ejemplo, en los datos de 2021, los cuatro robots coincidieron exactamente en cuántas cartas eran de "Ira" (46 cartas).
  • Manejaron el matiz: Fueron mucho mejores para detectar emociones complejas, como cuando un estudiante es sarcástico o cuando su "gracias" está en realidad cargado de agotamiento.
  • Los Números: Aunque el artículo no da una "puntuación de precisión" única para los robots (porque no hay una clave de respuestas humana con la cual compararlos), su consistencia sugiere que son mucho más confiables para este tipo de datos desordenados del mundo real que los modelos antiguos.

El Problema
Los robots no son magos perfectos. Los investigadores señalan algunas cosas a las que hay que prestar atención:

  • El error del "Amor": Los cuatro robots parecieron clasificar más cartas como "Amor" que como "Alegría". Los investigadores sospechan que esto se debe a que los robots aprendieron de las redes sociales, donde la gente dice "¡Amo esta clase!" para significar "Me gusta mucho", no que tengan sentimientos románticos profundos.
  • La Caja Negra: A diferencia de los viejos bibliotecarios, no siempre puedes ver por qué el robot tomó una decisión. Es más difícil auditar su trabajo.
  • Costo y Actualizaciones: Estos robots son caros de ejecutar, y las empresas que los fabrican los actualizan con frecuencia. Si ejecutas el mismo prompt el próximo año, el robot podría dar una respuesta ligeramente diferente porque es una "nueva versión".

El Veredicto
El estudio sugiere que si quieres analizar miles de respuestas abiertas de estudiantes, los nuevos robots de IA son la mejor herramienta. Son mucho mejores para entender el lado complejo y humano del lenguaje y son más consistentes a través de diferentes grupos de estudiantes.

Sin embargo, los investigadores no dicen que este sea un problema "resuelto". Sugieren que para decisiones de alto riesgo (como cambiar las políticas escolares), el mejor enfoque es un trabajo en equipo: dejar que los robots hagan el trabajo pesado para clasificar las cartas, pero tener humanos que revisen el trabajo para asegurarse de que los robots no estén siendo engañados por el sarcasmo o el sesgo. Es una nueva forma poderosa de escuchar a los estudiantes, pero todavía necesita una mano humana al volante.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →