LLMs for Survey Text Analysis – A Performance Comparison Between Humans and GPT-5 on Inductive Content Analysis
Este estudio demuestra que GPT-5.4 puede aproximarse al desempeño humano en el análisis de contenido inductivo de datos de encuestas, logrando niveles de acuerdo en la codificación y generación de temas comparables a la consistencia interna humana, validando así su potencial como una herramienta de apoyo escalable para la investigación cualitativa.
Artículo original bajo licencia CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La investigación cualitativa es el arte de dar sentido a las palabras. Cuando los científicos, sociólogos o responsables de políticas necesitan comprender los pensamientos, sentimientos y experiencias de las personas, a menudo plantean preguntas abiertas. En lugar de marcar una casilla, una persona escribe un párrafo sobre su vida, sus luchas o sus esperanzas. Para convertir miles de estos párrafos en conocimiento útil, los investigadores deben leer cada uno de ellos, encontrar las ideas que se repiten y agruparlas en categorías. Este proceso, conocido como análisis de contenido, es la columna vertebral para comprender el comportamiento humano, pero es increíblemente lento y exigente. Durante décadas, la única forma de hacerlo fue con mentes humanas, leyendo línea por línea. Ahora, un nuevo tipo de herramienta ha entrado en la sala: los modelos de lenguaje extensos. Estos son sistemas de inteligencia artificial entrenados en vastas cantidades de texto que pueden leer, comprender y resumir el lenguaje. La gran pregunta para la comunidad científica no es solo si estas máquinas pueden leer, sino si pueden pensar como un investigador humano cuando la tarea requiere encontrar patrones ocultos sin un libro de reglas preescrito.
Un equipo de investigadores de universidades de toda Europa se propuso responder a esta pregunta con una comparación directa. Tomaron un conjunto de datos del mundo real de una encuesta realizada a 2.800 estudiantes de doctorado en toda Europa, donde se seleccionó aleatoriamente el 10% de las respuestas para servir como base de datos del estudio. De esta muestra, se analizaron en profundidad un total de 903 respuestas a través de seis preguntas abiertas específicas. Por un lado del experimento, cinco investigadores humanos leyeron estas respuestas y realizaron lo que se llama análisis de contenido inductivo. Esto significa que no comenzaron con una lista de categorías para forzar las respuestas dentro de ellas. En su lugar, leyeron el texto, identificaron las ideas centrales, crearon sus propios rótulos para esas ideas y luego agruparon esos rótulos en temas más amplios. Es un proceso creativo e interpretativo, que depende del juicio humano para decidir qué es importante. Por el otro lado, los investigadores utilizaron un sofisticado modelo de lenguaje para realizar exactamente la misma tarea sobre el mismo texto. A la máquina se le dieron las mismas instrucciones de leer las respuestas, encontrar las ideas principales y agruparlas en temas, todo ello sin que se le dijera de antemano qué buscar.
Los investigadores compararon entonces los dos conjuntos de resultados para ver qué tan cerca estaba la máquina de los humanos. No buscaban una coincidencia perfecta, porque incluso diferentes expertos humanos suelen discrepar sobre cómo etiquetar una oración específica. En su lugar, midieron la alineación general de los grupos. Los resultados mostraron un nivel moderado de acuerdo. Al observar los rótulos específicos que los investigadores y la máquina crearon para el texto, coincidieron el 61 por ciento de las veces. Al observar los temas más amplios que construyeron a partir de esos rótulos, el acuerdo fue ligeramente inferior, del 54 por ciento. Para poner esto en perspectiva, los investigadores también comprobaron cuánto coincidían los cinco expertos humanos entre sí. Los humanos coincidieron entre sí aproximadamente el 68 por ciento de las veces en los rótulos y los temas. Esto significa que la brecha entre el humano y la máquina no era grande; la máquina funcionó casi tan consistentemente como un experto humano con otro experto humano.
Sin embargo, la historia no es uniforme en todos los temas. El acuerdo entre los humanos y la máquina varió significamente dependiendo de lo que los estudiantes estaban escribiendo. Para las preguntas relativas a situaciones financieras, la máquina tuvo más dificultades, mostrando una menor alineación con los investigadores humanos. Para las preguntas sobre experiencias personales o comentarios generales, la alineación fue mucho más fuerte. El estudio sugiere que la fiabilidad de la máquina depende en gran medida de la naturaleza de los datos y de la claridad del texto. Cuando el texto era ambiguo o la lógica interna de la agrupación de la propia máquina era inestable, el acuerdo con los humanos disminuía. Los investigadores descubrieron que siempre que la máquina era inconsistente consigo misma, también era inconsistente con los humanos, y lo mismo ocurría con el equipo humano. Esto indica que la dificultad del tema específico juega un papel importante en el funcionamiento de la herramienta.
También se pidió a los codificadores humanos que participaron en el estudio sus impresiones sobre el trabajo de la máquina. Informaron que las categorizaciones de la máquina reflejaban su propio pensamiento y que confiarían en la herramienta para ayudar a analizar datos futuros. Los investigadores concluyeron que estos sistemas de inteligencia artificial no están listos para reemplazar totalmente el juicio humano, especialmente para el trabajo complejo y de alto nivel de construcción de teorías. Sin embargo, los hallazgos sugieren que estas herramientas son altamente efectivas para manejar las etapas iniciales y laboriosas de clasificación de textos. Pueden realizar el trabajo pesado de leer miles de respuestas y encontrar los patrones iniciales, permitiendo que los investigadores humanos se concentren en la interpretación más profunda y la validación de esos patrones. El estudio no afirma que la máquina sea perfecta o que haya resuelto el problema del análisis de texto, pero sí sugiere que es un socio poderoso y escalable para los investigadores que necesitan dar sentido a grandes volúmenes de historias humanas.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.