Challenges in annotations by humans and LLMs: A case study of evaluative language
Este artículo compara las anotaciones humanas y de modelos de lenguaje de gran tamaño (LLM) del lenguaje evaluativo en transcripciones de charlas TED utilizando la teoría de la Evaluación (Appraisal theory), encontrando que los LLM superan tanto a lingüistas capacitados como a aprendices en tareas de anotación complejas, demostrando así su potencial para apoyar la investigación en humanidades digitales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Resumen Técnico: Desafíos en las anotaciones realizadas por humanos y LLM: Un estudio de caso sobre el lenguaje evaluativo
Planteamiento del problema
El artículo aborda la creciente complejidad de las tareas de anotación en las humanidades digitales y las ciencias sociales computacionales, centrándose específicamente en la identificación y clasificación del lenguaje evaluativo. Si bien los Modelos de Lenguaje de Gran Tamaño (LLM) han mostrado potencial en tareas de PLN no supervisadas, su capacidad para igualar o superar el rendimiento humano en marcos teóricos altamente subjetivos y complejos aún no ha sido verificada. El estudio se centra en la Teoría de la Valoración (Appraisal theory) (Martin & White, 2005), un modelo funcional para el lenguaje evaluativo, específicamente en su subsistema de Actitud (Afecto, Juicio, Apreciación). Los autores destacan que la anotación manual de estas categorías es lenta, propensa a una baja concordancia entre anotadores (IAA) y complicada por la dependencia del contexto, los significados implícitos y la dificultad de distinguir entre categorías sutiles. El problema central de investigación es determinar si los LLM encuentran los mismos desafíos que los anotadores humanos en estas tareas complejas y si pueden servir como herramientas efectivas para resolver tales dificultades de anotación.
Metodología
El estudio emplea un estudio de caso de métodos mixtos utilizando un corpus de 190 transcripciones de charlas TED en inglés (el corpus EmotionalizTED) a través de once dominios (p. ej., Ciencia, Política, Medicina). La metodología se divide en tres fases:
Anotación Humana:
- Anotadores: 24 estudiantes de lingüística en formación (no nativos de inglés, mayoritariamente alemanes) y un investigador sénior (que sirve como el estándar de oro o gold standard).
- Tarea: Clasificación a nivel de oración del contenido evaluativo. Los anotadores primero determinaron si una oración era evaluativa (binario) y luego la clasificaron en las categorías de Actitud: Afecto, Juicio, Apreciación, Ambiguo o Incierto. Se permitió la etiquetación múltiple.
- Evaluación: La concordancia entre anotadores (IAA) se midió mediante Kappa de Cohen (para la evaluatividad binaria) y alfa de Krippendorff (para la subclasificación multiclasificación). Se realizó un análisis de error cualitativo para identificar las fuentes de desacuerdo.
Anotación Automática (LLM):
- Ingeniería de Prompts: Se diseñaron y compararon tres variaciones distintas de prompts utilizando el modelo qwen3-30b-a3b-instruct-25075. Estas incluyeron enfoques de pocos disparos (few-shot) y de cero disparos (zero-shot), con variaciones en contexto, persona, restricciones y la inclusión de razonamiento de Cadena de Pensamiento (CoT).
- Selección y Ajuste del Modelo: El prompt con mejor rendimiento se aplicó a tres LLM diferentes. El modelo más efectivo fue posteriormente ajustado mediante QLoRA para optimizar el rendimiento.
- Proceso: Los LLM siguieron un proceso de dos pasos: (1) clasificación binaria de la evaluatividad, y (2) clasificación multiclasificación de las categorías de Actitud para las oraciones evaluativas.
Análisis Comparativo:
- El rendimiento del LLM ajustado se comparó contra el estándar de oro (investigador sénior) y los estudiantes anotadores.
- El estudio investigó específicamente si los LLM tenían dificultades con los mismos fenómenos lingüísticos específicos (p. ej., significado implícito, identificación del objetivo) que causaron la baja concordancia entre humanos.
Resultados Clave
- Rendimiento Humano: La concordancia entre anotadores entre los lingüistas estudiantes fue variable y a menudo baja. La concordancia en la decisión binaria de "evaluativo vs. no evaluativo" varió de ligera a moderada (Kappa 0.51 en algunos dominios como Entretenimiento y Política, pero cayendo significativamente en Historia y Psicología). La concordancia en las subclases específicas de Actitud (Afecto, Juicio, Apreciación) fue incluso menor, con un alfa de Krippendorff que frecuentemente caía por debajo de 0.50 y, en ocasiones, hacia valores negativos.
- Fuentes de Error Humano: El análisis cualitativo reveló que los desacuerdos humanos surgieron de:
- La dificultad para distinguir entre significados explícitos e implícitos.
- La confusión respecto al "objetivo de la evaluación" (p. ej., si una emoción pertenece al hablante o a un tercero mencionado).
- Desafíos con oraciones largas y complejas que contienen significados evaluativos anidados.
- Variaciones en la competencia en inglés y el conocimiento específico del dominio.
- Rendimiento de los LLM: El LLM ajustado alcanzó una puntuación F1 de 0.77 frente al estándar de oro.
- Comparación: El LLM superó a los anotadores estudiantes y, notablemente, logró una mayor concordancia con el investigador sénior (estándar de oro) que los estudiantes.
- Alineación de Desafíos: El estudio encontró que los LLM no necesariamente luchan con los mismos problemas específicos que los humanos de la misma manera; más bien, demostraron la capacidad de resolver tareas de clasificación complejas de forma más consistente que el grupo de humanos entrenados pero inexpertos.
Contribuciones Clave
- Esquema de Anotación: El artículo presenta un esquema de anotación específico para las categorías de Actitud de la Teoría de la Valoración adaptado para el análisis a nivel de oración en el discurso de la ciencia popular hablada.
- Comparación Empírica: Proporciona una comparación empírica directa entre anotadores humanos (tanto aprendices como expertos) y LLM en una tarea lingüística compleja y subjetiva.
- Optimización de Prompts: El estudio demuestra el impacto del diseño de prompts (incluyendo estrategias de CoT y few-shot) en el rendimiento de los LLM en la anotación pragmática.
Significancia y Reivindicaciones
Los autores afirman que los LLM pueden ayudar eficazmente en la resolución de tareas de anotación complejas, superando potencialmente el rendimiento de los lingüistas en formación en términos de consistencia y concordancia con los estándares expertos. El artículo sugiere que si los LLM pueden anotar con éxito teorías lingüísticas complejas como la Valoración mediante el uso de prompts y ajuste fino, esto abre nuevas vías para la investigación en humanidades digitales. Específicamente, implica que los corpus extensamente anotados manualmente pueden no ser siempre estrictamente necesarios para clasificar grandes porciones de datos de habla, siempre que los LLM sean guiados adecuadamente. El estudio concluye que los LLM ofrecen una estrategia viable para escalar los procesos de anotación en campos interdisciplinarios, aunque reconoce la necesidad de la validación del rendimiento del modelo tarea por tarea.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.