← Últimos artículos
💬 NLP

Quantifying the Sources of Instability in LLM-Based Stance Analysis of Public Discourse

Este estudio demuestra que, si bien las proporciones de sentimiento agregado en el análisis de postura basado en LLM del discurso público permanecen estables a través de diferentes procesos de preprocesamiento, las conclusiones específicas respecto al acoplamiento entre la valencia afectiva y la modalidad epistémica son altamente sensibles tanto a las variaciones del proceso para hablantes de baja muestra como, de manera más significativa, a los desacuerdos sistemáticos entre los métodos de medición de LLM y los de léxico de palabras clave.

Autores originales: Bo Chen

Publicado 2026-07-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Bo Chen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que eres un detective tratando de descubrir qué siente realmente una persona famosa y qué tan segura está de sus propias palabras. Tienes una pila gigante de entrevistas en video. Pero antes de que puedas comenzar tu investigación, tienes que pasar el video bruto por una máquina que hace tres cosas: escucha el audio, identifica quién está hablando (el invitado o el entrevistador) y corta el discurso en oraciones.

Este artículo plantea una pregunta simple pero complicada: ¿Cambia el veredicto final la forma en que configuras tu máquina?

Los investigadores, liderados por Bo Chen, organizaron un experimento masivo con 256 entrevistas de YouTube que presentan a 41 personas famosas de los ámbitos de las finanzas, la política y los medios de comunicación. Pasaron estos videos por dos "máquinas" diferentes (procesos de preprocesamiento) y luego utilizaron dos "detectives" diferentes (métodos de medición) para analizar el texto.

Las Dos Máquinas: El "Cortar y Pegar" vs. El "Oído de Audio"

Piensa en la primera máquina como un Detective Solo de Texto. Toma los subtítulos generados automáticamente por YouTube, los limpia e intenta adivinar quién está hablando basándose en las palabras. Es rápido, pero a veces se confunde por la forma desordenada en que se escriben los subtítulos de YouTube.

La segunda máquina es el Detective Solo de Audio. Escucha las ondas sonoras reales, identifica las voces y escribe lo que se dijo. Este es un enfoque más costoso y de alta tecnología.

Los investigadores querían ver si cambiar del Detective Solo de Texto al Detective Solo de Audio cambiaría la historia que se cuenta sobre los interlocutores.

Los Dos Detectives: El "Cerebro de IA" vs. La "Lista de Palabras"

Una vez que el texto estuvo listo, necesitaban medir dos cosas:

  1. Valencia: ¿Es el hablante feliz (positivo) o triste/enojado (negativo)?
  2. Modalidad: ¿Está el hablante siendo súper seguro (enfático) o inseguro (vacilante)?

Para medir esto, utilizaron dos herramientas diferentes:

  • El Cerebro de IA (LLM): Una inteligencia artificial poderosa que lee el texto y redacta un informe sobre los sentimientos y la confianza del hablante.
  • La Lista de Palabras (Léxico de Palabras Clave): Un libro de reglas rígido que simplemente cuenta cuántas veces aparecen palabras específicas de "enojo" o "confianza".

La Gran Sorpresa: La Máquina Importa Menos de lo que Piensas (Para Algunos)

Aquí está la primera vuelta de tuerca. Los investigadores descubrieron que cómo cortas el video importa mucho, pero solo si no tienes suficientes videos para empezar.

Si una persona famosa tiene solo un puñado minúsculo de videos (5 o menos), los resultados son un desastre total. Cambiar del Detective Solo de Texto al Detective Solo de Audio puede cambiar completamente los resultados, convirtiendo a un hablante "seguro" en uno "vacilante". Es como intentar adivinar el clima mirando una sola nube; es demasiado ruido.

Sin embargo, si un hablante tiene muchos videos (16 o más), la elección de la máquina apenas importa. Para las cuatro estrellas mejor muestreadas del estudio, cambiar la máquina solo cambió los resultados en una cantidad mínima (un cambio promedio de 0.13). La historia permaneció igual independientemente de qué máquina usaras.

El Verdadero Villano: La Elección del Detective

Aquí es donde la trama se complica. Si bien la máquina (preprocesamiento) no cambió mucho la historia para las estrellas bien muestreadas, el detective (método de medición) absolutamente lo hizo.

Los investigadores encontraron que el Cerebro de IA y la Lista de Palabras a menudo cuentan historias completamente opuestas sobre la misma persona, incluso cuando leen exactamente el mismo texto.

  • En casi el 49% de los casos, los dos detectives no estuvieron de acuerdo sobre si el hablante estaba siendo seguro o vacilante.
  • Para algunos hablantes muy famosos y bien muestreados (como el economista Ken Rogoff con 17 videos), la IA decía una cosa y la Lista de Palabras decía exactamente lo contrario.

Esto sugiere que la mayor fuente de inestabilidad no es cómo limpias los datos, sino qué herramienta eliges para analizarlo. Una herramienta puede ver a un hablante como "enojado y seguro", mientras que la otra lo ve como "calmado e inseguro".

La Ilusión de la Seguridad

Podrías pensar: "Bueno, ¿tal vez si miramos el promedio de todos, todo se equilibra?". Los investigadores lo comprobaron, y la respuesta es un rotundo no.

Descubrieron que si solo miras el porcentaje total de palabras negativas en todos los videos, los números parecen súper estables. No importa qué máquina o qué detective uses, el recuento total de "palabras malas" apenas se mueve (menos de 6 puntos porcentuales de cambio).

Pero esta estabilidad es una trampa. Oculta el hecho de que, para los hablantes individuales, las conclusiones son totalmente diferentes. Es como decir que un salón de clases es "promedio" porque el genio de las matemáticas y el estudiante que reprobó el examen se equilibran entre sí. Te pierdes el hecho de que un estudiante está luchando y el otro está prosperando.

La Conclusión

El artículo concluye con una advertencia para cualquiera que estudie el discurso público: No confíes en un solo setup.

  1. Verifica tu tamaño de muestra: Si solo tienes unos pocos videos, tus resultados probablemente sean poco fiables sin importar lo que hagas.
  2. No dependas de un solo detective: Si tu herramienta de IA y tu herramienta de conteo de palabras no están de acuerdo, aún no has encontrado la verdad. Necesitas ver si coinciden antes de publicar tus hallazgos.
  3. Separa el ruido: Tienes que averiguar si tus resultados están cambiando porque cambiaste la máquina (preprocesamiento) o porque cambiaste la herramienta (medición).

En resumen, la forma en que preparas tus datos importa, pero la herramienta que usas para medirlo importa aún más. Y si solo miras los grandes promedios, podrías perderte toda la historia.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →