← Últimos artículos
💬 NLP

From Entity Mentions to Tone: An LLM-Based Pipeline for Media Bias Analysis

Este artículo presenta un flujo de trabajo basado en LLM para analizar el sesgo y el encuadre mediático en noticias en línea mediante la agrupación de artículos en temas, la anotación de entidades y sentimiento, y la comparación de patrones de cobertura entre fuentes, demostrando su eficacia en un conjunto de datos de artículos de noticias albaneses donde las herramientas especializadas son limitadas.

Autores originales: Klesti Hoxha, Olti Qirici

Publicado 2026-08-19
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Klesti Hoxha, Olti Qirici

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo moderno, las noticias que leemos rara vez llegan como un flujo neutral de hechos. En su lugar, son filtradas a través de las decisiones de los editores y los algoritmos que deciden qué vemos. Estos filtros actúan como porteros, determinando qué historias llegan a nosotros y cómo se presentan. Una historia sobre un evento político puede ser presentada como un triunfo por un medio y como un fracaso por otro, no porque los hechos hayan cambiado, sino porque el tono y el enfoque se desplazaron. Este fenómeno, conocido como sesgo mediático, es difícil de rastrear a gran escala porque implica cambios sutiles en el lenguaje, la selección de detalles específicos y el peso emocional asignado a diferentes personas y eventos. Durante décadas, comprender estos patrones requirió equipos de expertos humanos para leer y analizar artículos uno por uno, un proceso lento y costoso que no podía seguir el ritmo de la velocidad de Internet.

Los investigadores han comenzado a recurrir a la inteligencia artificial para resolver este problema, con la esperanza de automatizar la detección de estos sesgos sutiles. Sin embargo, un obstáculo significativo permanece para muchas partes del mundo: la mayoría de las herramientas de lenguaje avanzadas están construidas para idiomas principales como el inglés, dejando a los idiomas más pequeños sin software confiable para analizar sus propias noticias. En estas regiones, la falta de herramientas especializadas significa que incluso las preguntas básicas —como qué fuentes de noticias cubrieron un evento específico o cómo diferentes medios describieron a una misma figura pública— siguen siendo difíciles de responder de manera consistente. Sin estas herramientas, es difícil ver el panorama completo de cómo la información está siendo moldeada y distribuida.

Un equipo de investigadores de la Universidad de Tirana en Albania ha desarrollado un nuevo enfoque para cerrar esta brecha. Crearon un sistema que utiliza un modelo de lenguaje potente y de propósito general para leer miles de artículos de noticias escritos en albanés, un idioma con muy pocas herramientas digitales dedicadas. El sistema no solo lee el texto; lo descompone en tres capas distintas de análisis. Primero, agrupa los artículos en temas y eventos específicos para ver qué historias se están contando. Segundo, identifica los nombres de las personas y organizaciones mencionadas en esas historias. Tercero, y quizás lo más importante, mide el tono emocional de la escritura, determinando si la cobertura de una persona o evento es positiva, negativa o neutral. Al combinar estas capas, el flujo de trabajo puede mapear no solo qué elige cubrir una fuente de noticias, sino también cómo describe a las personas involucradas en esas historias.

Para probar su sistema, los investigadores reunieron una colección de 8.358 artículos de noticias de 124 fuentes de noticias albanesas diferentes, publicados en abril de 2026. Introdujeron estos artículos en su flujo de trabajo, que utilizó una versión local de un modelo de lenguaje avanzado para extraer los datos necesarios. El objetivo era ver si este método automatizado podía producir resultados fiables sin necesidad de una base de datos masiva y preexistente de ejemplos etiquetados por humanos. Los investigadores compararon la salida de su sistema con las anotaciones proporcionadas por GDELT, una gran base de datos global que también utiliza herramientas automatizadas para rastrear noticias. La comparación reveló un nivel moderado de acuerdo entre los dos sistemas, lo que sugiere que el nuevo flujo de trabajo estaba trabajando en una dirección similar a los métodos establecidos. Más importante aún, los investigadores descubrieron que su sistema identificó muchas menciones de personas que el sistema GDELT había pasado por alto. Esta capacidad de captar nombres adicionales es crucial para el análisis de sesgos, porque omitir a una figura pública puede distorsionar la comprensión de cómo los diferentes medios tratan a esa persona.

El estudio también probó dos conjuntos diferentes de instrucciones, o prompts, dados al modelo de lenguaje para ver cuál funcionaría mejor. Un conjunto de instrucciones era estricto, requiriendo que el modelo doble la verificación de su propio trabajo para asegurar que las etiquetas emocionales que asignaba coincidieran con las puntuaciones numéricas que otorgaba. El otro era más simple y rápido. Las instrucciones estrictas sí eliminaron las inconsistencias entre etiquetas y puntuaciones, pero también ralentizaron el proceso significativamente y causaron que el sistema omitiera el etiquetado de casi la mitad de los artículos procesados. Las instrucciones más simples, aunque produjeron algunas inconsistencias más, permitieron que el sistema analizara una porción mucho mayor de la colección de noticias y funcionara mucho más rápido. Los investigadores concluyeron que, para un sistema diseñado para monitorear las noticias de forma continua, el enfoque más amplio y rápido era más práctico, ya que las pocas inconsistencias podían limpiarse más tarde con reglas simples.

Utilizando los datos generados por este flujo de trabajo, los investigadores pudieron crear perfiles detallados de cómo operan las diferentes fuentes de noticias. Encontraron que algunos medios enmarcaban consistentemente los temas con un tono más favorable, mientras que otros eran sistemáticamente más críticos. El sistema también pudo rastrear figuras públicas específicas, mostrando cómo la misma persona podría ser descrita con un tono positivo en un periódico y con un tono negativo en otro. Por ejemplo, el análisis mostró que la cobertura de ciertas figuras políticas variaba ampliamente según la fuente, con algunos medios ofreciendo una cobertura casi totalmente positiva mientras que otros eran predominantemente críticos. Además, el sistema pudo identificar eventos de "gatekeeping" (control de acceso): historias que fueron cubiertas por un pequeño grupo de fuentes mientras eran ignoradas por el resto del panorama mediático. Esto permitió a los investigadores ver no solo el tono de las noticias, sino también el alcance de historias específicas y dónde se estaba concentrando o reteniendo la información.

El trabajo demuestra que es posible construir un sistema automatizado y estructurado para analizar el sesgo mediático en lenguas de bajos recursos sin necesidad de datos de entrenamiento especializados y específicos del idioma. Los investigadores enfatizan que su herramienta no pretende reemplazar el juicio humano o la revisión experta, sino actuar como un punto de partida rápido. Convierte una colección masiva de artículos en señales claras que pueden ser inspeccionadas más fácilmente. Al automatizar la extracción inicial de nombres, temas y tonos, el sistema reduce la cantidad de material que los humanos deben leer desde cero. Esto es particularmente valioso en entornos donde el monitoreo continuo es difícil y donde las herramientas lingüísticas especializadas son escasas. Los investigadores sugieren que este enfoque proporciona un plano reproducible que puede aplicarse a otros idiomas y regiones, ofreciendo una forma de visualizar cómo se enmarca la noticia y quién está siendo escuchado en la conversación pública.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →