← Últimos artículos
💬 NLP

Approaches to Analysing Historical Newspapers Using LLMs

Este estudio combina métodos computacionales escalables, como el modelado de temas y el análisis de sentimientos con LLMs, con un enfoque cualitativo de análisis crítico del discurso para examinar la representación de identidades colectivas y orientaciones políticas en periódicos históricos eslovenos de principios del siglo XX.

Autores originales: Filip Dobranić, Tina Munda, Oliver Pejić, Vojko Gorjanc, Uroš Šmajdek, David Bordon, Jakob Lenardič, Tjaša Konovšek, Kristina Pahor de Maiti Tekavčič, Ciril Bohak, Darja Fišer

Publicado 2026-03-27
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Filip Dobranić, Tina Munda, Oliver Pejić, Vojko Gorjanc, Uroš Šmajdek, David Bordon, Jakob Lenardič, Tjaša Konovšek, Kristina Pahor de Maiti Tekavčič, Ciril Bohak, Darja Fišer

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes una biblioteca gigante llena de periódicos viejos, escritos hace más de 100 años en Eslovenia. Estos periódicos, Slovenec y Slovenski narod, eran como dos canales de noticias rivales: uno era conservador y muy religioso, y el otro era liberal y progresista.

El problema es que hay demasiados periódicos (más de 14.000 ediciones) y están en un estado muy deteriorado. Si intentaras leerlos uno por uno con tus propios ojos, tardarías toda una vida. Además, como fueron escaneados hace mucho tiempo, el texto está lleno de "ruido" (letras borrosas o mal reconocidas, como si alguien hubiera intentado leer un periódico bajo la lluvia).

Aquí es donde entran los Inteligencias Artificiales (IA) y los investigadores de este estudio. Su misión fue usar una "lupa digital" superpotente para entender qué pensaba la gente de esa época sobre quiénes eran y quiénes eran sus enemigos, sin tener que leer cada palabra manualmente.

Aquí te explico cómo lo hicieron, usando analogías sencillas:

1. El Mapa del Tesoro (Modelado de Temas)

Primero, usaron una IA llamada BERTopic para leer millones de párrafos y agruparlos por temas, como si ordenaran una biblioteca desordenada.

  • La analogía: Imagina que tienes una pila de cartas mezcladas. En lugar de leerlas una por una, usas un robot que las agrupa automáticamente: "Aquí están todas las cartas sobre la salud", "Aquí las sobre la política", "Aquí las sobre la religión".
  • El resultado: Descubrieron que ambos periódicos hablaban de cosas similares (salud, países, religión), pero con un "tono" muy diferente, como dos personas hablando del mismo clima pero una quejándose del frío y la otra celebrando la nieve.

2. El Traductor de Sentimientos (Análisis de Sentimiento con IA)

Este fue el paso más difícil. Querían saber: ¿Cómo trataban estos periódicos a los "alemanes", a los "eslovenos" o a los "húngaros"? ¿Con amor, con odio o con indiferencia?

  • El desafío: Las IAs modernas suelen entrenarse con textos limpios y modernos (como tweets o noticias de hoy). Pero estos periódicos tienen errores de escaneo y palabras antiguas. Era como pedirle a un experto en español moderno que lea un texto escrito en caligrafía medieval con tinta borrada.
  • La solución: Probaron cuatro "cerebros" de IA diferentes. El ganador fue un modelo llamado GaMS3, que había sido adaptado específicamente para el idioma esloveno.
  • La limitación: El modelo era un genio para detectar la indiferencia (cuando algo se menciona sin emociones), pero a veces se confundía entre el amor y el odio. Era como un detective que es muy bueno diciendo "este sospechoso no hizo nada", pero a veces confunde un abrazo con un empujón.

3. El Mapa de Conexiones (Gráficos de Entidades)

Para visualizar todo esto, crearon un mapa gigante de puntos y líneas.

  • La analogía: Imagina un tablero de conspiración con fotos de personas y lugares conectados por hilos rojos.
    • Los puntos eran: Países, ciudades, grupos de gente (ej. "los alemanes") y el sentimiento (positivo/negativo).
    • Los hilos mostraban qué aparecía junto a qué.
  • Lo que descubrieron:
    • En el periódico conservador (Slovenec), los "alemanes" aparecían conectados con hilos rojos muy gruesos (odio/conflicto), mientras que los "croatas" tenían hilos verdes (hermanos).
    • En el periódico liberal (Slovenski narod), la red era más diversa, pero también mostraba tensiones.
    • Grupos como "los alemanes" aparecían casi siempre en contextos de conflicto, mientras que grupos regionales vagos (como "gente del Mediterráneo") aparecían en contextos neutros y descriptivos.

4. La Mezcla de lo Humano y lo Digital

Lo más importante del estudio no fue solo que la IA funcionara, sino cómo la usaron.

  • No se confiaron ciegamente en la máquina. Usaron la IA para encontrar los patrones grandes (el "distant reading" o lectura a distancia) y luego los investigadores humanos leyeron los textos específicos para entender el contexto real (la "lectura cercana").
  • La analogía: La IA es como un dron que toma fotos aéreas de una ciudad y te dice: "Aquí hay mucho tráfico y aquí hay un parque". Pero los investigadores son los que bajan del dron, caminan por la calle y entienden por qué hay tráfico o qué se celebra en el parque.

Conclusión: ¿Qué aprendimos?

Este estudio nos dice que podemos usar la tecnología moderna para "resucitar" la voz de periódicos antiguos y entender cómo se construía la identidad nacional hace un siglo.

  • Nos mostró que la política de la época estaba muy polarizada: los eslovenos se veían a sí mismos en contraste con sus vecinos (alemanes, italianos, húngaros).
  • Nos enseñó que la IA es una herramienta increíblemente útil, pero no es perfecta. Necesitamos a los humanos para interpretar los matices, especialmente cuando la IA se equivoca entre el "sí" y el "no".

En resumen, fue como usar un microscopio de alta tecnología para examinar el ADN de la historia eslovena, revelando cómo se sentían las personas de esa época sobre quiénes eran y quiénes eran sus "otros".

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →