← 최신 논문
💬 NLP

Approaches to Analysing Historical Newspapers Using LLMs

이 논문은 20 세기 초 슬로베니아 역사 신문인 'Slovenec'과'Slovenski narod'의 OCR 손상 텍스트를 분석하기 위해 토픽 모델링, 슬로베니아어 특화 LLM 을 활용한 감성 분석, 개체명 그래프 시각화 및 질적 담화 분석을 결합한 혼합 방법론을 제시하며, 이를 통해 집단 정체성과 정치적 이념의 표현 양상을 규명했습니다.

원저자: Filip Dobranić, Tina Munda, Oliver Pejić, Vojko Gorjanc, Uroš Šmajdek, David Bordon, Jakob Lenardič, Tjaša Konovšek, Kristina Pahor de Maiti Tekavčič, Ciril Bohak, Darja Fišer

게시일 2026-03-27
📖 3 분 읽기☕ 가벼운 읽기

원저자: Filip Dobranić, Tina Munda, Oliver Pejić, Vojko Gorjanc, Uroš Šmajdek, David Bordon, Jakob Lenardič, Tjaša Konovšek, Kristina Pahor de Maiti Tekavčič, Ciril Bohak, Darja Fišer

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

구석구석 숨겨진 이야기를 찾아낸 '디지털 탐정'들의 여정

19 세기 말 슬로베니아 신문을 AI 가 어떻게 읽었을까?

이 논문은 마치 오래된 도서관의 먼지 쌓인 신문 더미를 현대적인 'AI 탐정'들이 어떻게 분석했는지에 대한 이야기입니다. 연구자들은 19 세기 말 슬로베니아의 두 주요 신문 (가톨릭 성향의 와 진보 성향의 ) 을 비교하며, 당시 사람들이 '우리'와 '그들'을 어떻게 바라보았는지 찾아냈습니다.

이 복잡한 과정을 쉽게 이해할 수 있도록 네 가지 핵심 비유로 설명해 드리겠습니다.


1. 거대한 도서관과 '주제 지도' (Topic Modelling)

상상해 보세요. 두 개의 거대한 도서관이 있습니다. 하나는 보수적인 가톨릭 신자들이, 다른 하나는 자유주의 진보파들이 신문을 읽었습니다. 이 신문을 일일이 손으로 읽는다면 수백 년이 걸릴 것입니다.

연구자들은 BERTopic이라는 '지능형 지도 제작자'를 불렀습니다. 이 AI 는 수백만 개의 기사 조각을 뭉개서 주요 테마 지도를 그려냈습니다.

  • 결과: 두 신문 모두 '건강', '국가', '종교' 같은 큰 산맥이 있다는 것을 발견했습니다. 하지만 그 산맥의 색깔은 달랐습니다. 가톨릭 신보는 '종교와 교육'을 강조하는 반면, 진보 신보는 '국가와 정치'를 더 많이 다뤘습니다. 마치 같은 지형이라도 한쪽은 숲으로, 다른 쪽은 도시로 그려진 것과 같습니다.

2. 낡은 글자를 읽는 'AI 번역가'와 감정 분석 (Sentiment Analysis)

이 신문의 글자들은 오래되어 OCR(광학 문자 인식) 기술로 스캔하는 과정에서 글자가 깨지거나 지저분해졌습니다. 마치 흐릿하게 번진 잉크로 쓴 편지 같죠.

연구자들은 이 흐릿한 글자를 읽기 위해 최신 LLM(대형 언어 모델) 4 가지를 시험해 보았습니다. 그중 GaMS3라는 AI 가 가장 잘 읽었습니다.

  • 비유: 이 AI 는 신문에 등장하는 '사람들' (예: 독일인, 오스트리아인, 슬로베니아인) 을 보고 **"이 글에서 이 사람들을 어떻게 묘사했니?"**라고 물어보는 역할입니다.
    • 좋음 (+): "우리의 용감한 형제"
    • 나쁨 (-): "교활한 적"
    • 중립 (0): "독일에서 온 여행자"

하지만 AI 에는 약점이 있었습니다.

  • 중립은 잘 읽지만, 감정은 헷갈려 합니다. AI 는 "중립"이라고 말하는 것은 잘 알아내지만, "좋음"이나 "나쁨"을 구분하는 데는 조금 서툴렀습니다. 특히 '나쁨'을 너무 자주 찾아내고, '좋음'은 놓치는 경향이 있었습니다. 마치 과민반응을 하는 보안 요원처럼, 의심스러운 건 다 '나쁨'으로 잡아채는 셈입니다.

3. 관계의 지도를 그리는 '네트워크 분석' (Entity Graphs)

이제 연구자들은 AI 가 찾아낸 정보를 바탕으로 관계 지도를 그렸습니다.

  • 노드 (점): 주제, 사람 (집단), 장소, 감정.
  • 선 (연결): 이 단어들이 함께 등장한 횟수.

이 지도를 보니 신문의 성격이 확연히 드러났습니다.

  • (진보): 지도가 비교적 깔끔하고, 사람들이 '중립'으로 연결되어 있습니다.
  • (보수): 지도가 훨씬 복잡하고, 사람들이 '감정' (특히 부정적) 과 강하게 연결되어 있습니다. 마치 복잡한 도시의 교통망단순한 시골 길의 차이처럼요.

4. '우리'와 '그들'을 구분하는 이야기 (Discourse Analysis)

마지막으로 연구자들은 AI 가 찾아낸 패턴을 인간이 직접 읽어보며 (Close Reading) 의미를 해석했습니다.

  • 적 (The Other): 두 신문 모두 독일인을 가장 큰 '적'으로 묘사했습니다. 슬로베니아 민족주의가 독일 민족주의와 충돌했기 때문입니다.
  • 형제 (The Brother): 크로아티아인은 '형제'로 묘사되었습니다. "우리의 형제 크로아티아인도 발전하고 있다"는 식의 따뜻한 표현이 나왔습니다.
  • 중립의 영역: '지중해'나 '발트해' 같은 지역 이름은 감정 없이 단순히 정보로만 등장했습니다.

흥미로운 발견:

  • 부고 기사 (Obituaries): 신문에서 부고 기사는 슬로베니아인에게는 따뜻한 감정을, 독일인에게는 중립적인 감정을 보였습니다. 반면, 는 짧은 뉴스 (Short news) 형식으로 다양한 국가의 소식을 다뤘습니다.

💡 결론: 왜 이 연구가 중요한가요?

이 연구는 **"AI 는 완벽하지 않지만, 인간의 눈으로는 볼 수 없는 거대한 패턴을 찾아낼 수 있다"**는 것을 보여줍니다.

  1. 디지털 인문학의 새로운 도구: AI 가 흐릿한 옛 신문을 읽어내어, 당시의 정치적 갈등과 민족 의식을 '감정 지도'로 시각화했습니다.
  2. AI 의 한계 인정: AI 가 '중립'은 잘 구분하지만 '감정'은 헷갈릴 수 있음을 솔직하게 인정하고, 이를 보정하는 방법을 제시했습니다.
  3. 역사의 재해석: 단순히 "독일인이 싫었다"는 사실을 넘어, 어떤 맥락에서, 어떤 집단에게 감정이 표출되었는지를 세밀하게 보여줍니다.

한 줄 요약:

이 연구는 **AI 라는 '디지털 돋보기'**를 통해 100 년 전의 흐릿한 신문들을 다시 읽어내어, 당시 슬로베니아 사람들이 '우리'를 어떻게 사랑하고 '그들'을 어떻게 두려워했는지 그 감정의 지도를 그려낸 탐정 이야기입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →