← 최신 논문
💬 NLP

From Entity Mentions to Tone: An LLM-Based Pipeline for Media Bias Analysis

이 논문은 기사를 주제별로 그룹화하고, 개체와 감성을 주석 처리하며, 소스 간의 보도 패턴을 비교함으로써 온라인 뉴스에서 미디어 편향성과 프레이밍을 분석하기 위한 LLM 기반 파이프라인을 제시하며, 전문적인 도구가 제한적인 알바니아 뉴스 데이터셋에 대한 효과성을 입증한다.

원저자: Klesti Hoxha, Olti Qirici

게시일 2026-08-19
📖 4 분 읽기☕ 가벼운 읽기

원저자: Klesti Hoxha, Olti Qirici

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

현대 사회에서 우리가 읽는 뉴스는 결코 중립적인 사실의 흐름으로 도착하는 경우가 드뭅니다. 대신, 뉴스는 편집자의 선택과 우리가 무엇을 볼지 결정하는 알고리즘을 통해 필터링됩니다. 이러한 필터는 게이트키퍼 역할을 하며, 어떤 이야기가 우리에게 도달할지, 그리고 그 이야기가 어떻게 프레임화될지를 결정합니다. 정치적 사건에 관한 이야기는 한 매체에서는 승리로 묘사될 수 있고, 다른 매체에서는 실패로 묘사될 수 있는데, 이는 사실이 변했기 때문이 아니라 어조와 초점이 바뀌었기 때문입니다. 미디어 편향이라고 알려진 이 현상은 언어의 미묘한 변화, 특정 세부 사항의 선택, 그리고 서로 다른 인물과 사건에 부여되는 정서적 무게감을 포함하기 때문에 대규모로 추적하기가 어렵습니다. 수십 년 동안 이러한 패턴을 이해하려면 인간 전문가 팀이 기사를 하나하나 읽고 분석해야 했으며, 이는 인터넷의 속도를 따라잡을 수 없는 느리고 비용이 많이 드는 과정이었습니다.

연구자들은 이러한 문제를 해결하기 위해 인공지능을 활용하기 시작했으며, 이러한 미묘한 편향을 탐지하는 것을 자동화하기를 희망하고 있습니다. 그러나 많은 지역에서 중요한 장애물이 남아 있습니다. 대부분의 고급 언어 도구는 영어와 같은 주요 언어를 기반으로 구축되어 있어, 규모가 작은 언어들은 자신의 뉴스를 분석할 신뢰할 만한 소프트웨어가 없는 실정입니다. 이러한 지역에서는 전문화된 도구가 부족하여, 특정 사건을 어떤 뉴스 소스가 다루었는지, 혹은 서로 다른 매체가 동일한 공인(public figure)을 어떻게 묘사했는지와 같은 기본적인 질문조차 일관되게 답하기 어렵습니다. 이러한 도구가 없다면 정보가 어떻게 형성되고 유통되는지에 대한 전체적인 그림을 파악하기 어렵습니다.

알바니아 티라나 대학교의 연구팀은 이 격차를 메우기 위한 새로운 접근 방식을 개발했습니다. 그들은 디지털 도구가 매우 적은 언어인 알바니아어로 작성된 수천 건의 뉴스 기사를 읽기 위해 강력하고 범용적인 언어 모델을 사용하는 시스템을 만들었습니다. 이 시스템은 단순히 텍-스트를 읽는 것에 그치지 않고, 이를 세 가지 뚜да한 분석 계층으로 분해합니다. 첫째, 기사들을 주제와 특정 사건별로 그룹화하여 어떤 이야기가 전달되고 있는지 확인합니다. 둘째, 해당 이야기에서 언급된 인물과 조직의 이름을 식별합니다. 셋째, 아마도 가장 중요한 단계로서, 글의 정서적 어조를 측정하여 특정 인물이나 사건에 대한 보도가 긍정적인지, 부정적인지, 혹은 중립적인지를 판별합니다. 이 계층들을 결합함으로써, 이 파이프라인은 뉴스 소스가 무엇을 다루기로 선택했을 뿐만 아니라, 그 이야기 속에 등장하는 인물들을 어떻게 묘사하는지까지 지도화할 수 있습니다.

시스템을 테스트하기 위해, 연구진은 2026년 4월에 발행된 124개의 다양한 알바니아 뉴스 소스로부터 수집된 8,358개의 뉴스 기사 모음을 확보했습니다. 그들은 이 기사들을 자신들의 파이프라인에 입력했으며, 이 파이프라인은 뉴스 데이터를 추출하기 위해 고급 언어 모델의 로컬 버전을 사용했습니다. 목표는 이 자동화된 방법이 대규모의 기존 인간 라벨링 예시 데이터베이스 없이도 신뢰할 수 있는 결과를 생성할 수 있는지 확인하는 것이었습니다. 연구진은 자신들의 시스템 출력을 자동화된 도구를 사용하여 뉴스를 추적하는 대규모 글로벌 데이터베이스인 GDELT의 주석(annotations)과 비교했습니다. 비교 결과, 두 시스템 사이에 중간 정도의 일치도가 나타났으며, 이는 새로운 파이프라인이 기존의 확립된 방식과 유사한 방향으로 작동하고 있음을 시사했습니다. 더 중요한 점은, 연구진의 시스템이 GDELT 시스템이 놓친 많은 인물 언급을 식별해냈다는 것입니다. 이러한 추가적인 이름을 포착하는 능력은 편향 분석에 있어 매우 중요한데, 왜냐하면 공인을 놓치게 되면 그 인물을 대하는 서로 다른 매체의 태도를 이해하는 데 왜곡이 생길 수 있기 때문입니다 p.

또한 연구는 언어 모델에 주어지는 두 가지 서로 다른 지침, 즉 프롬프트를 테스트하여 어떤 것이 더 잘 작동하는지 확인했습니다. 한 세트의 지침은 엄격하여, 모델이 자신이 부여한 정서적 라벨이 할당된 수치 점수와 일치하는지 스스로 재검토하도록 요구했습니다. 다른 세트는 더 단순하고 빨랐습니다. 엄격한 지침은 라벨과 점수 사이의 불일치를 제거했지만, 프로세스를 상당히 느리게 만들었고 시스템이 처리하는 기사의 거의 절반을 건너뛰게 만들었습니다. 단순한 지침은 약간의 불일치를 발생시키긴 했지만, 시스템이 훨씬 더 많은 양의 뉴스 컬렉션을 분석할 수 있게 해주었고 훨씬 빠르게 실행되었습니다. 연구진은 뉴스를 지속적으로 모니터링하기 위해 설계된 시스템의 경우, 몇 가지 불일치는 나중에 간단한 규칙으로 정리할 수 있으므로 더 빠르고 광범위한 접근 방식이 더 실용적이라는 결론을 내렸습니다.

이 파이프라인에서 생성된 데이터를 사용하여, 연구진은 서로 다른 뉴스 소스들이 어떻게 운영되는지에 대한 상세한 프로필을 생성할 수 있었습니다. 그들은 일부 매체가 일관되게 더 우호적인 어조로 주제를 프레임화하는 반면, 다른 매체들은 체계적으로 더 비판적이라는 것을 발견했습니다. 또한 시스템은 특정 공인을 추적하여, 동일한 인물이 한 신문에서는 긍정적인 어조로, 다른 신문에서는 부정적인 어조로 묘사될 수 있음을 보여주었습니다. 예를 들어, 분석 결과 특정 정치 인물에 대한 보도는 소스에 따라 크게 달랐으며, 어떤 매체는 거의 전적으로 긍정적인 보도를 제공하는 반면 다른 매체는 압도적으로 비판적이었습니다. 또한, 시스템은 '게이트키핑' 사건, 즉 소수의 소스에 의해서만 다뤄지고 나머지 미디어 환경에서는 무시된 이야기를 식별할 수 있었습니다. 이를 통해 연구진은 뉴스의 어조뿐만 아니라 특정 이야기의 도달 범위와 정보가 어디에 집중되거나 차단되는지도 볼 수 있었습니다.

이 연구는 특화된 언어별 학습 데이터 없이도 저자원 언어(low-resource languages)에서 미디어 편향을 분석하기 위한 구조화되고 자동화된 시스템을 구축하는 것이 가능하다는 것을 입증합니다. 연구진은 이 도구가 인간의 판단이나 전문가의 검토를 대체하기 위한 것이 아니라, 빠른 시작점 역할을 하기 위해 만들어졌음을 강조합니다. 이는 방대한 양의 기사 모음을 더 쉽게 검사할 수 있는 명확한 신호로 변환해 줍니다. 이름, 주제, 어조의 초기 추출을 자동화함으로써, 이 시스템은 인간이 처음부터 읽어야 하는 자료의 양을 줄여줍니다. 이는 지속적인 모니터링이 어렵고 특화된 언어 도구가 부족한 환경에서 특히 가치가 있습니다. 연구진은 이 접근 방식이 다른 언어와 지역에도 적용할 수 있는 재현 가능한 청사진을 제공하며, 뉴스가 어떻게 프레임화되고 공적 담론에서 누가 목소리를 내고 있는지를 시각화하는 방법을 제시한다고 제안합니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →