BERTopic-Virality Prioritisation: A Scalable Framework for Thematic and Comparative Analysis of COVID-19 and Monkeypox Misinformation on Twitter
이 논문은 서로 다른 팬데믹 전반에 걸쳐 영향력이 큰 건강 관련 허위 정보 내러티브의 조기 식별 및 비교 분석을 가능하게 하기 위해, 맥락적 임베딩 클러스터링을 바이럴리티 우선순위 지정 계층 및 하이브리드 허위 정보 탐지기와 통합한 확장 가능한 프레임워크인 BERTopic-VP를 소개한다.
원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기
새로운 질병이 출현할 때, 세상은 두 가지 동시다발적인 위기에 직면합니다. 바이러스 그 자체와 그와 함께 퍼져나가는 거짓 정보의 범람입니다. 흔히 인포데믹(infodemic)이라 불리는 이 두 번째 위기는 생물학적 위기만큼이나 위험할 수 있습니다. 메시지가 짧고 빛의 속도로 이동하는 트위터와 같은 소셜 미디어 플랫폼에서는 치료법, 기원, 안전 조치에 관한 가짜 이야기가 공식적인 보건 지침보다 더 빠르게 확산될 수 있습니다. 이러한 이야기들을 추적하기 위한 전통적인 방식들은 특정 단어가 얼마나 자주 등장하는지를 세는 방식에 의존하기 때문에 실패하는 경우가 많습니다. 속어, 해시태그, 이모티콘을 사용하는 소셜 미디어의 혼란스럽고 급변하는 언어 체계 속에서 단순한 단어 계산 방식은 무너집니다. 이 방식은 게시물의 더 깊은 의미를 파악하지 못해 서로 관련 없는 아이디어들을 하나로 묶거나, 새로운 위험한 루머가 이미 너무 널리 퍼질 때까지 이를 포착하지 못합니다.
이를 해결하기 위해 맨체스터 메트로폴리탄 대학교(Manchester Metropolitan University)의 연구진은 디지털 소음 속에서 귀를 기울일 수 있는 새로운 방법을 개발했습니다. 그들은 단순히 단어를 세는 것이 아니라 그 뒤에 숨겨진 의미를 이해하면서, 동시에 이야기가 얼마나 빠르게 퍼지고 있는지에도 주목하는 시스템을 만들었습니다. 그들의 목표는 공중 보건 관계자들이 거짓 정보가 막 순환하기 시작하는 시점에 가장 위험한 거짓말을 포착할 수 있도록 돕는 도구를 구축하는 것이었습니다. 언어에 대한 깊은 이해와 게시물이 얼마나 많이 공유되는지에 대한 척도를 결합함으로써, 그들은 트윗 묶음들을 걸러내어 공중 보건에 가장 큰 위험을 초래하는 구체적인 내러티브를 찾아낼 수 있는 프레임워크를 만들어냈습니다.
연구진은 이 새로운 시스템에 BERTopic-VP라는 이름을 붙이고, 이를 신종 코로나바이러스로 인한 글로벌 팬데믹과 2022년 원숭이두창(monkeypox) 발생이라는 두 가지 주요 보건 위기의 실제 데이터에 적용했습니다. 그들은 이 사건들과 관련된 트윗들을 10,000개에서 100,000개 단위의 묶음으로 나누어 시스템에 입력했습니다. 시스템은 특정 키워드를 찾는 대신, 실제 의미를 바탕으로 트윗들을 클러스터(군집)로 그룹화했습니다. 시스템은 고급 언어 모델을 사용하여 서로 다른 내용을 말하는 두 게시물이 어떻게 정부에 대한 불신이나 백신에 대한 공포와 같이 동일한 핵심 아이디어를 다룰 수 있는지 이해했습니다. 이야기가 그룹화되면, 시스템은 두 번째 분석 단계로 각 이야기가 얼마나 많은 참여를 이끌어냈는지 살펴보았습니다. 시스템은 각 그룹 내의 게시물들이 얼마나 많은 좋아요, 공유, 답글을 받았는지 계산했습니다. 이를 통해 시스템은 이야기를 순위 매길 수 있었으며, 단순히 인기 있는 것을 넘어 실제로 활발하게 퍼지고 있는 이야기를 강조해 냈습니다.
결과는 이 두 가지 발병 사례에서 오정보(misinformation)가 어떻게 다르게 행동하는지를 극명하게 보여주었습니다. 코로나바이러스 팬데emic 기간 동안의 가짜 이야기들은 매우 다양하고 복잡했습니다. 바이러스의 기원에 대한 음모론부터 마스크 효능 및 봉쇄 정책에 대한 논쟁에 이르기까지 광범적인 주제를 다루었습니다. 이 게시물들에 사용된 언어는 종종 밀도가 높고 읽기 어려웠으며, 신뢰성을 높이기 위해 전문가의 어조를 흉내 냈습니다. 반면, 원숭이두창 발생과 관련된 오정보는 훨씬 더 집중되어 있었습니다. 가짜 내러티브는 백신 배분의 실패나 보건 당국에 대한 깊은 불신과 같은 몇 가지 특정 주제에 집중되었습니다. 이러한 이야기들은 언어적으로 더 단순하고 읽기 쉬웠으며, 특히 공포와 분노라는 강력한 정서적 자극을 담고 있었습니다.
연구 결과, 이 시스템은 자신의 임무를 효과적으로 수행하는 것으로 나타났습니다. 시스템은 높은 바이럴 잠재력을 가진 오정보 클러스터를 성공적으로 식별해 냈으며, 가장 활발하게 퍼지는 상위 1%의 이야기를 인간의 검토 대상으로 분류했습니다. 실제 공유 숫자를 확인할 수 있었던 원숭이두창 데이터의 경우, 시스템은 의미론적으로 해석 가능한 주제를 생성하고 관찰된 참여도를 바탕으로 가장 활발한 그룹을 식별해 냈습니다. 공유 숫자를 사용할 수 없었던 코로나바이러스 데이터의 경우, 시스템은 영리한 우회 방법을 사용했습니다. 즉, 원숭이두창 데이터로부터 어떤 언어적, 심리학적 특징이 높은 공유를 이끌어내는지 학습한 다음, 그 지식을 적용하여 어떤 코로나바이러스 이야기가 퍼질 가능성이 높은지 예측했습니다. 이를 통해 시스템은 직접적인 공유 수치에 접근할 수 없는 상황에서도 위험한 내러티브의 우선순위를 정할 수 있었습니다.
결정적으로, 연구진은 이야기의 확산 능력이 반드시 그것이 참인지 거짓인지와 연결되지는 않는다는 점을 보여주었습니다. 시스템은 뉴스 업데이트나 공식 보건 지침과 같이 실제로 사실인 매우 바이럴한 게시물 그룹들을 많이 찾아냈습니다. 이것이 바로 시스템이 두 단계로 작동하도록 설계된 이유입니다. 첫째, 가장 빠르게 퍼지고 있는 이야기를 찾고, 둘째, 별도의 검증을 통해 그 이야기들이 사실인지 판단합니다. 이러한 결합을 통해 공중 보건 관계자들은 모든 거짓 주장을 반박하거나 빠르게 퍼지는 사실들을 무시하는 데 시간을 허비하는 대신, 가장 큰 탄력을 받고 있는 특정 거짓 정보에 집중할 수 있습니다.
또한 본 연구는 이야기의 정서적 톤이 확산의 강력한 동력이라는 점을 강조했습니다. 가장 바이럴한 오정보는 종종 빠르게 이해하기 쉬운 단순한 언어와 함께 공포나 분노와 같은 강렬한 감정을 동반했습니다. 이는 쉽게 소화할 수 있고 사람들에게 강렬한 감정을 불러일으키는 거짓말이 공유될 가능성이 훨씬 높다는 것을 시사합니다. 이러한 패턴을 식별함으로써, 이 새로운 프레임워크는 공중 보건 팀이 디지털 환경을 모니터링할 수 있는 실질적인 방법을 제공합니다. 이는 일종의 조기 경보 시스템으로서, 광범위한 피해를 입히기 전에 즉각적인 주의가 필요한 구체적이고 고위험인 내러티브를 표면 위로 끌어올립니다. 이 연구는 단어의 의미와 그 단어가 이동하는 메커니즘을 모두 이해함으로써, 보건 비상사태 시 오정보의 위험으로부터 공동체를 더 잘 보호할 수 있음을 보여줍니다.
연구 분야의 논문에 파묻히고 계신가요?
연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.