← 최신 논문
💬 NLP

Like Article, Like Audience: Enforcing Multimodal Correlations for Disinformation Detection

이 논문은 예측 시에는 사용자 프로필에 의존하지 않으면서도 학습 과정에서는 사용자 프로필을 통해 모델 학습을 유도함으로써, 사용자 생성 콘텐츠와 공유된 뉴스 기사 간의 상관관계를 활용하여 허위 정보 탐지를 강화하는 멀티모달 학습 알고리즘을 제안한다.

원저자: Liesbeth Allein, Marie-Francine Moens, Domenico Perrotta

게시일 2026-08-14
📖 4 분 읽기☕ 가벼운 읽기

원저자: Liesbeth Allein, Marie-Francine Moens, Domenico Perrotta

원본 논문은 CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) 라이선스로 제공됩니다. 이것은 아래 논문에 대한 AI 생성 설명입니다. 저자가 작성하거나 승인한 것이 아닙니다. 기술적 정확성을 위해서는 원본 논문을 참조하세요. 전체 면책 조항 읽기

인터넷을 모두가 소리 높여 외치고, 공유하고, 논쟁하는 거대하고 북적이는 광장이라고 상상해 보십시오. 이 디지털 마을에서 '허위 정보(disinformation)'는 사람들을 속이거나 문제를 일으키기 위해 터무니없고 사실이 아닌 이야기를 퍼뜨리는 유언비어 유포 공장과 같습니다. 오랫동안 이러한 유언비를 막으려는 과학자들은 주로 단어 그 자체에 집중해 왔습니다. 즉, 뉴스 기사를 마치 철자 오류나 수상한 문구를 찾는 탐정이 종이 한 장을 조사하듯 검사해 온 것입니다. 하지만 이 논문은 종이 자체만을 보는 것만으로는 충분하지 않다고 제안합니다. 이 논문은 어떤 이야기를 이해하려면 그 이야기를 좋아하는 '군중'도 이해해야 한다고 제로합니다. 여기서 핵심 개념은 '멀티모달 학습(multimodal learning)'인데, 이는 단순히 다양한 유형의 단서들을 함께 살펴봐야 한다는 뜻입니다. 예를 들어, 기사의 텍스트와 그것을 공유하는 사람들의 텍스트를 함께 보는 식입니다. 핵심적인 질문은 간단합니다. 가짜 뉴스를 공유하는 사람들은 진짜 뉴스를 공유하는 사람들과 모습이나 목소리가 다를까요? 만약 컴퓨터가 이 연결 고리를 포착하도록 가르칠 수 있다면, 아마 거짓말쟁이를 더 빨리 찾아낼 수 있을 것입니다.

트위터 데이터를 활용해 작업한 이 논문의 저자들은, 단순히 헤드라인만 읽는 것이 아니라 그것을 들고 있는 사람들의 신분증까지 확인하는 똑똑한 컴퓨터 프로그램(탐정)을 만들기로 했습니다. 그들은 기사 자체와 그것을 공유한 사람들의 '사용자 생성 콘텐츠(user-generated content)'라는 두 가지를 동시에 학습하는 시스템을 구축했습니다. 사용자 생성 콘텐츠란 프로필 설명(bio)이나 최근 트윗처럼 일반 사람들이 만드는 콘텐츠를 말합니다. 연구진은 사람들이 보통 일관된 온라인 정체성을 가진다는 점에 주목했습니다. 예를 들어, 프로필에 음악에 대해 쓴다면 아마도 음악 관련 기사를 공유할 것입니다. 그들은 가짜 뉴스 기사가 특정한 '유형'의 사람들을 끌어들일지, 그리고 그 사람들이 서로 비슷한 분위기를 풍길지를 궁금해했습니다.

이를 테스트하기 위해, 그들은 컴퓨터를 훈련시키기 위한 세 가지 구체적인 규칙, 즉 '목표(objectives)'를 사용하는 학습 알고리즘을 구축했습니다. 첫째, 컴퓨터는 일반적인 탐정처럼 진짜 이야기와 가짜 이야기를 구별하는 법을 배워야 합니다. 둘째, 이것이 영리한 부분인데, 컴퓨터는 기사의 '분위기'가 그것을 공유한 사람들의 '분위기'와 일치해야 한다는 것을 강제로 학습해야 합니다. 만약 가짜 기사가 공유된다면, 컴퓨터는 그 기사와 공유자들이 숨겨진 수학적 공간 안에서 서로 유사해 보이도록 학습합니다. 셋째, 컴퓨터는 동일한 기사를 공유하는 사람들 또한 서로 비슷해 보여야 한다는 것을 배웁니다. 이는 마치 "만별의 낯선 사람들이 이 이상한 이야기를 공유하기 위해 몰려든다면, 그들은 분명 공통점을 가지고 있을 것이므로 컴퓨터가 그 연결 고리를 보도록 만들자"라고 말하는 것과 같습니다.

연구진은 실제 팩트 체크 웹사이트와 코로나19 관련 뉴스 데이터를 사용하여 이 아이디어를 세 가지 다른 종류의 컴퓨터 두뇌(신경망 분류기)로 테스트했습니다. 그들은 이러한 '사회적 단서'를 훈련 과정에 추가했을 때, 컴퓨터가 가짜 뉴스를 더 잘 잡아낸다는 것을 발견했습니다. 결과는 모델들이 진짜와 가짜 이야기를 더 명확하게 구분하도록 학습했음을 보여주었습니다. 실제로 내부의 수학적 구조를 살펴보았을 때, 사용자 단서를 사용했을 때 컴퓨터의 마음속에서 가짜 이야기와 진짜 이야리가 서로 더 멀리 떨어지게 밀려난 것을 확인했습니다.

하지만 이 논문에는 현실적인 제약 사항들도 있습니다. 연구진은 어떤 사람들을 선택하느냐가 중요한지 확인해 보았습니다. 그들은 처음 공유한 사람들(초기 수용자)이 가장 좋은 단서가 될 것이라고 생각했지만, 놀랍게도 처음 공유한 사람을 뽑든 마지막에 공유한 사람을 뽑든 큰 차이가 없었습니다. 또한, 기사와 사람들을 무작위로 뒤섞어 컴퓨터를 속이려고 시도하기도 했습니다. 연결 고리를 망가뜨렸음에도 불구하고, 컴퓨터는 사용자 단서가 전혀 없을 때보다 여전히 더 나은 성능을 보였습니다. 이는 구체적인 연결이 완벽하지 않더라도 방대한 양의 추가 데이터 자체가 도움이 된다는 것을 시사합니다.

흥หนึ่ง의 발견은 컴퓨터가 사용자의 프로필 설명(bio)을 보았을 때는 정답을 맞혔지만, 트윗을 보았을 때는 틀렸던 특정 사례를 살펴보는 데서 나왔습니다. 트윗은 노이즈가 많고 너무 다양한 주제를 다루는 반면, 프로필 설명은 집중되어 있었습니다. 이는 사용자 데이터가 도움이 될 수는 있지만 매우 지저분할 수 있으며, 향후 작업에서는 노이즈를 걸러내는 과정이 필요할 수 있음을 시사합니다.

궁극적으로 이 논문은 컴퓨터에게 이야기와 관객 사이의 관계를 존중하도록 가르침으로써, 허위 정보를 퇴치하기 위한 더 나은 도구를 구축할 수 있다고 제안합니다. 저자들은 이 방법이 컴퓨터가 실제로 예측을 수행할 때가 아니라 '학습하는 동안'에만 사용자 정보를 사용한다는 점을 명시하며 주의를 기울였습니다. 즉, 컴퓨터가 뉴스를 판단할 때 당신이 누구인지 알 필요는 없으며, 단지 사람과 이야기가 어떻게 연결되는지의 패턴으로부터 학습했을 뿐이라는 의미입니다. 결과는 유망하고 방법론 또한 새롭지만, 저자들은 시간이 흐름에 따라 사용자 프로필은 변하고 가짜 뉴스 제작자들도 사라지기 때문에 데이터가 낡을 수 있다는 점을 인정합니다. 하지만 현재로서는, 거짓을 식별하는 가장 좋은 방법은 때때로 그 이야기를 누가 하고 있는지를 보는 것이라는 점을 일깨워주는 흥미롭고 강력한 사례입니다.

연구 분야의 논문에 파묻히고 계신가요?

연구 키워드에 맞는 최신 논문의 일일 다이제스트를 받아보세요 — 기술 요약 포함, 당신의 언어로.

Digest 사용해 보기 →