BERTopic-Virality Prioritisation: A Scalable Framework for Thematic and Comparative Analysis of COVID-19 and Monkeypox Misinformation on Twitter
本論文は、文脈埋め込みクラスタリングにバイラリティ優先化レイヤーとハイブリッド誤情報検出器を統合することで、異なるパンデミックにおける影響力の高い健康に関する誤情報のナラティブの早期特定および比較分析を可能にするスケーラブルなフレームワークであるBERTopic-VPを紹介するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
新たな疾患が出現すると、世界は二つの同時進行する危機に直面します。一つはウイルスそのものであり、もう一つは、その傍らで拡散する誤情報の氾濫です。この第二の危機は「インフォデミック」と呼ばれることもあり、生物学的な危機と同じくらい危険なものとなり得ます。Twitterのような、メッセージが短く、電光石火の速さで流れるソーシャルメディア・プラットフォームでは、治療法や起源、安全対策に関する虚偽の物語が、公式の健康ガイダンスよりも早く勢力を増すことがあります。これらの物語を追跡するための従来の手法は、特定の単語がどれくらいの頻度で出現するかを数えることに依存しているため、失敗することがよくあります。スラング、ハッシュタグ、絵文字が飛び交う、ソーシャルメディアの混沌とした急速に変化する言語においては、単純な単語のカウントは機能しなくなります。それらは投稿の背後にある深い意味を見落とし、無関係なアイデアを一つにまとめてしまったり、新しい危険な噂が広まりすぎてしまうまで、それを察知できなかったりするのです。
これを解決するために、マンチェスター・メトロポリタン大学の研究者たちは、デジタル上のノイズに耳を傾けるための新しい方法を開発しました。彼らが作り上げたシステムは、単に単語を数えるのではなく、その背後にある意味を理解し、同時にその物語がどれほどの速さで拡散しているかにも注意を払います。彼らの目標は、公衆衛生当局が、たとえ物語が循環し始めたばかりであっても、最も危険な嘘を早期に特定できるツールを構築することでした。言語への深い理解と、投稿がどれだけ共有されているかという指標を組み合わせることで、彼らは、一連のツイートの中から、公衆衛生に対して最大の脅威をもたらす特定のナラティブ(語り口)をふるい分けることができるフレームワークを作り上げました。
研究者たちは、この新しいシステムを「BERTopic-VP」と名付け、新型コロナウイルスによる世界的なパンデミックと、2022年のエムポックス(サル痘)の発生という、二つの主要な健康危機から得られた実際のデータに適用しました。彼らは、関連するツイートを1万件から10万件のグループとして処理し、システムに投入しました。システムは特定のキーワードを探すのではなく、まず、実際の意味に基づいてツイートをクラスター(集団)に分類しました。高度な言語モデルを用いることで、表現が異なっていても、政府への不信感やワクチンへの恐怖といった、同じ核心的なアイデアについて語っている可能性があることを理解させました。物語がグループ化されると、システムは第二の分析レイヤーを追加しました。それは、各物語がどれほどのエンゲージメント(反応)を得たかを確認することでした。各グループ内の投稿が、どれだけの数の「いいね」、シェア、あるいは返信を獲得したかをカウントしたのです。これにより、システムは物語をランク付けし、単に人気があるだけでなく、積極的に拡散しているものを浮き彫りにすることができました。
結果は、これら二つのアウトブレイクにおける誤情報の振る舞いの明確な違いを明らかにしました。コロナウイルスのパンデミックの間、虚偽の物語は非常に多様で複雑でした。それらは、ウイルスの起源に関する陰謀論から、マスクの有効性やロックダウン政策に関する議論まで、幅広いトピックを網羅していました。これらの投稿で使用される言語は、しばしば難解で読み取りにくく、信頼性を高めるために専門家のようなトーンを模倣していました。対照的に、エムポックスの発生に伴う誤情報は、より焦点が絞られていました。虚偽のナラティブは、ワクチンの配布における失敗や、保健当局に対する深い不信感といった、いくつかの特定のテーマに強く集中していました。これらの物語は言語的にシンプルで読みやすく、そして恐怖や怒りといった、より強い感情的な響きを持っていました。
研究は、このシステムがその役割を効果的に果たしたことを示しました。システムは、拡散の可能性が高い誤情報のクラスターを特定し、拡散している上位1パーセントの物語を人間のレビュー用にフラグ立てすることに成功しました。研究者が実際の共有数にアクセスできたエムポックスのデータにおいて、システムは意味的に解釈可能なトピックを生成し、観察されたエンゲージメントに基づいて最も活発なグループを特定しました。共有数が利用できなかったコロナウイルスのデータについては、システムは巧妙な回避策を用いました。つまり、エムポックスのデータから、どのような言語的・心理的特徴が通常高いシェアにつながるかを学習し、その知識を適用して、どのコロナウイルスの物語が広がる可能性が高いかを予測したのです。これにより、システムは直接的な共有数にアクセスできない場合でも、リスクの高いナラティブを優先順位付けすることができました。
決定的なのは、ある物語が拡散する能力は、それが真実であるか否かと必ずしも結びついているわけではないことを、研究者たちが示したことです。システムは、ニュースの更新や公式の健康アドバイスなど、実際に事実に基づいている非常に拡散力の強い投稿のグループを多く発見しました。だからこそ、システムは二段階で作動するように設計されています。第一に、最も速く拡散している物語を見つけ、第二に、それらの物語が真実であるかどうかを判断するための別個のチェックを行います。この組み合わせにより、公衆衛生当局は、あらゆる虚偽の主張を論破しようとしたり、あるいは急速に動いているものがたまたま真実であるために無視したりすることなく、最も勢いのある嘘に焦点を当てることができるのです。
また、本研究は、物語の感情的なトーンがその拡散の強力な原動力であることを強調しました。最も拡散力の高い誤情報は、しばしば簡単に理解できるシンプルな言葉で書かれ、恐怖や怒りといった強い感情と組み合わされていました。これは、消化しやすく、人々に強烈な感情を抱かせる嘘が、最も共有されやすいことを示唆しています。これらのパターンを特定することで、この新しいフレームワークは、公衆衛生チームがデジタル環境を監視するための実践的な方法を提供します。それは、警戒を呼びかける早期警告システムとして機能し、広範囲に被害をもたらす前に、即座に対処が必要な、特定の高リスクなナラティブを浮き彫りにします。この研究は、言葉の意味と、それらがどのように移動するかというメカニズムの両方を理解することで、健康上の緊急事態における誤情報の危険から、より良くコミュニティを守ることができることを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。